【求助】华为ModelArts里,ModelMindSpore+MindNLP调qwen模型,但只在cpu上运行
收藏回复举报
【求助】华为ModelArts里,ModelMindSpore+MindNLP调qwen模型,但只在cpu上运行
t('forum.solved') 已解决
发表于2026-01-31 10:10:16
0 查看

求助

试用mindnlp 加载 qwen 模型, 但不知道是哪个配置不对, 运行非常慢、只在CPU上运行,特此求助,谢谢!

环境如下: 镜像:mindspore_2.4.10-cann_8.0.0-py_3.10-euler_2.10.11-aarch64-snt9b

版本:

accelerate                               1.12.0
mindnlp                                  0.4.1
mindspore                                2.4.10
mindspore_lite                           2.4.10
modelarts-mindspore-model-server         1.0.6
tokenizers                               0.19.1
transformers                             4.40.0

代码非常简单

# 华为云 环境变量设置
import env


import mindspore
import mindspore as ms
import mindnlp
from transformers import pipeline
import os
# 
# 指定 Ascend NPU
ms.set_context(device_target="Ascend", mode=ms.GRAPH_MODE, device_id=0)

pipe = pipeline(
    "text-generation",
    model="Qwen/Qwen1.5-1.8B",
    # ms_dtype=mindspore.bfloat16,   # 大模型给的写法,但版本对应不上
    # mirror='modelscope',
    device_map="auto"
)

messages = [{"role": "user", "content": "那么打个招呼吧,你好, 介绍一下成龙。"}]
import time
start = time.time()
print(pipe(messages, max_new_tokens=100)[0]["generated_text"][-1]["content"])
print(time.time()  - start)

但就是加载不到npu上,只使用cpu(npu-smi info 显示显存占用无变化), 而相同的代码 香橙派 AI pro 20T 反而运行npu上, 虽然也很慢, 两边都花了200多秒。

特此求助,谢谢!

我要发帖子