华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
求助
试用mindnlp 加载 qwen 模型, 但不知道是哪个配置不对, 运行非常慢、只在CPU上运行,特此求助,谢谢!
环境如下: 镜像:mindspore_2.4.10-cann_8.0.0-py_3.10-euler_2.10.11-aarch64-snt9b
版本:
accelerate 1.12.0 mindnlp 0.4.1 mindspore 2.4.10 mindspore_lite 2.4.10 modelarts-mindspore-model-server 1.0.6 tokenizers 0.19.1 transformers 4.40.0
代码非常简单
# 华为云 环境变量设置 import env import mindspore import mindspore as ms import mindnlp from transformers import pipeline import os # # 指定 Ascend NPU ms.set_context(device_target="Ascend", mode=ms.GRAPH_MODE, device_id=0) pipe = pipeline( "text-generation", model="Qwen/Qwen1.5-1.8B", # ms_dtype=mindspore.bfloat16, # 大模型给的写法,但版本对应不上 # mirror='modelscope', device_map="auto" ) messages = [{"role": "user", "content": "那么打个招呼吧,你好, 介绍一下成龙。"}] import time start = time.time() print(pipe(messages, max_new_tokens=100)[0]["generated_text"][-1]["content"]) print(time.time() - start)
但就是加载不到npu上,只使用cpu(npu-smi info 显示显存占用无变化), 而相同的代码 香橙派 AI pro 20T 反而运行npu上, 虽然也很慢, 两边都花了200多秒。
特此求助,谢谢!
我要发帖子
求助
试用mindnlp 加载 qwen 模型, 但不知道是哪个配置不对, 运行非常慢、只在CPU上运行,特此求助,谢谢!
环境如下: 镜像:mindspore_2.4.10-cann_8.0.0-py_3.10-euler_2.10.11-aarch64-snt9b
版本:
代码非常简单
# 华为云 环境变量设置 import env import mindspore import mindspore as ms import mindnlp from transformers import pipeline import os # # 指定 Ascend NPU ms.set_context(device_target="Ascend", mode=ms.GRAPH_MODE, device_id=0) pipe = pipeline( "text-generation", model="Qwen/Qwen1.5-1.8B", # ms_dtype=mindspore.bfloat16, # 大模型给的写法,但版本对应不上 # mirror='modelscope', device_map="auto" ) messages = [{"role": "user", "content": "那么打个招呼吧,你好, 介绍一下成龙。"}] import time start = time.time() print(pipe(messages, max_new_tokens=100)[0]["generated_text"][-1]["content"]) print(time.time() - start)但就是加载不到npu上,只使用cpu(npu-smi info 显示显存占用无变化), 而相同的代码 香橙派 AI pro 20T 反而运行npu上, 虽然也很慢, 两边都花了200多秒。
特此求助,谢谢!