环境概述:
硬件平台:中科可控 x7840h0 海光 7470CPU x86_64
操作系统是:openeuler 22.03 lts
目前需求:安装 qwen3 系列大模型,并可以正常调用 npu 算力资源。
已安装了华为 atlas 300i duo 驱动和固件,安装了 cann 开发套件,文件如下:
Ascend-hdk-310p-npu-driver_25.2.0_linux-x86-64.run
Ascend-hdk-310p-npu-firmware_7.7.0.6.236.run
Ascend-cann-toolkit_8.2.RC1_linux-x86_64.run
Ascend-cann-kernels-310p_8.2.RC1_linux-x86_64.run
测试情况与问题现象
下载MindIE 镜像:
docker pull --platform=amd64 swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-300I-Duo-py311-openeuler24.03-lts
参考一下文档进行了配置。
调整了torch-dtype: bf16 => f16
关闭了 https
按照文档进行:对话测试,服务化推理启动,均存在问题,现象如下:
1. npu-smi info 有进程加载到两个device id 设备上。显存占用仅100M 左右无变化。
2. 对话测试,服务化推理,均不报错但程序卡住没反应,推测为模型加载时卡住,且长时间无响应。无端口监听。
另外通过宿主机 pytorch + torch-npu 现象相同。
通过 export IMAGE=quay.io/ascend/vllm-ascend:main-310p docker 镜像 vllm 启动服务,现象也是无响应不报错。
请教可能得问题??是不适配海光cpu ? 显卡问题? 接口问题? 供电问题? 驱动问题?

环境概述:
硬件平台:中科可控 x7840h0 海光 7470CPU x86_64
操作系统是:openeuler 22.03 lts
目前需求:安装 qwen3 系列大模型,并可以正常调用 npu 算力资源。
已安装了华为 atlas 300i duo 驱动和固件,安装了 cann 开发套件,文件如下:
Ascend-hdk-310p-npu-driver_25.2.0_linux-x86-64.run
Ascend-hdk-310p-npu-firmware_7.7.0.6.236.run
Ascend-cann-toolkit_8.2.RC1_linux-x86_64.run
Ascend-cann-kernels-310p_8.2.RC1_linux-x86_64.run
测试情况与问题现象
下载MindIE 镜像:
docker pull --platform=amd64 swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-300I-Duo-py311-openeuler24.03-lts
参考一下文档进行了配置。
调整了torch-dtype: bf16 => f16
关闭了 https
按照文档进行:对话测试,服务化推理启动,均存在问题,现象如下:
1. npu-smi info 有进程加载到两个device id 设备上。显存占用仅100M 左右无变化。
2. 对话测试,服务化推理,均不报错但程序卡住没反应,推测为模型加载时卡住,且长时间无响应。无端口监听。
另外通过宿主机 pytorch + torch-npu 现象相同。
通过 export IMAGE=quay.io/ascend/vllm-ascend:main-310p docker 镜像 vllm 启动服务,现象也是无响应不报错。
请教可能得问题??是不适配海光cpu ? 显卡问题? 接口问题? 供电问题? 驱动问题?