硬件配置: 2288V5 GOLD 5220R2 +32G5 +1.2T SAS +ATLAS300 3010*4 宿主机: openEuler 22.03 LTS-SP1 容器: Docker version 26.1.3 镜像: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.RC3-300I-Duo-x86_64 swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts 驱动: npu-smi version: 23.0.0 Ascend-hdk-310-npu-driver_23.0.0_linux-x86-64 Ascend-hdk-310-npu-firmware_7.1.0.3.220 故障现象: 宿主机内命令npu-smi info正常显示推理卡信息,状态正常 创建容器如下命令 docker run -it -d --net=host --shm-size=1g
--name=huaweideepseek
--device=/dev/davinci_manager
--device=/dev/devmm_svm
--device=/dev/davinci0
--device=/dev/davinci1
--device=/dev/davinci2
--device=/dev/davinci3
--device=/dev/hisi_hdc
--privileged=true
-v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/sbin/npu-smi:/usr/local/sbin/npu-smi
-v /usr/local/Ascend/driver:/usr/local/Ascend/driver
-v /usr/local/Ascend/driver/lib64:/usr/local/Ascend/driver/lib64
-v /etc/ascend_install.info:/etc/ascend_install.info
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info
-v /root/DeepSeek-R1-Distill-Qwen-32B//root/DeepSeek-R1-Distill-Qwen-32B
-v /root/:/root/
swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.RC3-300I-Duo-x86_64 /bin/bash
进入容器后按说明文档运行下面两行命令 groupadd -g 1001 HwHiAiUser && useradd -g HwHiAiUser -d /home/HwHiAiUser -m HwHiAiUser && echo ok
export LD_LIBRARY_PATH=/usr/local/Ascend/driver/lib64:${LD_LIBRARY_PATH}
然后lspci | grep 100 能显示卡信息,表明已经挂载 但是运行npu-smi -help正常,npu-smi -v较长时间才输出结果,npu-smi info运行很长时间后无输出跳回命令行
跳过此步骤,继续部署,到启动mindie时运行./mindieservice_daemon 提示错误找不到npu设备,然后被KILL掉退回命令行
这种错误是宿主系统跟镜像系统不匹配还是驱动版本太低(驱动24.0的昇腾官网上没看到有对应这个推理卡的),还是说哪里配置不对,已经翻阅了几天官方文档和互联网资料均无法解决。 另外,宿主机更换过centos 7.9,镜像使用过2个,故障现象都一样。
硬件配置: 2288V5 GOLD 5220R2 +32G5 +1.2T SAS +ATLAS300 3010*4 宿主机: openEuler 22.03 LTS-SP1 容器: Docker version 26.1.3 镜像: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.RC3-300I-Duo-x86_64 swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts 驱动: npu-smi version: 23.0.0 Ascend-hdk-310-npu-driver_23.0.0_linux-x86-64 Ascend-hdk-310-npu-firmware_7.1.0.3.220 故障现象: 宿主机内命令npu-smi info正常显示推理卡信息,状态正常 创建容器如下命令 docker run -it -d --net=host --shm-size=1g
--name=huaweideepseek
--device=/dev/davinci_manager
--device=/dev/devmm_svm
--device=/dev/davinci0
--device=/dev/davinci1
--device=/dev/davinci2
--device=/dev/davinci3
--device=/dev/hisi_hdc
--privileged=true
-v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/sbin/npu-smi:/usr/local/sbin/npu-smi
-v /usr/local/Ascend/driver:/usr/local/Ascend/driver
-v /usr/local/Ascend/driver/lib64:/usr/local/Ascend/driver/lib64
-v /etc/ascend_install.info:/etc/ascend_install.info
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info
-v /root/DeepSeek-R1-Distill-Qwen-32B//root/DeepSeek-R1-Distill-Qwen-32B
-v /root/:/root/
swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.RC3-300I-Duo-x86_64 /bin/bash
进入容器后按说明文档运行下面两行命令 groupadd -g 1001 HwHiAiUser && useradd -g HwHiAiUser -d /home/HwHiAiUser -m HwHiAiUser && echo ok
export LD_LIBRARY_PATH=/usr/local/Ascend/driver/lib64:${LD_LIBRARY_PATH}
然后lspci | grep 100 能显示卡信息,表明已经挂载 但是运行npu-smi -help正常,npu-smi -v较长时间才输出结果,npu-smi info运行很长时间后无输出跳回命令行
跳过此步骤,继续部署,到启动mindie时运行./mindieservice_daemon 提示错误找不到npu设备,然后被KILL掉退回命令行
这种错误是宿主系统跟镜像系统不匹配还是驱动版本太低(驱动24.0的昇腾官网上没看到有对应这个推理卡的),还是说哪里配置不对,已经翻阅了几天官方文档和互联网资料均无法解决。 另外,宿主机更换过centos 7.9,镜像使用过2个,故障现象都一样。