华为昇腾MindIE部署Qwen2.5-72B模型启动卡住,日志中断在HCCL初始化阶段求助
在华为Atlas 800I A2服务器上使用MindIE 2.1.RC3部署Qwen2.5-72B-Instruct模型时,服务启动过程在HCCL通信初始化阶段卡住,无报错信息但长时间无进展,NPU显存占用35%后停滞。
环境信息
硬件环境:
-
服务器型号:Atlas 800I A2推理服务器
-
CPU:2*鲲鹏920处理器,128核
-
内存:512GB DDR4
-
NPU配置:4*昇腾910B(32G)推理卡
软件环境:
模型信息:
问题详细现象
服务启动命令执行后,日志输出在以下位置卡住:
停滞特征分析:
-
NPU监控显示4张卡显存占用均达到35%左右后不再变化
-
无CPU异常飙升(维持在15%-20%)
-
无错误日志输出,日志级别已设置为DEBUG
-
进程未退出,保持僵尸状态
-
网络端口未监听(检测7025端口无响应)
操作步骤回顾
1. 基础环境准备
2. 容器启动配置
3. 关键配置文件(/usr/local/Ascend/mindie/latest/mindie-service/conf/config.json)
已尝试的排查方法
1. 基础环境验证
华为昇腾MindIE部署Qwen2.5-72B模型启动卡住,日志中断在HCCL初始化阶段求助
在华为Atlas 800I A2服务器上使用MindIE 2.1.RC3部署Qwen2.5-72B-Instruct模型时,服务启动过程在HCCL通信初始化阶段卡住,无报错信息但长时间无进展,NPU显存占用35%后停滞。
环境信息
硬件环境:
服务器型号:Atlas 800I A2推理服务器
CPU:2*鲲鹏920处理器,128核
内存:512GB DDR4
NPU配置:4*昇腾910B(32G)推理卡
软件环境:
操作系统:OpenEuler 24.03 LTS
MindIE版本:2.1.RC3-800I-A2-py311-openeuler24.03-lts
CANN版本:2.1.RC2
Docker版本:25.0.3
容器运行时:runc
模型信息:
模型名称:Qwen2.5-72B-Instruct-2507
下载源:ModelScope官方仓库
权重格式:safetensors(16分片)
文件完整性:已校验SHA256
问题详细现象
服务启动命令执行后,日志输出在以下位置卡住:
停滞特征分析:
NPU监控显示4张卡显存占用均达到35%左右后不再变化
无CPU异常飙升(维持在15%-20%)
无错误日志输出,日志级别已设置为DEBUG
进程未退出,保持僵尸状态
网络端口未监听(检测7025端口无响应)
操作步骤回顾
1. 基础环境准备
2. 容器启动配置
docker run -it -d --net=host --shm-size=4g \ --name qwen25-72b \ --device=/dev/davinci_manager \ --device=/dev/hisi_hdc \ --device=/dev/devmm_svm \ --device=/dev/davinci0 --device=/dev/davinci1 \ --device=/dev/davinci2 --device=/dev/davinci3 \ -e ASCEND_VISIBLE_DEVICES=0,1,2,3 \ -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro \ -v /data/models/Qwen2.5-72B-Instruct:/models:rw \ swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC3-800I-A2-py311-openeuler24.03-lts3. 关键配置文件(/usr/local/Ascend/mindie/latest/mindie-service/conf/config.json)
{ "ServerConfig": { "ipAddress": "0.0.0.0", "port": 7025, "managementPort": 7026, "allowAllZeroIpListening": true, "httpsEnabled": false, "interCommTLSEnabled": false }, "BackendConfig": { "npuDeviceIds": [[0,1,2,3]], "modelInstanceNumber": 1, "ModelDeployConfig": { "maxSeqLen": 8192, "maxInputTokenLen": 6144, "ModelConfig": [{ "modelInstanceType": "Standard", "modelName": "qwen2.5", "modelWeightPath": "/models", "worldSize": 4, "cpuMemSize": 16, "npuMemSize": -1, "backendType": "atb", "trustRemoteCode": true, "useCustomKernels": true }] } } }已尝试的排查方法
1. 基础环境验证
[x] NPU设备识别:
npu-smi info显示4张卡状态正常[x] 基础计算测试:
torch.randn(3,4).npu()执行成功