在华为Atlas 800I A2服务器上使用MindIE 2.1.RC3部署Qwen2.5-72B-Instruct模型时,服务启动过程在HCCL通信初始化阶段卡住,无报错信息但长时间无进展,NPU显存占用35%后停滞。
收藏回复举报
在华为Atlas 800I A2服务器上使用MindIE 2.1.RC3部署Qwen2.5-72B-Instruct模型时,服务启动过程在HCCL通信初始化阶段卡住,无报错信息但长时间无进展,NPU显存占用35%后停滞。
t('forum.solved') 已解决
发表于2026-01-29 23:50:28
0 查看

华为昇腾MindIE部署Qwen2.5-72B模型启动卡住,日志中断在HCCL初始化阶段求助

在华为Atlas 800I A2服务器上使用MindIE 2.1.RC3部署Qwen2.5-72B-Instruct模型时,服务启动过程在HCCL通信初始化阶段卡住,无报错信息但长时间无进展,NPU显存占用35%后停滞。

环境信息

硬件环境:

  • 服务器型号:Atlas 800I A2推理服务器

  • CPU:2*鲲鹏920处理器,128核

  • 内存:512GB DDR4

  • NPU配置:4*昇腾910B(32G)推理卡

软件环境:

  • 操作系统:OpenEuler 24.03 LTS

  • MindIE版本:2.1.RC3-800I-A2-py311-openeuler24.03-lts

  • CANN版本:2.1.RC2

  • Docker版本:25.0.3

  • 容器运行时:runc

模型信息:

  • 模型名称:Qwen2.5-72B-Instruct-2507

  • 下载源:ModelScope官方仓库

  • 权重格式:safetensors(16分片)

  • 文件完整性:已校验SHA256

问题详细现象

服务启动命令执行后,日志输出在以下位置卡住:

[2026-01-29 10:15:23.456+08:00] [12345] [12346] [server] [INFO] [share_memory.cpp:168] : [ShareMemory::SharedMemorySizeCheck] shared memory size check success.
[2026-01-29 10:15:23.568+08:00] [12347] [12347] [server] [DEBUG] [main.cpp:286] : [Connector] process 12347 belong to process group: 12345
[2026-01-29 10:15:23.569+08:00] [12347] [12347] [server] [DEBUG] [slave_IPC_communicator.cpp:747] : [SetupMsgChannels]slave communicator lanuch threads success.
[2026-01-29 10:15:24.336+08:00] [12347] [12351] [server] [DEBUG] [slave_IPC_communicator.cpp:378] : [=========== Backend rank 0, start processing the broadcast message =============]
[2026-01-29 10:15:24.337+08:00] [12347] [12351] [server] [DEBUG] [slave_IPC_communicator.cpp:399] : [=========== Backend rank 0 is Single Node Infer =============]

停滞特征分析:

  1. NPU监控显示4张卡显存占用均达到35%左右后不再变化

  2. 无CPU异常飙升(维持在15%-20%)

  3. 无错误日志输出,日志级别已设置为DEBUG

  4. 进程未退出,保持僵尸状态

  5. 网络端口未监听(检测7025端口无响应)

操作步骤回顾

1. 基础环境准备

# 安装CANN 2.1.RC2
sudo yum install ascend-devel-2.1.rc2 -y

# 拉取MindIE官方镜像
docker pull swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC3-800I-A2-py311-openeuler24.03-lts

2. 容器启动配置

docker run -it -d --net=host --shm-size=4g \
    --name qwen25-72b \
    --device=/dev/davinci_manager \
    --device=/dev/hisi_hdc \
    --device=/dev/devmm_svm \
    --device=/dev/davinci0 --device=/dev/davinci1 \
    --device=/dev/davinci2 --device=/dev/davinci3 \
    -e ASCEND_VISIBLE_DEVICES=0,1,2,3 \
    -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro \
    -v /data/models/Qwen2.5-72B-Instruct:/models:rw \
    swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC3-800I-A2-py311-openeuler24.03-lts

3. 关键配置文件(/usr/local/Ascend/mindie/latest/mindie-service/conf/config.json)

{
  "ServerConfig": {
    "ipAddress": "0.0.0.0",
    "port": 7025,
    "managementPort": 7026,
    "allowAllZeroIpListening": true,
    "httpsEnabled": false,
    "interCommTLSEnabled": false
  },
  "BackendConfig": {
    "npuDeviceIds": [[0,1,2,3]],
    "modelInstanceNumber": 1,
    "ModelDeployConfig": {
      "maxSeqLen": 8192,
      "maxInputTokenLen": 6144,
      "ModelConfig": [{
        "modelInstanceType": "Standard",
        "modelName": "qwen2.5",
        "modelWeightPath": "/models",
        "worldSize": 4,
        "cpuMemSize": 16,
        "npuMemSize": -1,
        "backendType": "atb",
        "trustRemoteCode": true,
        "useCustomKernels": true
      }]
    }
  }
}

已尝试的排查方法

1. 基础环境验证

  • [x] NPU设备识别:npu-smi info显示4张卡状态正常

  • [x] 基础计算测试:torch.randn(3,4).npu()执行成功

我要发帖子