最近在昇腾910B服务器上使用MindIE 2.0.T3部署DeepSeek-R1-70B模型时遇到严重问题。启动服务后,模型加载过程会卡住,最终报错停止。错误信息显示“TBE Subprocesses raise error, main
收藏回复举报
最近在昇腾910B服务器上使用MindIE 2.0.T3部署DeepSeek-R1-70B模型时遇到严重问题。启动服务后,模型加载过程会卡住,最终报错停止。错误信息显示“TBE Subprocesses raise error, main
t('forum.solved') 已解决
发表于2026-04-07 22:31:30
0 查看

MindIE部署DeepSeek-R1模型时加载卡死,报TBE Subprocesses错误

问题描述:

最近在昇腾910B服务器上使用MindIE 2.0.T3部署DeepSeek-R1-70B模型时遇到严重问题。启动服务后,模型加载过程会卡住,最终报错停止。错误信息显示“TBE Subprocesses raise error, main process disappeared!”,导致推理服务完全无法启动。

环境信息:

  • 硬件:昇腾910B服务器(8卡配置)

  • 操作系统:openEuler 24.03 LTS

  • MindIE版本:2.0.T3

  • CANN版本:8.0.0

  • 驱动版本:24.1.rc2

  • 模型:DeepSeek-R1-Distill-Llama-70B

详细错误日志:

[ERROR] 2025-04-07 10:23:45.310 - TBE Subprocesses raise error, main process disappeared!
File "/usr/local/Ascend/atb-models/atb_llm/utils/data/weight_wrapper.py", line 49, in __init__
self.placeholder = torch.zeros(1, dtype=torch.float16, device="npu")
RuntimeError: call aclnnInplaceZero failed, detail: EZ9999: Inner Error!
Parse dynamic kernel config fail. AclOpKernelInit failed opType ZerosLike

已尝试的解决方案:

  1. 检查硬件兼容性:确认服务器支持该模型,驱动版本符合要求(≥23.0.7)

  2. 内存检查:确保主机内存足够,free_mem ≥ (权重大小/机器数) × 1.3

  3. 环境变量调整

    export HCCL_DETERMINISTIC=false
    export HCCL_OP_EXPANSION_MODE="AIV"
    export NPU_MEMORY_FRACTION=0.96
    export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
  4. 多机配置检查:确认所有节点的服务化配置参数完全一致

  5. 缓存清理:执行sync; echo 3 > /proc/sys/vm/drop_caches释放缓存

  6. 重启尝试:重启NPU卡和整个服务器

当前状态:

以上方法均未解决问题,模型加载仍然会在相同位置卡死。从日志看似乎与kernel配置解析失败有关,但不确定具体原因。

求助内容:

  1. 有没有遇到类似问题的同学?如何解决TBE子进程错误?

  2. 这个“Parse dynamic kernel config fail”错误通常是什么原因导致的?

  3. MindIE 2.0.T3镜像中的kernel是否可能与910B硬件存在兼容性问题?

  4. 除了上述方法,还有哪些排查思路?

  5. 是否需要升级到更高版本的MindIE或CANN?

补充信息:

  • 单机多卡部署,非分布式场景

  • 模型权重已通过官方渠道获取并验证完整性

我要发帖子