MindIE部署DeepSeek-R1模型时加载卡死,报TBE Subprocesses错误
问题描述:
最近在昇腾910B服务器上使用MindIE 2.0.T3部署DeepSeek-R1-70B模型时遇到严重问题。启动服务后,模型加载过程会卡住,最终报错停止。错误信息显示“TBE Subprocesses raise error, main process disappeared!”,导致推理服务完全无法启动。
环境信息:
详细错误日志:
已尝试的解决方案:
-
检查硬件兼容性:确认服务器支持该模型,驱动版本符合要求(≥23.0.7)
-
内存检查:确保主机内存足够,free_mem ≥ (权重大小/机器数) × 1.3
-
环境变量调整:
-
多机配置检查:确认所有节点的服务化配置参数完全一致
-
缓存清理:执行sync; echo 3 > /proc/sys/vm/drop_caches释放缓存
-
重启尝试:重启NPU卡和整个服务器
当前状态:
以上方法均未解决问题,模型加载仍然会在相同位置卡死。从日志看似乎与kernel配置解析失败有关,但不确定具体原因。
求助内容:
-
有没有遇到类似问题的同学?如何解决TBE子进程错误?
-
这个“Parse dynamic kernel config fail”错误通常是什么原因导致的?
-
MindIE 2.0.T3镜像中的kernel是否可能与910B硬件存在兼容性问题?
-
除了上述方法,还有哪些排查思路?
-
是否需要升级到更高版本的MindIE或CANN?
补充信息:
-
单机多卡部署,非分布式场景
-
模型权重已通过官方渠道获取并验证完整性
MindIE部署DeepSeek-R1模型时加载卡死,报TBE Subprocesses错误
问题描述:
最近在昇腾910B服务器上使用MindIE 2.0.T3部署DeepSeek-R1-70B模型时遇到严重问题。启动服务后,模型加载过程会卡住,最终报错停止。错误信息显示“TBE Subprocesses raise error, main process disappeared!”,导致推理服务完全无法启动。
环境信息:
硬件:昇腾910B服务器(8卡配置)
操作系统:openEuler 24.03 LTS
MindIE版本:2.0.T3
CANN版本:8.0.0
驱动版本:24.1.rc2
模型:DeepSeek-R1-Distill-Llama-70B
详细错误日志:
已尝试的解决方案:
检查硬件兼容性:确认服务器支持该模型,驱动版本符合要求(≥23.0.7)
内存检查:确保主机内存足够,free_mem ≥ (权重大小/机器数) × 1.3
环境变量调整:
多机配置检查:确认所有节点的服务化配置参数完全一致
缓存清理:执行
sync; echo 3 > /proc/sys/vm/drop_caches释放缓存重启尝试:重启NPU卡和整个服务器
当前状态:
以上方法均未解决问题,模型加载仍然会在相同位置卡死。从日志看似乎与kernel配置解析失败有关,但不确定具体原因。
求助内容:
有没有遇到类似问题的同学?如何解决TBE子进程错误?
这个“Parse dynamic kernel config fail”错误通常是什么原因导致的?
MindIE 2.0.T3镜像中的kernel是否可能与910B硬件存在兼容性问题?
除了上述方法,还有哪些排查思路?
是否需要升级到更高版本的MindIE或CANN?
补充信息:
单机多卡部署,非分布式场景
模型权重已通过官方渠道获取并验证完整性