搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。
收藏回复举报
搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。
t('forum.solved') 已解决
发表于2026-04-06 23:48:04
0 查看

我在使用华为昇腾AI处理器(Ascend 910)搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。

我正在尝试在单台8卡昇腾910服务器上微调Qwen-14B模型。环境配置完成后,启动训练脚本大约运行30分钟后,程序会突然崩溃,报错信息显示为“INFNAN模式溢出”和“TBE compile failed for custom operator”双重错误。

环境信息:

  • 硬件:华为Atlas 800训练服务器(8×Ascend 910)

  • 操作系统:EulerOS 2.0 SP8

  • 驱动版本:23.0.rc1

  • CANN工具包:7.0.0

  • MindSpore版本:2.2.0(昇腾专用版)

  • Python版本:3.7.5

  • 模型:Qwen-14B(从Hugging Face转换而来)

详细错误日志:

已尝试的解决方案:

  1. 检查了CANN环境变量配置,确认ASCEND_OPP_PATH指向正确路径

  2. 清理了编译缓存:rm -rf ~/ascend_cache/*

  3. 尝试降低batch_size从16降到8,问题依旧

  4. 开启了内存复用:export MS_ENABLE_MEM_REUSE=1

  5. 验证了驱动状态:npu-smi info显示所有卡状态正常

  6. 单独测试了基础矩阵运算,可以正常运行

问题特点:

  • 错误发生在训练中期(约1250次迭代后),不是一开始就报错

我要发帖子