我在使用华为昇腾AI处理器(Ascend 910)搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。
我正在尝试在单台8卡昇腾910服务器上微调Qwen-14B模型。环境配置完成后,启动训练脚本大约运行30分钟后,程序会突然崩溃,报错信息显示为“INFNAN模式溢出”和“TBE compile failed for custom operator”双重错误。
环境信息:
详细错误日志:
已尝试的解决方案:
-
检查了CANN环境变量配置,确认ASCEND_OPP_PATH指向正确路径
-
清理了编译缓存:rm -rf ~/ascend_cache/*
-
尝试降低batch_size从16降到8,问题依旧
-
开启了内存复用:export MS_ENABLE_MEM_REUSE=1
-
验证了驱动状态:npu-smi info显示所有卡状态正常
-
单独测试了基础矩阵运算,可以正常运行
问题特点:
我在使用华为昇腾AI处理器(Ascend 910)搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。
我正在尝试在单台8卡昇腾910服务器上微调Qwen-14B模型。环境配置完成后,启动训练脚本大约运行30分钟后,程序会突然崩溃,报错信息显示为“INFNAN模式溢出”和“TBE compile failed for custom operator”双重错误。
环境信息:
硬件:华为Atlas 800训练服务器(8×Ascend 910)
操作系统:EulerOS 2.0 SP8
驱动版本:23.0.rc1
CANN工具包:7.0.0
MindSpore版本:2.2.0(昇腾专用版)
Python版本:3.7.5
模型:Qwen-14B(从Hugging Face转换而来)
详细错误日志:
已尝试的解决方案:
检查了CANN环境变量配置,确认
ASCEND_OPP_PATH指向正确路径清理了编译缓存:
rm -rf ~/ascend_cache/*尝试降低batch_size从16降到8,问题依旧
开启了内存复用:
export MS_ENABLE_MEM_REUSE=1验证了驱动状态:
npu-smi info显示所有卡状态正常单独测试了基础矩阵运算,可以正常运行
问题特点:
错误发生在训练中期(约1250次迭代后),不是一开始就报错