昇腾910上单张Vnpu跑MindYolo训练完成以后,再次训练报错 E39999: Inner Error!
收藏回复举报
昇腾910上单张Vnpu跑MindYolo训练完成以后,再次训练报错 E39999: Inner Error!
t('forum.solved') 已解决
发表于2024-12-25 21:55:16
0 查看

代码链接:mindyolo/configs/yolov7 at master · mindspore-lab/mindyolo · GitHub

环境:已使用ascendhub上的mindspore最新的训练镜像

CANN:8.0.RC3

mindspore:2.4.0

cke_1136.png

复现步骤:

1、单卡按照指导做算力切分后

cke_16777.png

挂载Vnpu,显存32G,进入容器

cke_183868.png

2、进入容器,开始训练,设置300个epoch,batchsize为8,第一个训练完成,模型正常生成

cke_49611.png

3、完整训练了1-3次后,中断训练2-3次​,报E39999的AICPU错误

cke_68520.png

4、/root/ascend/log目录下收集日志以后,报Fail to write file:/home/CustAiCpuUser1/cust_aicpu_32_32_2313779/libcust_cpu_kernels.so, eof=0, bad=1, fail=1, reason=No space left on device. 但是df -h查看磁盘空间足够。与磁盘空间不足无关,且docker默认存储路径已修改,空间也足够!!!希望可以找到mindyolo或者算力切分的同事分析一下,是不是版本问题,还是哪里缓存需要清理

cke_89185.png

本帖最后由 匿名用户2024/12/26 08:42:48 编辑

我要发帖子