代码链接:mindyolo/configs/yolov7 at master · mindspore-lab/mindyolo · GitHub
环境:已使用ascendhub上的mindspore最新的训练镜像
CANN:8.0.RC3
mindspore:2.4.0

复现步骤:
1、单卡按照指导做算力切分后

挂载Vnpu,显存32G,进入容器


2、进入容器,开始训练,设置300个epoch,batchsize为8,第一个训练完成,模型正常生成

3、完整训练了1-3次后,中断训练2-3次,报E39999的AICPU错误

4、/root/ascend/log目录下收集日志以后,报Fail to write file:/home/CustAiCpuUser1/cust_aicpu_32_32_2313779/libcust_cpu_kernels.so, eof=0, bad=1, fail=1, reason=No space left on device. 但是df -h查看磁盘空间足够。与磁盘空间不足无关,且docker默认存储路径已修改,空间也足够!!!希望可以找到mindyolo或者算力切分的同事分析一下,是不是版本问题,还是哪里缓存需要清理

代码链接:mindyolo/configs/yolov7 at master · mindspore-lab/mindyolo · GitHub
环境:已使用ascendhub上的mindspore最新的训练镜像
CANN:8.0.RC3
mindspore:2.4.0
复现步骤:
1、单卡按照指导做算力切分后
挂载Vnpu,显存32G,进入容器
2、进入容器,开始训练,设置300个epoch,batchsize为8,第一个训练完成,模型正常生成
3、完整训练了1-3次后,中断训练2-3次,报E39999的AICPU错误
4、/root/ascend/log目录下收集日志以后,报Fail to write file:/home/CustAiCpuUser1/cust_aicpu_32_32_2313779/libcust_cpu_kernels.so, eof=0, bad=1, fail=1, reason=No space left on device. 但是df -h查看磁盘空间足够。与磁盘空间不足无关,且docker默认存储路径已修改,空间也足够!!!希望可以找到mindyolo或者算力切分的同事分析一下,是不是版本问题,还是哪里缓存需要清理