【多卡训练跑不满显存】多卡训练跑满显存会出现[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
收藏回复举报
【多卡训练跑不满显存】多卡训练跑满显存会出现[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
t('forum.solved') 已解决
新人帖
发表于2025-03-20 16:04:53
0 查看

我也来反馈一下,为该问题补充详细描述吧,希望国产显卡能够做得更好!

设备:910B2x鲲鹏920(64GB) 

环境:npu-smi 23.0.3 、PyTorch  2.1.0、Python  3.10(ubuntu22.04)、CANN  8.0.0

报错截图

细节描述:使用DDP在单卡上能够跑满显存,但是在使用多卡时,会报错,以下是详细试验记录:

单卡,batchsize=268,显存占用65233M,能够跑起来;

4卡,batchsize=38,显存占用15179M,能够跑起来;

4卡,batchsize=164,显存占用42463M,能够跑起来;

4卡,batchsize=268,显存未知,报错;

7卡,batchsize=1,显存占用7205M,能够跑起来;

7卡,batchsize=38,显存占用15065M,能够跑起来;

7卡,batchsize=76,显存占用23340M,能够跑起来;

7卡,batchsize=152,显存未知,报错;

以上信息中batchsize和显存均为每张显卡的记录

我要发帖子