torch_npu单机多卡训练性能不正常
收藏回复举报
torch_npu单机多卡训练性能不正常
t('forum.solved') 已解决
发表于2024-12-28 16:22:02
0 查看

系统环境

  • CANN版本:8.0.RC3.alpha001
  • kernel包版本:7.3.T10.0.B528
  • torch版本:2.4.0
  • torch_npu版本:2.4.0

具体表现

训练代码在4张3090上验证过,没有问题,使用torch_ddp引擎,100个batch大约需要1分钟。

完全相同的配置,在NPU上进行训练,使用4卡,1个batch就需要2分钟以上。

上图是4卡3090训练的日志,100个batch时间差约1分钟。

上图是4卡NPU训练的日志,1个batch时间差约2分钟。

ascend/log/debug/plog下并没有生成报错日志,ascend/log/run/plog下的日志也未观察到异常。

Profiling

参考这个链接进行了性能分析https://www.hiascend.com/document/detail/zh/Pytorch/60RC3/ptmoddevg/trainingmigrguide/performance_tuning_0015.html

cke_5368.png

计算时间差可以接受,通信时间不正常。

观察了某张卡的trace,allReduce操作花了38秒多

本帖最后由 匿名用户2024/12/28 16:32:00 编辑

我要发帖子