系统环境
- CANN版本:8.0.RC3.alpha001
- kernel包版本:7.3.T10.0.B528
- torch版本:2.4.0
- torch_npu版本:2.4.0
具体表现
训练代码在4张3090上验证过,没有问题,使用torch_ddp引擎,100个batch大约需要1分钟。
完全相同的配置,在NPU上进行训练,使用4卡,1个batch就需要2分钟以上。

上图是4卡3090训练的日志,100个batch时间差约1分钟。

上图是4卡NPU训练的日志,1个batch时间差约2分钟。
ascend/log/debug/plog下并没有生成报错日志,ascend/log/run/plog下的日志也未观察到异常。
Profiling
参考这个链接进行了性能分析https://www.hiascend.com/document/detail/zh/Pytorch/60RC3/ptmoddevg/trainingmigrguide/performance_tuning_0015.html

计算时间差可以接受,通信时间不正常。
观察了某张卡的trace,allReduce操作花了38秒多

系统环境
具体表现
训练代码在4张3090上验证过,没有问题,使用torch_ddp引擎,100个batch大约需要1分钟。
完全相同的配置,在NPU上进行训练,使用4卡,1个batch就需要2分钟以上。
上图是4卡3090训练的日志,100个batch时间差约1分钟。
上图是4卡NPU训练的日志,1个batch时间差约2分钟。
ascend/log/debug/plog下并没有生成报错日志,ascend/log/run/plog下的日志也未观察到异常。
Profiling
参考这个链接进行了性能分析https://www.hiascend.com/document/detail/zh/Pytorch/60RC3/ptmoddevg/trainingmigrguide/performance_tuning_0015.html
计算时间差可以接受,通信时间不正常。
观察了某张卡的trace,allReduce操作花了38秒多