
环境:CANN 8.2 RC1+torch_npu 7.2+torch 2.8,Ubuntu20.04
代码:Ultralytics库,使用transfer_to_npu工具一键迁移,然后手动加入了NPUFusedAdamW优化器和昇腾图优化
运行配置:910B2,单卡,
问题:使用编译后单步迭代耗时466ms,但是前向传播(图中torch compiled部分)27ms,反向传播约50ms,亲和优化器更新约2.9ms,其他时间不知道花在了哪里。此时NPU功耗180w/450w,核心占用率统计约占用30%。
请问如何进行优化以提高训练利用率?
环境:CANN 8.2 RC1+torch_npu 7.2+torch 2.8,Ubuntu20.04
代码:Ultralytics库,使用transfer_to_npu工具一键迁移,然后手动加入了NPUFusedAdamW优化器和昇腾图优化
运行配置:910B2,单卡,
问题:使用编译后单步迭代耗时466ms,但是前向传播(图中torch compiled部分)27ms,反向传播约50ms,亲和优化器更新约2.9ms,其他时间不知道花在了哪里。此时NPU功耗180w/450w,核心占用率统计约占用30%。
请问如何进行优化以提高训练利用率?