NPU的通信效率问题
收藏回复举报
NPU的通信效率问题
t('forum.solved') 已解决
发表于2025-12-19 10:23:59
0 查看
在昇腾NPU上用ZeRO-3并行策略训练LLaMA-13B模型时,已按适配指南调整通信桶大小、开启计算-通信重叠,但仍出现梯度聚合耗时过长(占单步训练耗时60%)、训练吞吐量偏低的问题,且NPU算力利用率长期维持在50%以下。请问需从哪些维度优化ZeRO-3的通信效率?是否有针对昇腾NPU的ZeRO-3专属调优参数或硬件加速策略?

本帖最后由 匿名用户2025/12/19 10:39:08 编辑

我要发帖子