MindCluster大规模分布式训练
收藏回复举报
MindCluster大规模分布式训练
发表于2025-11-09 21:20:04
0 查看
在使用MindCluster进行大规模分布式训练时,如果遇到性能瓶颈,即随着计算节点(如Ascend/GPU卡)数量的增加,训练速度并没有线性提升甚至下降,可能有哪些主要原因?应该如何进行系统地排查和优化?

我要发帖子