多结点分布式训练启动失败;无法获取device_ip/rank_table;对于多节点分布式文档的问题
收藏回复举报
多结点分布式训练启动失败;无法获取device_ip/rank_table;对于多节点分布式文档的问题
t('forum.solved') 已解决
新人帖
发表于2023-03-21 21:29:16
0 查看

环境:

华为云,8*ascend910*8结点,python3.9,mindspore1.9

bash启动脚本:

cke_43701.png

在训练作业用mpirun启动分布式训练(8节点)后出现报错,似乎是结点间初始化失败

cke_9956.png

官网的文档中提出2个方法:

1.配置ranktable,但是通过cat /etc/hccn.conf 获取ranktable失败,因为结点上不存在这个文件,卡在获取device_id上

cke_15694.png

cke_19074.png

cke_21229.png

2.mpirun

关于hostfile不是很理解,此外,在蓝色的“GPU配置分布式环境链接”中提到的device IP具体应该写什么也不清楚

cke_22874.png

我要发帖子