环境:
华为云,8*ascend910*8结点,python3.9,mindspore1.9
bash启动脚本:

在训练作业用mpirun启动分布式训练(8节点)后出现报错,似乎是结点间初始化失败

官网的文档中提出2个方法:
1.配置ranktable,但是通过cat /etc/hccn.conf 获取ranktable失败,因为结点上不存在这个文件,卡在获取device_id上



2.mpirun
关于hostfile不是很理解,此外,在蓝色的“GPU配置分布式环境链接”中提到的device IP具体应该写什么也不清楚

环境:
华为云,8*ascend910*8结点,python3.9,mindspore1.9
bash启动脚本:
在训练作业用mpirun启动分布式训练(8节点)后出现报错,似乎是结点间初始化失败
官网的文档中提出2个方法:
1.配置ranktable,但是通过cat /etc/hccn.conf 获取ranktable失败,因为结点上不存在这个文件,卡在获取device_id上
2.mpirun
关于hostfile不是很理解,此外,在蓝色的“GPU配置分布式环境链接”中提到的device IP具体应该写什么也不清楚