用Atlas 800M9000集群,进行mindspore分布式训练的时候,发现那个,集群的参数网络层没有配置好,然后我们是照着那个集群交付一本通文档配置的参数网络。照着文档配置好以后使用hccn_tool测试各个npu设备之间的连通性,相同id的npu之间,可以通信,不同id-npu的有的能通信,有的不能通信。我们设置的是每种id的npu对应一个网段。
参考的是那个集群交付一本通文档:https://support.huawei.com/enterprise/zh/doc/EDOC1100318566/6211f0c1
参考配置的参数面网络的文档:https://support.huawei.com/enterprise/zh/doc/EDOC1100302398/549e2956
ip规划如下所示:

交换机配置

测试结果:

尝试配置了各种ip_route 0.0.0.0/0 10.0.0.0/8 10.1x.0.0/16 via 各自网关。都不能实现全部npu之间连通。
交换机配置的有没有问题,交换机应该怎么配置?还有主机配置的是不是有问题?还是说安装驱动啥的有问题?
有没有什么方法可以排查,网络联通不了的原因,还是只能一种一种的尝试?求大佬指点。感谢
用Atlas 800M9000集群,进行mindspore分布式训练的时候,发现那个,集群的参数网络层没有配置好,然后我们是照着那个集群交付一本通文档配置的参数网络。照着文档配置好以后使用hccn_tool测试各个npu设备之间的连通性,相同id的npu之间,可以通信,不同id-npu的有的能通信,有的不能通信。我们设置的是每种id的npu对应一个网段。
参考的是那个集群交付一本通文档:https://support.huawei.com/enterprise/zh/doc/EDOC1100318566/6211f0c1
参考配置的参数面网络的文档:https://support.huawei.com/enterprise/zh/doc/EDOC1100302398/549e2956
ip规划如下所示:
交换机配置
测试结果:
尝试配置了各种ip_route 0.0.0.0/0 10.0.0.0/8 10.1x.0.0/16 via 各自网关。都不能实现全部npu之间连通。
交换机配置的有没有问题,交换机应该怎么配置?还有主机配置的是不是有问题?还是说安装驱动啥的有问题?
有没有什么方法可以排查,网络联通不了的原因,还是只能一种一种的尝试?求大佬指点。感谢