使用设备:800IA2
使用场景:单机单卡训练实现断点续训功能
由于NPU显存限制,因此使用基础模型resnet50训练来验证断点续训功能
resnet50参考样例:
ResNet50_ID4149_for_PyTorch
已在docker容器中验证其可行性
使用a800_pytorch_vcjob.yaml作为下发任务的脚本
修改后的yaml文件见附件
使用hccn工具在宿主机内配置的deviceIP如下图所示
下发任务后pod状态正常
打印其中日志
参考文档FAQ中hccl.json文件没有生成
进入pod中查看
宿主机内查看Ascend Device Plugin启动参数,发现符合要求
Ascend Device Plugin组件日志如下,未出现Get device ip failed字样
查看hccl组件日志,有如下报错
volcano组件日志报错
此前验证时,不使用k8s调用训练,由于是基础模型,因此只需要代码中写明卡数即可,使用mindxDL时,样例中使用的脚本要求hccl-controller组件生成rank_table_file
请问这种情况应该如何处理
附件已提供hccl-controller日志
使用设备:800IA2
使用场景:单机单卡训练实现断点续训功能
由于NPU显存限制,因此使用基础模型resnet50训练来验证断点续训功能
resnet50参考样例:
ResNet50_ID4149_for_PyTorch
已在docker容器中验证其可行性
使用a800_pytorch_vcjob.yaml作为下发任务的脚本
修改后的yaml文件见附件
使用hccn工具在宿主机内配置的deviceIP如下图所示
下发任务后pod状态正常
打印其中日志
参考文档FAQ中hccl.json文件没有生成
进入pod中查看
宿主机内查看Ascend Device Plugin启动参数,发现符合要求
Ascend Device Plugin组件日志如下,未出现Get device ip failed字样
查看hccl组件日志,有如下报错
volcano组件日志报错
此前验证时,不使用k8s调用训练,由于是基础模型,因此只需要代码中写明卡数即可,使用mindxDL时,样例中使用的脚本要求hccl-controller组件生成rank_table_file
请问这种情况应该如何处理
附件已提供hccl-controller日志