测试mindxDL断点续训功能,在使用k8s下发训练任务时报错,pod中无法获取deviceIP,hccl.json文件一直处于initializing状态
收藏回复举报
测试mindxDL断点续训功能,在使用k8s下发训练任务时报错,pod中无法获取deviceIP,hccl.json文件一直处于initializing状态
t('forum.solved') 已解决
发表于2024-09-19 10:19:42
0 查看

使用设备:800IA2

使用场景:单机单卡训练实现断点续训功能

由于NPU显存限制,因此使用基础模型resnet50训练来验证断点续训功能

resnet50参考样例:

ResNet50_ID4149_for_PyTorch

已在docker容器中验证其可行性

使用a800_pytorch_vcjob.yaml作为下发任务的脚本

修改后的yaml文件见附件

使用hccn工具在宿主机内配置的deviceIP如下图所示

下发任务后pod状态正常

打印其中日志

参考文档FAQ中hccl.json文件没有生成

进入pod中查看

宿主机内查看Ascend Device Plugin启动参数,发现符合要求

Ascend Device Plugin组件日志如下,未出现Get device ip failed字样

查看hccl组件日志,有如下报错

volcano组件日志报错

此前验证时,不使用k8s调用训练,由于是基础模型,因此只需要代码中写明卡数即可,使用mindxDL时,样例中使用的脚本要求hccl-controller组件生成rank_table_file

请问这种情况应该如何处理

附件已提供hccl-controller日志

我要发帖子