---
title: 结果说明
description: "分布式训练执行完成后，开发者可以参考本章节检查执行结果、定位问题。"
url: https://www.hiascend.com/document/detail/zh/TensorFlowCommercial/latest/migration/tfmigr1/tfmigr1_000035.html
sourcePath: /source/zh/TensorFlowCommercial/900/migration/tfmigr1/tfmigr1_000035.html
indexId: 1ad9de2ebde66d88c991a6191e4513a1cd39472543b853ca4cfd4b45d02e382373
---
# 结果说明

分布式训练执行完成后，开发者可以参考本章节检查执行结果、定位问题。

#### 检查执行结果

1. 检查运行结果。
  不同的训练脚本打印结果不同，若执行分布式训练的每个Device出现类似如下打印信息，说明训练任务已经正常结束。

  当启用环境变量DUMP_GE_GRAPH时，会生成GE的dump图文件。

  1 export DUMP_GE_GRAPH=2

  在dump下来的图文件目录下，搜索到包含了HcomBroadcast和HcomAllReduce算子，这表明正常插入了NPU间通信的HCCL算子。

  图1 GE的dump图

2. 如果运行失败，和单Device训练一样，通过日志分析并定位问题。
  在$HOME/ascend/log/run/plog下查看Host侧日志plog_*.log，$HOME为Host侧用户根目录。

  在单Device执行成功，多Device执行失败的情况下，一般为集合通信的问题，如图2所示。可以参见《HCCL集合通信库(https://www.hiascend.com/document/detail/zh/canncommercial/900/API/hcclug/hcclug_000001.html)》的“FAQ”章节进行问题处理。

  图2 集合通信问题


#### 问题定位

如果运行失败，通过日志分析并定位问题。

在Host侧运行应用程序产生的运行日志路径：$HOME/ascend/log/run/plog/plog-pid_*.log。

在Device侧运行应用程序产生的运行日志路径：$HOME/ascend/log/run/device-id/device-pid_*.log。

$HOME为Host侧用户根目录。

了解更多介绍，请参考《日志参考(https://www.hiascend.com/document/detail/zh/canncommercial/900/maintenref/logreference/logreference_0001.html)》。


一般通过ERROR级别的日志，识别问题产生模块，根据具体日志内容判定问题产生原因。

图3 错误日志样例


**表1 问题定位思路**

| ModuleName | 出错流程 | 解决思路 |
| --- | --- | --- |
| 系统类报错 | 环境与版本配套错误 | 系统类报错，优先排查版本配套是否正确，系统是否正常安装。 |
| GE | GE图编译或校验问题 | 校验类报错，通常会给出明确的错误原因，此时需要针对性地修改网络脚本，以满足相关要求。 |
| Runtime | 环境异常导致初始化问题或图执行问题 | 对于初始化异常，优先排查当前运行环境配置是否正确，当前环境是否有其他进程占用。 |
