---
title: 使用前须知
description: "执行分布式训练前，首先应参考本节了解一些注意事项。"
url: https://www.hiascend.com/document/detail/zh/TensorFlowCommercial/latest/migration/tfmigr1/tfmigr1_000028.html
sourcePath: /source/zh/TensorFlowCommercial/900/migration/tfmigr1/tfmigr1_000028.html
indexId: 5d5a6f98c91914b4c02ed1db0fb13272ba6f1990e34c9a046f406af2c86ab2fb73
---
# 使用前须知

执行分布式训练前，首先应参考本节了解一些注意事项。

开发者跨多个进程执行分布式训练时，首先需要配置参与分布式训练的AI处理器的资源信息，然后再启动训练进程。

当前有配置文件和环境变量两种配置资源信息的方式，开发者可以选择其中任一方式，但两种方式不能混合使用。- 通过配置文件的方式，此资源配置文件称为rank table文件，并配合RANK_TABLE_FILE、RANK_ID等环境变量使用。
  此种方式下配置资源信息、启动训练进程的详细说明可参见训练执行（通过rank table配置资源信息）。

- 通过环境变量的方式。
  此种方式下配置资源信息、启动训练进程的详细说明可参见训练执行（通过环境变量配置资源信息）。


执行分布式训练前，请了解如下注意事项：1. 针对Atlas 训练系列产品，单Server场景下，要求实际参与集合通信的AI处理器数目为1、2、4、8，且0-3卡和4-7卡各为一个组网，使用2张卡或4张卡训练时，不支持跨组网创建设备集群；Server集群场景，要求参与集合通信的AI处理器数目只能为1*n、2*n、4*n、8*n（n为参与训练的Server个数），且n为2的指数倍情况下，集群性能最好，建议用户优先采用此种方式进行集群组网。
2. 针对Atlas A2 训练系列产品 / Atlas A2 推理系列产品，单Server场景，对参与集合通信的AI处理器数量无限制；Server集群场景要求参与集合通信的AI处理器数量为（1~8）*n（n为参与训练的Server个数）。建议每个Server中参与集合通信的AI处理器数量保持一致，若不一致，会造成性能劣化。
3. 针对Atlas A3 训练系列产品 / Atlas A3 推理系列产品，建议每个超节点中的Server数量一致，每个Server中的AI处理器数量一致，若不一致，会造成性能劣化。
4. 一个Device对应执行一个训练进程，当前不支持多进程在同一个Device上进行训练。
