---
title: 在进行模型分布式训练时遇到报错“RuntimeError: Gloo connectFullMesh failed ...”-昇腾社区
description: (待补充)
keywords: RuntimeError,在进行模型分,布式训练时遇,到报错,Gloo,FullMesh,昇腾社区,问题现象描述
url: https://www.hiascend.com/document/caselibrary/detail/ptacase_0041
section: (其他)
---

# 在进行模型分布式训练时遇到报错“RuntimeError: Gloo connectFullMesh failed ...”-昇腾社区

URL: https://www.hiascend.com/document/caselibrary/detail/ptacase_0041
描述: (待补充)
关键词: RuntimeError,在进行模型分,布式训练时遇,到报错,Gloo,FullMesh,昇腾社区,问题现象描述

昇腾文档 [了解详情](https://www.hiascend.com/document)

故障案例 [了解详情](https://www.hiascend.com/document/caselibrary)

在进行模型分布式训练时遇到报错“RuntimeError: Gloo connectFullMesh failed ...”

在进行模型分布式训练时遇到报错“RuntimeError: Gloo connectFullMesh failed ...”

2025/03/18

1.4k

问题信息

| 问题来源 | 产品大类 | 产品子类 | 关键字 |
| --- | --- | --- | ---|
| 官方 | 模型训练 | PyTorch | -- |

#### 问题现象描述

- 报错截图

- 报错文本

```
……
[E ProcessGroupGloo.cpp:138] Gloo connectFullMesh failed with [...] no error

……
RuntimeError: Gloo connectFullMesh failed with [...] no error
```

#### 原因分析

- 模型进行分布式训练时，gloo是torch原生cpu协议，当有多个网口时，可能会报“RuntimeError: Gloo connectFullMesh failed ...”。
- 由于gloo协议的限制，当bond4网口超过60个时，可能会报“RuntimeError: Gloo connectFullMesh failed ...”。

#### 解决措施

- 当有多个网口时，建议设置以下环境变量，命令如下：

```
export GLOO_SOCKET_IFNAME=网口名称
```

通过ifconfig命令可以找到与机器IP相同的网口名称。
- 当bond4网口超过60个时，考虑用其他网口代替，比如用GE网口进行替换，执行如下命令：

```
export GLOO_SOCKET_IFNAME=enp189s0f0
```

“enp189s0f0”为GE网口的名称，需根据实际情况进行替换。

本页内容

- 问题信息
- 问题现象描述
- 原因分析
- 解决措施
