---
title: 点云分割类模型在A3上线性度不足问题分析与优化实践-官方技术文章-昇腾社区
description: 在基于Atlas 900 A3 SuperPoD的中心化训练场景中&#xff0c;点云分割类AI模型广泛应用于自动驾驶、3D场景理解等高精度感知任务。随着模型规模与集群规模的持续增长&#xff0c;训练效率与线性度成为影响整体训练性能的关键指标。在实际部署过程中&#xff0c;部分用户反馈在使用A3芯片进行16Die分布式训练时&#xff0c;线性度仅维持在0.7~0.8之间&#xff0c;未达到
keywords: 点云分割类模,型在,上线性度不足,问题分析与优,化实践,官方技术文章,昇腾社区,背景概述
url: https://www.hiascend.com/developer/techArticles/20260709-3
section: (其他)
---

# 点云分割类模型在A3上线性度不足问题分析与优化实践-官方技术文章-昇腾社区

URL: https://www.hiascend.com/developer/techArticles/20260709-3
描述: 在基于Atlas 900 A3 SuperPoD的中心化训练场景中&#xff0c;点云分割类AI模型广泛应用于自动驾驶、3D场景理解等高精度感知任务。随着模型规模与集群规模的持续增长&#xff0c;训练效率与线性度成为影响整体训练性能的关键指标。在实际部署过程中&#xff0c;部分用户反馈在使用A3芯片进行16Die分布式训练时&#xff0c;线性度仅维持在0.7~0.8之间&#xff0c;未达到
关键词: 点云分割类模,型在,上线性度不足,问题分析与优,化实践,官方技术文章,昇腾社区,背景概述

官方技术文章 [了解详情](https://www.hiascend.com/zh/developer/techArticles)

点云分割类模型在A3上线性度不足问题分析与优化实践

点云分割类模型在A3上线性度不足问题分析与优化实践

性能调优

发表于: 2026/07/09

6

0

## 背景概述

在基于Atlas 900 A3 SuperPoD部署点云分割类AI模型过程中，线性度仅维持在0.7~0.8之间，未达到预期目标（≥0.9），严重影响训练效率与资源利用率。本文基于真实训练场景，系统分析该问题的根本原因，并提出可落地的优化方案。

## 问题描述

在CANN 8.2.RC1、PyTorch 2.1.0、HDK 25.2.1的软件栈环境下，使用Atlas 900 A3 SuperPoD进行点云分割模型的16Die分布式训练，发现线性度表现不佳，仅在0.7~0.8区间波动，远低于预期目标0.9。进一步缩小规模至4Die作业后，该问题依然存在，表明非集群规模引发的偶发异常，而是系统性瓶颈。

## 问题分析

### 1. 快慢卡现象识别

通过Profiling工具对训练过程进行分析，发现任务中存在显著的快慢卡现象。以Step 3为例，Rank2在每次卡间同步时均表现为最慢节点，成为整体通信延迟的瓶颈点。该现象直接导致各卡间执行不同步，进而影响整体线性度。

### 2. 下发流水差异定位

对比Rank2（慢卡）与Rank0（快卡）的算子下发流水，发现前向阶段存在明显差异，尤其体现在`nonzero`算子的下发时序上。该算子在慢卡上显著延迟，而其他算子下发相对正常，提示问题可能源于算子执行前的同步机制。

### 3.nonzero算子同步机制分析

经确认，`nonzero`算子在执行前会触发同步操作，需等待前序所有算子完成执行后方可下发。因此，其延迟本质反映的是前序执行流水的不一致。

进一步分析NPU流水，发现Rank0存在大量`event_wait`事件，而Rank2部分算子执行时间明显更长，说明慢卡在执行阶段已存在性能瓶颈。

### 4. 计算负载不均分析

#### （1）计算耗时差异

计算/通信概览显示，Rank2的计算耗时显著高于Rank0，表明存在明显的计算负载不均。

#### （2）算子下发次数对比

对比两张卡的算子下发次数，发现下发数量接近，说明负载不均并非由算子数量差异引起。

#### （3）关键算子耗时对比

分析耗时排名前三的算子，发现相同算子在Rank2上的执行时间明显更长。

#### （4）输入数据差异验证

以耗时最高的`RepeatInterleave`算子为例，对比其在两张卡上的输入shape，发现慢卡的输入数据整体尺寸更大，导致执行时间高出快卡约40%。其他关键算子亦呈现相同趋势。

## 问题根因

综合分析表明，当前训练任务性能瓶颈的核心在于数据分布不均。尽管各卡算子下发数量相近，但由于输入数据尺寸差异显著，导致不同卡上算子的实际计算负载不均。该负载不均进一步引发：

●

卡间执行不同步；

●

`nonzero`等同步算子因等待时间延长而延迟下发；

●

通信阶段等待时间增加，整体通信效率下降；

●

最终表现为线性度不足。

## 优化验证

为验证上述推断，进行理想化实验：通过构造绝对均匀的数据分布，对各卡输入数据进行严格控制。实验结果显示，线性度提升至0.9以上，部分场景甚至达到1.0，充分证明数据分布不均是导致性能劣化的主因。

## 解决方案

针对点云分割模型输入数据尺寸不一的问题，提出以下优化策略：

推荐方案：分桶采样 + 加权采样

●

分桶策略：将输入点云数据按尺寸（如点数、空间范围）划分为若干桶（如小、中、大三类）；

●

组Batch策略：在构建训练Batch时，从每个桶中按比例均匀采样，确保每个Batch中数据尺寸分布均衡；

●

加权采样：对不同桶设置采样权重，平衡数据多样性与训练效率。

该方案可在不改变原始数据的前提下，有效缓解因输入尺寸差异导致的负载不均问题，显著提升卡间同步效率与整体线性度。

## 总结

在大规模分布式训练中，数据分布不均可能成为隐藏的性能瓶颈，即使算子下发数量均衡，仍可能因输入数据差异导致计算负载失衡。通过Profiling分析、流水对比与理想实验验证，最终定位问题根因并提出可落地的分桶采样优化方案。该方法适用于点云、图像等输入尺寸可变的模型场景，具有良好的通用性与工程价值。

边框设置

无框线

边距

宽度

1磅

颜色

自由布局设置

整体布局

子模块

评论

修订记录

对正文进行的文本增删、样式修改都将标记为修订

自定义多级列表

列表设置

- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9

- 1.
- a.
- i.
- 1.
- a.
- i.
- 1.
- a.
- i.

前缀

无

序号

1 2 3 ...

后缀

.

编号格式

列表显示

继承层级

不继承

位置

对齐方式

默认

单元格边距

边距

默认

左边距

cm

右边距

cm

上边距

cm

下边距

cm

点赞 0

本页内容

背景概述 [了解详情](https://www.hiascend.com/#276o1azXmSWh1YvSz3Jiyr)

问题描述 [了解详情](https://www.hiascend.com/#2htOKAaLvZhW8XoXJBURSt)

问题分析 [了解详情](https://www.hiascend.com/#reJ87HjYtbIdsLnqV9ItP)

问题根因 [了解详情](https://www.hiascend.com/#6lIz3TRJ2HXelkM2odgv2W)

优化验证 [了解详情](https://www.hiascend.com/#447hIrfHK8UhWzyTUtRavi)

解决方案 [了解详情](https://www.hiascend.com/#5krzAFY1oUaBHuOkeDoFUO)

总结 [了解详情](https://www.hiascend.com/#6BGf6O1vLI7spahY4et9Ql)
