---
title: 昇腾大规模专家并行解决方案-昇腾社区
description: 高性能 | 高可用 | 业界领先
keywords: 昇腾大规模专,家并行解决方,昇腾社区,解决方案介绍,业务挑战,MoE,模型带来的模,型推理挑战
url: https://www.hiascend.com/industries/solutions/large-model
section: (其他)
---

# 昇腾大规模专家并行解决方案-昇腾社区

URL: https://www.hiascend.com/industries/solutions/large-model
描述: 高性能 | 高可用 | 业界领先
关键词: 昇腾大规模专,家并行解决方,昇腾社区,解决方案介绍,业务挑战,MoE,模型带来的模,型推理挑战

大规模专家并行解决方案

大规模专家并行解决方案

高性能 | 高可用 | 业界领先

## 解决方案介绍

大规模专家并行解决方案，是昇腾针对类DeepSeek-R1/V3的MoE混合专家模型，推出的一种集群推理解决方案。

针对大型MoE专家模型的特点，大规模专家并行解决方案通过对通信、访存、专家的部署和调度、并行策略等的深度优化，可满足超大吞吐、超低时延的大模型推理生产应用场景需求，单卡吞吐是传统模式的4倍以上。

大规模专家并行方案在互联网、金融、能源、教育等行业已初步落地，一些应用如ToC端的AI实时交互、AI风险控制等，需要更高的吞吐和更低的推理时延，部署大规模专家并行解决方案将为企业带来更高的收益。

## 业务挑战

### MoE模型带来的模型推理挑战

MoE模型的专家通信All2All时延更大

在极端场景下，通信时延占整体时延的70%，导致推理的文本输出时延大，对话缓慢。

MoE模型专家负载不均衡，推理效率低

由于路由的随机性，部分专家过分热门，其他NPU处于闲置等待，拖慢了整体的推理业务，算力利用率低。

MoE模型内存占用大，导致性能瓶颈

以DeepSeek-R1 671B为例，700GB模型权重常驻内存，且KVCache碎片化分布，空闲内存少，推理性能瓶颈。

## 解决方案

大规模专家并行解决方案

MoE推理最优解，相比常规服务器堆叠，大规模专家并行可实现2到4倍的单卡吞吐提升，降低50%+系统时延，在相同卡数下获得更大的收益，实现“一份投入，多份输出”

64卡大规模专家并行

384卡大规模专家并行

## 方案亮点

动态专家负载均衡

PD分离服务调度

线程级精细调度

RAS可靠性

动态专家负载均衡

PD分离服务调度

线程级精细调度

RAS可靠性

...

动态专家负载均衡

MoE中专家负载容易不均，导致某个专家负载过高，阻塞整体的推理进度。昇腾通过EPLB动态专家负载均衡，在线统计和分析热点专家，实时分配和调节冗余专家分担负载，有效降低了热点专家的阻塞。

此外，通过让通信较为频繁的“亲和”专家部署在一张卡内或一个服务器内，减少了跨卡和跨机的通信。

通过这些专家调节技术，均衡了每个专家的计算量，负载峰均比从最大8降低到1.4，同时减少了30%的通信数量，提升了硬件资源利用率，使得集群的推理时延更低，支持更大的吞吐性能。

## 相关产品

硬件

软件

硬件

软件

...

Atlas 800I A2 推理服务器

了解详情 [了解详情](https://www.hiascend.com/hardware/ai-server?tag=800A2)

Atlas 800I A3 推理超节点

了解详情 [了解详情](https://www.hiascend.com/hardware/ai-server?tag=800ia3)
