在昇腾910上使用MindIE 3.5部署DeepSeek-V2模型时遇到PD分离调度性能异常问题 各位昇腾社区的技术专家们好,我在使用MindIE推理引擎进行大语言模型部署时遇到了一个比较特殊的性能问题,希望能得到社区的帮助和指导。
收藏回复举报
在昇腾910上使用MindIE 3.5部署DeepSeek-V2模型时遇到PD分离调度性能异常问题 各位昇腾社区的技术专家们好,我在使用MindIE推理引擎进行大语言模型部署时遇到了一个比较特殊的性能问题,希望能得到社区的帮助和指导。
t('forum.solved') 已解决
发表于2026-04-09 23:19:40
0 查看

在昇腾910上使用MindIE 3.5部署DeepSeek-V2模型时遇到PD分离调度性能异常问题

各位昇腾社区的技术专家们好,我在使用MindIE推理引擎进行大语言模型部署时遇到了一个比较特殊的性能问题,希望能得到社区的帮助和指导。

问题描述:

我正在昇腾910集群上使用MindIE 3.5版本部署DeepSeek-V2模型(MoE架构,16个专家层),采用PD分离部署模式。在测试过程中发现,当并发请求数超过50时,推理吞吐量会出现断崖式下降,从正常的1200 tokens/s骤降到不足300 tokens/s,同时P99延迟从150ms增加到800ms以上。

环境配置:

  • 硬件:昇腾910B * 4节点

  • MindIE版本:3.5.0

  • 部署模式:PD分离部署(2个P节点,2个D节点)

  • 模型:DeepSeek-V2-32B(使用MindIE LLM组件加载)

  • 服务化框架:MindIE Motor + vLLM Ascend适配层

具体现象:

  1. 低并发场景(<30请求)下性能表现正常,符合预期

  2. 中等并发(30-50请求)时开始出现性能波动

  3. 高并发(>50请求)时吞吐量急剧下降,错误日志显示大量"KVCache allocation failed"警告

  4. 监控显示D节点的显存使用率在95%以上,但P节点的CPU利用率仅30%

已尝试的解决方案:

  1. 调整AutoPD参数,尝试不同的P:D比例(1:3, 2:2, 3:1)

  2. 增加vLLM的block_size从16到32

我要发帖子