在昇腾910上使用MindIE 3.5部署DeepSeek-V2模型时遇到PD分离调度性能异常问题
各位昇腾社区的技术专家们好,我在使用MindIE推理引擎进行大语言模型部署时遇到了一个比较特殊的性能问题,希望能得到社区的帮助和指导。
问题描述:
我正在昇腾910集群上使用MindIE 3.5版本部署DeepSeek-V2模型(MoE架构,16个专家层),采用PD分离部署模式。在测试过程中发现,当并发请求数超过50时,推理吞吐量会出现断崖式下降,从正常的1200 tokens/s骤降到不足300 tokens/s,同时P99延迟从150ms增加到800ms以上。
环境配置:
具体现象:
-
低并发场景(<30请求)下性能表现正常,符合预期
-
中等并发(30-50请求)时开始出现性能波动
-
高并发(>50请求)时吞吐量急剧下降,错误日志显示大量"KVCache allocation failed"警告
-
监控显示D节点的显存使用率在95%以上,但P节点的CPU利用率仅30%
已尝试的解决方案:
-
调整AutoPD参数,尝试不同的P:D比例(1:3, 2:2, 3:1)
-
增加vLLM的block_size从16到32
在昇腾910上使用MindIE 3.5部署DeepSeek-V2模型时遇到PD分离调度性能异常问题
各位昇腾社区的技术专家们好,我在使用MindIE推理引擎进行大语言模型部署时遇到了一个比较特殊的性能问题,希望能得到社区的帮助和指导。
问题描述:
我正在昇腾910集群上使用MindIE 3.5版本部署DeepSeek-V2模型(MoE架构,16个专家层),采用PD分离部署模式。在测试过程中发现,当并发请求数超过50时,推理吞吐量会出现断崖式下降,从正常的1200 tokens/s骤降到不足300 tokens/s,同时P99延迟从150ms增加到800ms以上。
环境配置:
硬件:昇腾910B * 4节点
MindIE版本:3.5.0
部署模式:PD分离部署(2个P节点,2个D节点)
模型:DeepSeek-V2-32B(使用MindIE LLM组件加载)
服务化框架:MindIE Motor + vLLM Ascend适配层
具体现象:
低并发场景(<30请求)下性能表现正常,符合预期
中等并发(30-50请求)时开始出现性能波动
高并发(>50请求)时吞吐量急剧下降,错误日志显示大量"KVCache allocation failed"警告
监控显示D节点的显存使用率在95%以上,但P节点的CPU利用率仅30%
已尝试的解决方案:
调整AutoPD参数,尝试不同的P:D比例(1:3, 2:2, 3:1)
增加vLLM的block_size从16到32