昇腾910B上部署DeepSeek V4-Flash的一些实战思考
收藏回复举报
昇腾910B上部署DeepSeek V4-Flash的一些实战思考
新人帖
发表于2026-07-31 09:12:55
0 查看

最近在韶关智算中心初期部署2台8卡昇腾910B,跑DeepSeek V4-Flash推理服务,踩了一些坑,也总结了一些经验,分享出来供大家参考。

1. 多卡并行(TP)配置

昇腾上跑MoE模型,tensor-parallel-size建议按卡数设置,通信开销和计算负载需要平衡。实测8卡场景下TP=8比TP=4+PP=2的组合更优。

2. MTP多Token预测

DeepSeek V4-Flash支持MTP,需要在vLLM启动时开启--speculative-model auto,配合昇腾专属环境变量VLLM_ASCEND_ENABLE_MATMUL_ALLREDUCE=1,单流速度有明显提升-

3. 显存管理

PagedAttention在昇腾上适配良好,但需要根据实际并发数调整KV Cache block size,避免碎片化导致OOM。

目前我们正在组建核心团队,欢迎对昇腾推理优化感兴趣的朋友加入。

📍 坐标:深圳宝安

💰 薪资:50-100万 + 股权

📮 投递:112267823@qq.com

我要发帖子