最近在韶关智算中心初期部署2台8卡昇腾910B,跑DeepSeek V4-Flash推理服务,踩了一些坑,也总结了一些经验,分享出来供大家参考。
1. 多卡并行(TP)配置
昇腾上跑MoE模型,tensor-parallel-size建议按卡数设置,通信开销和计算负载需要平衡。实测8卡场景下TP=8比TP=4+PP=2的组合更优。
2. MTP多Token预测
DeepSeek V4-Flash支持MTP,需要在vLLM启动时开启--speculative-model auto,配合昇腾专属环境变量VLLM_ASCEND_ENABLE_MATMUL_ALLREDUCE=1,单流速度有明显提升-。
3. 显存管理
PagedAttention在昇腾上适配良好,但需要根据实际并发数调整KV Cache block size,避免碎片化导致OOM。
目前我们正在组建核心团队,欢迎对昇腾推理优化感兴趣的朋友加入。
📍 坐标:深圳宝安
💰 薪资:50-100万 + 股权
📮 投递:112267823@qq.com
最近在韶关智算中心初期部署2台8卡昇腾910B,跑DeepSeek V4-Flash推理服务,踩了一些坑,也总结了一些经验,分享出来供大家参考。
1. 多卡并行(TP)配置
昇腾上跑MoE模型,tensor-parallel-size建议按卡数设置,通信开销和计算负载需要平衡。实测8卡场景下TP=8比TP=4+PP=2的组合更优。
2. MTP多Token预测
DeepSeek V4-Flash支持MTP,需要在vLLM启动时开启
--speculative-model auto,配合昇腾专属环境变量VLLM_ASCEND_ENABLE_MATMUL_ALLREDUCE=1,单流速度有明显提升-。3. 显存管理
PagedAttention在昇腾上适配良好,但需要根据实际并发数调整KV Cache block size,避免碎片化导致OOM。
目前我们正在组建核心团队,欢迎对昇腾推理优化感兴趣的朋友加入。
📍 坐标:深圳宝安
💰 薪资:50-100万 + 股权
📮 投递:112267823@qq.com