vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?
收藏回复举报
vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?
t('forum.solved') 已解决
发表于2026-04-27 22:55:58
0 查看
vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?

我要发帖子