华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
昇腾社区首页
昇腾论坛
0
/100
支持
消息
我的论坛主页
论坛首页
/
vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?
点赞
0
收藏
0
回复
0
分享
举报
vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?
已解决
发表于2026-04-27 22:55:58
0
查看
vLLM/SGLang 推理时无 NPU 算力瓶颈,但 KV Cache 频繁释放 / 重分配、吞吐毛刺大,不是显存不足,底层如何根治?
匿名回复
发表
我要发帖子
我们使用cookie来确保您的高速浏览体验。继续浏览本站,即表示您同意我们使用cookie。
查看详情