各位昇腾社区专家好,我们在昇腾 910B 上使用CANN 7.2 + PagedAttention部署 7B/13B 大模型高并发推理服务,目标是提升单卡并发会话数与吞吐,但遇到了KV Block 调度冲突、HBM 内存碎片化、动态批处理效率低三个核心问题,优化后始终达不到硬件理论性能,特来求助。
环境与现象
- 芯片:昇腾 910B 32GB HBM
- 模式:持续推理、多用户长上下文(2k~8k token)
- 问题:
- 开启 Paged KV Cache 后,高并发下频繁出现Block 未释放、重复分配,调度报错。
- 并发会话增多后,HBM 利用率高但有效吞吐不升反降,时延抖动大。
- ATC 编译 OM 时无法自动适配 Paged 结构,KV Cache 内存布局不匹配,推理报错。
已尝试:
- 调整 Block Size(64/128/256)
- 增大预分配池、限制最大并发
- 关闭部分算子融合、重新编译模型
- 修改 HCCL/ACL 内存策略均未稳定解决。
请教
- 昇腾 910B 上 Paged KV Cache 的Block 大小、内存池大小如何配置最合理?
- 高并发下KV Block 释放延迟、调度冲突的根因与规避方案是什么?
- CANN 7.2 如何正确编译支持 PagedAttention 的 OM 模型,避免内存布局不兼容?
各位昇腾社区专家好,我们在昇腾 910B 上使用CANN 7.2 + PagedAttention部署 7B/13B 大模型高并发推理服务,目标是提升单卡并发会话数与吞吐,但遇到了KV Block 调度冲突、HBM 内存碎片化、动态批处理效率低三个核心问题,优化后始终达不到硬件理论性能,特来求助。
环境与现象
已尝试:
请教