各位昇腾社区的大佬们好,最近在尝试使用华为MindIE推理引擎部署一个70B参数的大语言模型出现KV Cache内存溢出问题
收藏回复举报
各位昇腾社区的大佬们好,最近在尝试使用华为MindIE推理引擎部署一个70B参数的大语言模型出现KV Cache内存溢出问题
t('forum.solved') 已解决
发表于2026-03-24 23:29:31
0 查看

MindIE Service部署大模型时出现KV Cache内存溢出问题

各位昇腾社区的大佬们好,最近在尝试使用华为MindIE推理引擎部署一个70B参数的大语言模型,遇到了一个棘手的问题,想请教一下大家。

环境信息:

  • 硬件:昇腾910B NPU,256GB内存

  • 软件:MindIE Service v1.2.0,MindIE LLM组件

  • 模型:基于LLaMA架构的70B模型,已转换为昇腾格式

  • 部署方式:单机多卡部署,使用MindIE Server服务化部署

在部署模型后,进行并发推理测试时,当并发请求数达到10个以上,系统会出现KV Cache内存溢出的错误。具体错误信息如下:

[ERROR] MindIE LLM Runtime: KV cache allocation failed, out of memory
[ERROR] Request dropped due to insufficient KV cache space

已尝试的解决方法:

  1. 调整了MindIE Service的配置参数,包括max_batch_sizemax_seq_len,但问题依旧

  2. 尝试启用MindIE LLM的KV Cache压缩功能,但压缩率设置后效果不明显

  3. 查看了MindIE Turbo的内存优化配置,但文档中关于KV Cache动态管理的说明不够详细

具体现象:

  • 单请求推理正常,响应时间在可接受范围内

  • 并发请求数超过10个时,部分请求被丢弃

  • 监控显示NPU内存使用率在并发时迅速达到95%以上

  • 错误日志显示KV Cache分配失败

求助内容:

  1. 有没有人在部署大模型时遇到过类似的KV Cache内存管理问题?

  2. MindIE LLM组件是否有更细粒度的KV Cache配置参数?

我要发帖子