MindIE Service部署大模型时出现KV Cache内存溢出问题
各位昇腾社区的大佬们好,最近在尝试使用华为MindIE推理引擎部署一个70B参数的大语言模型,遇到了一个棘手的问题,想请教一下大家。
环境信息:
-
硬件:昇腾910B NPU,256GB内存
-
软件:MindIE Service v1.2.0,MindIE LLM组件
-
模型:基于LLaMA架构的70B模型,已转换为昇腾格式
-
部署方式:单机多卡部署,使用MindIE Server服务化部署
在部署模型后,进行并发推理测试时,当并发请求数达到10个以上,系统会出现KV Cache内存溢出的错误。具体错误信息如下:
已尝试的解决方法:
-
调整了MindIE Service的配置参数,包括max_batch_size和max_seq_len,但问题依旧
-
尝试启用MindIE LLM的KV Cache压缩功能,但压缩率设置后效果不明显
-
查看了MindIE Turbo的内存优化配置,但文档中关于KV Cache动态管理的说明不够详细
具体现象:
求助内容:
-
有没有人在部署大模型时遇到过类似的KV Cache内存管理问题?
-
MindIE LLM组件是否有更细粒度的KV Cache配置参数?
MindIE Service部署大模型时出现KV Cache内存溢出问题
各位昇腾社区的大佬们好,最近在尝试使用华为MindIE推理引擎部署一个70B参数的大语言模型,遇到了一个棘手的问题,想请教一下大家。
环境信息:
硬件:昇腾910B NPU,256GB内存
软件:MindIE Service v1.2.0,MindIE LLM组件
模型:基于LLaMA架构的70B模型,已转换为昇腾格式
部署方式:单机多卡部署,使用MindIE Server服务化部署
在部署模型后,进行并发推理测试时,当并发请求数达到10个以上,系统会出现KV Cache内存溢出的错误。具体错误信息如下:
已尝试的解决方法:
调整了MindIE Service的配置参数,包括
max_batch_size和max_seq_len,但问题依旧尝试启用MindIE LLM的KV Cache压缩功能,但压缩率设置后效果不明显
查看了MindIE Turbo的内存优化配置,但文档中关于KV Cache动态管理的说明不够详细
具体现象:
单请求推理正常,响应时间在可接受范围内
并发请求数超过10个时,部分请求被丢弃
监控显示NPU内存使用率在并发时迅速达到95%以上
错误日志显示KV Cache分配失败
求助内容:
有没有人在部署大模型时遇到过类似的KV Cache内存管理问题?
MindIE LLM组件是否有更细粒度的KV Cache配置参数?