相关依赖版本信息: firmware版本:7.1.0.6.220
driver版本:24.1.rc1
CANN版本:8.0.RC2
python版本:3.10.13
torch版本:2.1.0
torch_npu版本:2.1.0.post5
CPU架构:x86
NPU类型:300i duo (24g*2)
MindIE版本:1.0.T56(1.0.RC2)
问题描述:用MindIE service部署qwen-14b占用的显存太大,有什么办法可以降低显存,目前已经根据官方文档把npuMemSize的值调成了1,如下所示:


此时运行qwen-14b,占用的npu显存情况如下:

等到服务起来后调用接口,输出的是一堆胡乱的单词,应该是显存剩余空间不足导致

运行qwen1.5-14b直接报错npu out of memory,如下所示:

后面尝试在96G(48g*2)的昇腾300I Duo上运行,可以正常运行和输出,但占用的显存有52g(26g*2),理论上14b的模型占用30g显存差不多,为什么用MindIE Service占用显存要多这么多?


firmware版本:7.1.0.6.220
driver版本:24.1.rc1
CANN版本:8.0.RC2
python版本:3.10.13
torch版本:2.1.0
torch_npu版本:2.1.0.post5
CPU架构:x86
NPU类型:300i duo (24g*2)
MindIE版本:1.0.T56(1.0.RC2)
问题描述:用MindIE service部署qwen-14b占用的显存太大,有什么办法可以降低显存,目前已经根据官方文档把npuMemSize的值调成了1,如下所示:
此时运行qwen-14b,占用的npu显存情况如下:

等到服务起来后调用接口,输出的是一堆胡乱的单词,应该是显存剩余空间不足导致
运行qwen1.5-14b直接报错npu out of memory,如下所示:
后面尝试在96G(48g*2)的昇腾300I Duo上运行,可以正常运行和输出,但占用的显存有52g(26g*2),理论上14b的模型占用30g显存差不多,为什么用MindIE Service占用显存要多这么多?