vLLM在启动加载时,支持tp、pp等模型并行参数设置;但是看MindIE好像并没有放出来模型并行参数,如果设置呢?
在启动MindIE时,我未设置 `npuMemSize` 参数,该值为-1,此时推理加载部署deepseek-r1-distilled-qwen-32b是,显卡占用得到了50+GB(单卡64GB显存),而设置了该参数为8后,显存掉到了30GB左右;从该参数的用途来看,是启用kv cache,并设置其上限。难道MindIE是通过kv cache来实现降低显存的嘛?而不是类似vllm这种tp、pp等降低显存的优化手段?
vLLM在启动加载时,支持tp、pp等模型并行参数设置;但是看MindIE好像并没有放出来模型并行参数,如果设置呢?
在启动MindIE时,我未设置 `npuMemSize` 参数,该值为-1,此时推理加载部署deepseek-r1-distilled-qwen-32b是,显卡占用得到了50+GB(单卡64GB显存),而设置了该参数为8后,显存掉到了30GB左右;从该参数的用途来看,是启用kv cache,并设置其上限。难道MindIE是通过kv cache来实现降低显存的嘛?而不是类似vllm这种tp、pp等降低显存的优化手段?