服务器的卡是两张altlas 300I pro,驱动版本是24.1.0.1,cann版本是8.0.0
目前在服务器上按照DeepSeek-R1-Distill-Qwen-7B-模型库-ModelZoo-昇腾社区的步骤将DeepSeek-R1-Distill-Qwen-7B进行稀疏量化,生成的权重如下

执行命令torchrun --nproc_per_node 2 --master_port 20037 -m examples.run_pa --model_path /home/deepseek_7B_QC --max_output_length 20能够正常出结果

然而在按照环境准备-vLLM-MindIE开源第三方服务化框架适配开发指南-服务化集成部署-MindIE1.0.0开发文档-昇腾社区用vllm0.6.2进行离线推理的时候报错

这是vllm不支持稀疏量化吗?
服务器的卡是两张altlas 300I pro,驱动版本是24.1.0.1,cann版本是8.0.0
目前在服务器上按照DeepSeek-R1-Distill-Qwen-7B-模型库-ModelZoo-昇腾社区的步骤将DeepSeek-R1-Distill-Qwen-7B进行稀疏量化,生成的权重如下
执行命令torchrun --nproc_per_node 2 --master_port 20037 -m examples.run_pa --model_path /home/deepseek_7B_QC --max_output_length 20能够正常出结果
然而在按照环境准备-vLLM-MindIE开源第三方服务化框架适配开发指南-服务化集成部署-MindIE1.0.0开发文档-昇腾社区用vllm0.6.2进行离线推理的时候报错
这是vllm不支持稀疏量化吗?