使用vllm离线推理量化的deepseek_7B报错
收藏回复举报
使用vllm离线推理量化的deepseek_7B报错
t('forum.solved') 已解决
发表于2025-04-08 15:17:30
0 查看

服务器的卡是两张altlas 300I pro,驱动版本是24.1.0.1,cann版本是8.0.0

目前在服务器上按照DeepSeek-R1-Distill-Qwen-7B-模型库-ModelZoo-昇腾社区的步骤将DeepSeek-R1-Distill-Qwen-7B进行稀疏量化,生成的权重如下

cke_7547.png

执行命令torchrun --nproc_per_node 2  --master_port 20037 -m examples.run_pa --model_path /home/deepseek_7B_QC  --max_output_length 20能够正常出结果

cke_15141.png

然而在按照环境准备-vLLM-MindIE开源第三方服务化框架适配开发指南-服务化集成部署-MindIE1.0.0开发文档-昇腾社区用vllm0.6.2进行离线推理的时候报错

cke_24065.png

这是vllm不支持稀疏量化吗?

我要发帖子