在300I DOU上量化ds蒸馏的qwen 14B模型,量化格式为w8a8,用的MindIE里自带的量化脚本,具体为usr/local/Ascend/atb-models/examples/models/qwen/convert_quant_weight.sh ,量化前的模型启动服务化推理,访问服务,回答的问题正常,量化后的w8a8模型启动服务化,访问服务,回答问题出现乱码乱回答的情况。
然后在atlas 800I 9000上量化ds蒸馏的qwen 14B模型,同样的脚本,同样的格式,除了设备换了,其他全都一样,在这台机器上启动量化后的模型服务化。就不会出现乱码乱回答的情况。这是什么原因呢,怎么解决呢?
然后在atlas 800I 9000上量化ds蒸馏的qwen 14B模型,同样的脚本,同样的格式,除了设备换了,其他全都一样,在这台机器上启动量化后的模型服务化。就不会出现乱码乱回答的情况。这是什么原因呢,怎么解决呢?