我尝试在lmdeploy awq量化中接入ascend,有个关于量化性能的疑问:
在推理时,我看torch_npu.npu_weight_quant_batchmatmul是调用的aclnnWeightQuantBatchMatmulV2,于是直接采用torch_npu.npu_weight_quant_batchmatmul。我在800T上测试了量化前后的性能,发现w4a16的性能比fp16的性能低了10%~20%,请问这是正常的吗?
我分别拉取了internlm2-chat-7b和internlm2-chat-7b-4bit在prompt长度128,batch_size为16的情况下的timeline,发现aclnnWeightQuantBatchMatmulV2(w4a16)要比aclnnMatmul(fp16)慢的,timeline文件在附件里面。


我尝试在lmdeploy awq量化中接入ascend,有个关于量化性能的疑问:
在推理时,我看torch_npu.npu_weight_quant_batchmatmul是调用的aclnnWeightQuantBatchMatmulV2,于是直接采用torch_npu.npu_weight_quant_batchmatmul。我在800T上测试了量化前后的性能,发现w4a16的性能比fp16的性能低了10%~20%,请问这是正常的吗?
我分别拉取了internlm2-chat-7b和internlm2-chat-7b-4bit在prompt长度128,batch_size为16的情况下的timeline,发现aclnnWeightQuantBatchMatmulV2(w4a16)要比aclnnMatmul(fp16)慢的,timeline文件在附件里面。