关于w4a16量化的性能的疑问
收藏回复举报
关于w4a16量化的性能的疑问
t('forum.solved') 已解决
发表于2024-10-16 15:19:43
0 查看

我尝试在lmdeploy awq量化中接入ascend,有个关于量化性能的疑问:

在推理时,我看torch_npu.npu_weight_quant_batchmatmul是调用的aclnnWeightQuantBatchMatmulV2,于是直接采用torch_npu.npu_weight_quant_batchmatmul。我在800T上测试了量化前后的性能,发现w4a16的性能比fp16的性能低了10%~20%,请问这是正常的吗?

我分别拉取了internlm2-chat-7b和internlm2-chat-7b-4bit在prompt长度128,batch_size为16的情况下的timeline,发现aclnnWeightQuantBatchMatmulV2(w4a16)要比aclnnMatmul(fp16)慢的,timeline文件在附件里面。

cke_16404.png

cke_22327.png

我要发帖子