模型量化后虽然权重文件变小,但是mindie推理是速度比原模型推理速度慢
收藏回复举报
模型量化后虽然权重文件变小,但是mindie推理是速度比原模型推理速度慢
t('forum.solved') 已解决
发表于2025-03-11 14:38:19
0 查看

原fp16模型推理速度:

cke_615.png

量化成w8a8后的推理速度:

cke_3204.png

我要发帖子