4-bit 量化为什么推理延迟反而比 FP16 还高?
收藏回复举报
4-bit 量化为什么推理延迟反而比 FP16 还高?
t('forum.solved') 已解决
发表于2026-01-13 16:50:20
0 查看
为了在 Atlas 300I 上部署 Qwen-7B,按文档启用了 4-bit AWQ 量化,期望降低显存、提升吞吐。结果压测发现:单请求延迟从 280ms 涨到 410ms,吞吐还下降了 30%!日志里全是 dequantize 相关的 kernel 调用。难道量化在国产 NPU 上不 work?

本帖最后由 匿名用户2026/01/13 17:21:23 编辑

我要发帖子