华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
昇腾社区首页
昇腾论坛
0
/100
支持
消息
我的论坛主页
论坛首页
/
4-bit 量化为什么推理延迟反而比 FP16 还高?
点赞
0
收藏
0
回复
0
分享
举报
只看楼主
4-bit 量化为什么推理延迟反而比 FP16 还高?
已解决
发表于2026-01-13 16:50:20
0
查看
为了在 Atlas 300I 上部署 Qwen-7B,按文档启用了 4-bit AWQ 量化,期望降低显存、提升吞吐。结果压测发现:单请求延迟从 280ms 涨到 410ms,吞吐还下降了 30%!日志里全是
dequantize
相关的 kernel 调用。难道量化在国产 NPU 上不 work?
本帖最后由
匿名用户
于
2026/01/13 17:21:23
编辑
匿名回复
发表
我要发帖子
我们使用cookie来确保您的高速浏览体验。继续浏览本站,即表示您同意我们使用cookie。
查看详情
dequantize相关的 kernel 调用。难道量化在国产 NPU 上不 work?