CANN 如何对ONNX模型进行Int8量化并编译生成om
收藏回复举报
CANN 如何对ONNX模型进行Int8量化并编译生成om
t('forum.solved') 已解决
发表于2024-05-17 22:04:04
0 查看

【用户类型】:企业、高校、个人开发者、其他

【昇腾产品型号】:Atlas 200I DK A2

【版本信息】:

--操作系统版本:ubuntu.aarch64

--固件驱动版本:npu-smi 21.0.4     Version: 21.0.4

--CANN版本:CANN 7.0.rc1

--Pytorch版本:2.0.1

--Python版本:Python3.9

【官方样例or个人代码】:

--官方样例链接:https://gitee.com/ascend/samples/tree/master/python/level1_single_api/9_amct/amct_onnx/cmd

-- 简介-算子及模型速查工具-开发工具-CANN社区版8.0.RC2.alpha002开发文档-昇腾社区 (hiascend.com)

【开发内容】:使用 amct 量化 onnx 的 mobilenetv2 模型,并生成对应的 om 用于上板子运行测速

【问题描述】:atc 的文档中没有详细的章节讲解如何编译生成 int8 的模型,默认的指导都是没有量化的 fp16 的模型转换,无法发挥 NPU 最大算力(即 Int8 的算力),于是我参考 简介-算子及模型速查工具-开发工具-CANN社区版8.0.RC2.alpha002开发文档-昇腾社区 (hiascend.com) 使用 amct 工具量化生成了以下文件

cke_43761.png

看 mobilenetv2_deploy_model.onnx 的模型大小为 3.6MiB,对应的 onnx 浮点模型为 15+MiB,貌似成功完成了int8模型量化。然后我应该怎么操作呢?是使用 atc 工具来转换生成 om 文件,还是说直接可以上板子运行了?

我要发帖子