我的操作:
1. 使用yolov8项目在带GPU的Linux_x86_64服务器上进行训练,得到pt模型后导出为onnx模型。
2. 在x86_64 PC机上使用amct的命令行方式量化为int8模型。得到deploy_model.onnx和fake_quant_model.onnx。(按照这个链接操作https://gitee.com/ascend/samples/tree/master/python/level1_single_api/9_amct/amct_onnx/cmd)
这个链接的README.md中说使用 fake_quant_model.onnx(量化仿真模型)在 ONNX 执行框架 ONNX Runtime 进行精度仿真。
于是我在GPU服务器的yolov8项目执行val.py来测试精度,但是报错了:
详情看这个链接: https://yb.tencent.com/s/ahHSwCs2BMNx
我的问题:
1. 是我的onnx runtime版本有问题吗,感觉和这个链接的问题差不多https://www.hiascend.com/forum/thread-0261157080581406401-1-1.html
2. 我拿这个int8量化后的om模型到atlas 200i dk去跑,相比fp16的模型fps提升不多、模型大小也才从5.多MB降到4.多MB,这正常吗?
我的操作:
1. 使用yolov8项目在带GPU的Linux_x86_64服务器上进行训练,得到pt模型后导出为onnx模型。
2. 在x86_64 PC机上使用amct的命令行方式量化为int8模型。得到deploy_model.onnx和fake_quant_model.onnx。(按照这个链接操作https://gitee.com/ascend/samples/tree/master/python/level1_single_api/9_amct/amct_onnx/cmd)
这个链接的README.md中说使用 fake_quant_model.onnx(量化仿真模型)在 ONNX 执行框架 ONNX Runtime 进行精度仿真。
于是我在GPU服务器的yolov8项目执行val.py来测试精度,但是报错了:
详情看这个链接: https://yb.tencent.com/s/ahHSwCs2BMNx
我的问题:
1. 是我的onnx runtime版本有问题吗,感觉和这个链接的问题差不多https://www.hiascend.com/forum/thread-0261157080581406401-1-1.html
2. 我拿这个int8量化后的om模型到atlas 200i dk去跑,相比fp16的模型fps提升不多、模型大小也才从5.多MB降到4.多MB,这正常吗?