公司自研基于Transformer架构的CV模型,使用ACT工具,从onnx转om成功,并能正常推理。
使用atc工具导出的命令如下:
atc --framework=5 --model=./image_encoder_fb16.onnx --output=./image_encoder_om \
--input_format=NCHW --input_shape=image:1,3,960,960 --log=error --soc_version=Ascend910B2
CANN版本和驱动版本:最新版本
与nvidia T4 推理速度相比,推理速度耗时很高,不知道要从哪个方面着手,以提高推理速度,请论坛大牛指教。
已测试过的方案,如:精简onnx模型、量化模型均无法正常导出om模型,则无法正常推理。
使用性能分析工具对模型中的算子进行推理速度检测,对比详细内容如下:
公司自研基于Transformer架构的CV模型,使用ACT工具,从onnx转om成功,并能正常推理。
使用atc工具导出的命令如下:
atc --framework=5 --model=./image_encoder_fb16.onnx --output=./image_encoder_om \
--input_format=NCHW --input_shape=image:1,3,960,960 --log=error --soc_version=Ascend910B2
CANN版本和驱动版本:最新版本
与nvidia T4 推理速度相比,推理速度耗时很高,不知道要从哪个方面着手,以提高推理速度,请论坛大牛指教。
已测试过的方案,如:精简onnx模型、量化模型均无法正常导出om模型,则无法正常推理。
使用性能分析工具对模型中的算子进行推理速度检测,对比详细内容如下:
推理时最高耗时的算子
华为晟腾910B
(鲲鹏CPU)
onnx转
om
softmaxV2:871微秒
Conv:727微秒
BatchMatMulV2:726微秒
Nvidia T4
(X86 CPU)
onnx转
TensorRT engine
softmaxV2:0.67微秒
Conv:0.89微秒
BatchMatMulV2:0.54微秒