公司自研基于Transformer架构的CV模型,onnx转om成功,并能正常推理,但模型性能下降,求助~
收藏回复举报
公司自研基于Transformer架构的CV模型,onnx转om成功,并能正常推理,但模型性能下降,求助~
t('forum.solved') 已解决
新人帖
发表于2026-02-05 19:08:50
0 查看

公司自研基于Transformer架构的CV模型,使用ACT工具,从onnx转om成功,并能正常推理。

使用atc工具导出的命令如下:

atc --framework=5 --model=./image_encoder_fb16.onnx --output=./image_encoder_om  \

   --input_format=NCHW --input_shape=image:1,3,960,960 --log=error --soc_version=Ascend910B2

CANN版本和驱动版本:最新版本

与nvidia T4 推理速度相比,推理速度耗时很高,不知道要从哪个方面着手,以提高推理速度,请论坛大牛指教。

已测试过的方案,如:精简onnx模型、量化模型均无法正常导出om模型,则无法正常推理。

使用性能分析工具对模型中的算子进行推理速度检测,对比详细内容如下:

算力卡推理精度模型格式推理耗时

推理时最高耗时的算子

备注

华为晟腾910B

(鲲鹏CPU)

FP16

onnx转

om

33毫秒一张图

softmaxV2:871微秒

Conv:727微秒

BatchMatMulV2:726微秒

推理网络有8层,这只是一层的推理耗时,如果要全计算耗时,乘以8即可

Nvidia T4

(X86 CPU)

FP16

onnx转

TensorRT engine

0.22毫秒一张图

softmaxV2:0.67微秒

Conv:0.89微秒

BatchMatMulV2:0.54微秒

我要发帖子