算子替换信息:
NPU不支持模型原本使用的torchvision.ops.deform_conv2d算子,使用 mmcv.ops.ModulatedDeformConv2替换。此外也尝试过torchvision_npu.ops.deform_conv2d算子,性能最好到2.87 its/s。
基本优化手段后的性能

距离客户要求还差3倍;
Profiling观察结论:
(1)推理的最后阶段有Conv2d算子耗时最长;
(2)除去Conv2d算子,其余部分统计,free占比高,属于单算子调度产生的性能瓶颈; 
希望咨询一下有效的性能优化手段或优化方向。
算子替换信息:
NPU不支持模型原本使用的
torchvision.ops.deform_conv2d算子,使用mmcv.ops.ModulatedDeformConv2替换。此外也尝试过torchvision_npu.ops.deform_conv2d算子,性能最好到2.87 its/s。基本优化手段后的性能
距离客户要求还差3倍;
Profiling观察结论:
(1)推理的最后阶段有Conv2d算子耗时最长;
(2)除去Conv2d算子,其余部分统计,free占比高,属于单算子调度产生的性能瓶颈;