卡:300v pro,can:8.0rc3
atlas 300v pro官方算力描述:140 TOPS INT8,70 TFLOPS FP16
nvidia 3060算力:12.7 FP32 TFLOP、 24.9 RT TFLOPs 及 101 Tensor TFLOPs
实际测试了多个模型,只计算推理时间,不计算预处理和后处理,统一为fp16精度,atc转换指令示例如下:
atc --model=yolov7x.onnx --framework=5 --output=yolov7x --input_shape="images:1,3,640,640" --soc_version=Ascend310P3 --precision_mode_v2=fp16
测试如下
sampleYolov7例程模型:npu 14ms,nvidia 8ms
个人检测模型:npu 5.3ms,nvidia 1.7ms
个人姿态模型:npu 6.8ms, nvidia 1.6ms
从上面可以看出,大概有2~4倍的差距,但是从算力描述上,似乎npu性能更好一下,所以有以下问题:
1.npu对标nvidia,算力的关系是怎样的
2.不同类型的模型,转换后速度差距较大,如果在保证精度的前提下,提升推理速度
卡:300v pro,can:8.0rc3
atlas 300v pro官方算力描述:140 TOPS INT8,70 TFLOPS FP16
nvidia 3060算力:12.7 FP32 TFLOP、 24.9 RT TFLOPs 及 101 Tensor TFLOPs
实际测试了多个模型,只计算推理时间,不计算预处理和后处理,统一为fp16精度,atc转换指令示例如下:
atc --model=yolov7x.onnx --framework=5 --output=yolov7x --input_shape="images:1,3,640,640" --soc_version=Ascend310P3 --precision_mode_v2=fp16
测试如下
sampleYolov7例程模型:npu 14ms,nvidia 8ms
个人检测模型:npu 5.3ms,nvidia 1.7ms
个人姿态模型:npu 6.8ms, nvidia 1.6ms
从上面可以看出,大概有2~4倍的差距,但是从算力描述上,似乎npu性能更好一下,所以有以下问题:
1.npu对标nvidia,算力的关系是怎样的
2.不同类型的模型,转换后速度差距较大,如果在保证精度的前提下,提升推理速度