测试多个模型,比对npu和nvidia推理速度,算力关系是怎样的
收藏回复举报
测试多个模型,比对npu和nvidia推理速度,算力关系是怎样的
t('forum.solved') 已解决
发表于2025-02-28 10:38:19
0 查看

卡:300v pro,can:8.0rc3

atlas 300v pro官方算力描述:140 TOPS INT8,70 TFLOPS FP16

nvidia 3060算力:12.7 FP32 TFLOP、 24.9 RT TFLOPs 及 101 Tensor TFLOPs

实际测试了多个模型,只计算推理时间,不计算预处理和后处理,统一为fp16精度,atc转换指令示例如下:

atc --model=yolov7x.onnx --framework=5 --output=yolov7x --input_shape="images:1,3,640,640"  --soc_version=Ascend310P3 --precision_mode_v2=fp16

测试如下

sampleYolov7例程模型:npu 14ms,nvidia 8ms

个人检测模型:npu 5.3ms,nvidia 1.7ms

个人姿态模型:npu 6.8ms, nvidia 1.6ms

从上面可以看出,大概有2~4倍的差距,但是从算力描述上,似乎npu性能更好一下,所以有以下问题:

1.npu对标nvidia,算力的关系是怎样的

2.不同类型的模型,转换后速度差距较大,如果在保证精度的前提下,提升推理速度

我要发帖子