上一期对比了AI pro 和 RK3588 的CPU性能,AI pro 落后2-4倍。在这种不利开局下,实测 AI pro 在 NPU 性能上反超了 RK3588。同时还测试了“同价位”的RTX2060,瘦死的 NVIDIA 骆驼比这两匹马大。
纸面参数对比
从纸面参数上,AI pro 是领先的
- AI pro 的NPU算力 8TOPs,超过了 RK3588 的 6TOPs。
- RK3588的另外讨厌之处在于其6T算力是平均分配到3个独立的核心上,用户的模型只能调用1个核心(因为不能跨节点),因此单模型最大算力是2T。只有创建3个网络模型,平均分配到3个NPU核心,才能最大程度利用上RK3588的算力 —— 这要求你项目的任务是可以并行的,即使这样编程也很痛苦。
测试方案:
具体实测,我使用 resnet50 和 yolov8n,它们是图像识别和目标检测的热门模型。接着在两台机器上部署“int8量化后模型”,测试 NPU 的性能差异。此外还请出了NVIDIA的甜品级显卡,RTX2060,4年前的产品,现在二手的价格也只有¥800,与AI pro & RK3588 都是同价位的对手。
结果:
- 单任务场景下(用户一般场景),AI pro 都比 RK3588 更快。此时RK3588只有1个NPU核心在运行。Restnet50 推断中,AI pro 是 2.7x 速度提升;YOLOv8n 是 3.9x 速度提升。
- 任务可以并行的情况,AI pro 和 RK3588 各有胜负。RK3588的3个NPU都充分利用。RK3588在resnet50中稍快,AI pro在YOLOv8n 快的更明显。
- YOLOv8n 的模型并没有“赛满” AI pro 和 RK3588 的NPU算力。两个机器的NPU利用率都卡在30-55%的瓶颈上,即使使用多线程加塞,也不能提升NPU利用率。 RTX2060 利用率任维持90%。因此NPU的利用率上不去既有模型算法问题,也有平台原因。
- 同价位的RTX2060 快很多,是 AI pro 的 3.5x (Resnet)和 7.5x (YOLOv8n) 速度提升。此时 RTX2060 还没开启INT8量化,量化之后,领先的幅度可能会更拉开。我搞不定 tensorrt 的量化,也就没进一步测试了。
总结
AI pro 的总体NPU性能是 RK3588 的2-4倍。在使用多任务并行时,两者基本没有差距。
但是对比NVIDIA大魔头还是逊色太多,老黄家的小弟都能胖揍 AI pro 和 RK3588。这有一方面是NVIDIA显卡高功耗占便宜。但NVIDIA的驱动可以充分发挥硬件的算力——YOLOV8n 在AI pro 和RK3588 都只能利用 50% NPU算力,在tensorrt上能到90% GPU使用率。华为优化昇腾NPU的驱动还有很长的路。
p.s. 我手上的AI pro 是8T版本,欢迎昇腾寄一块 20T的AIpro,我再做一期评测。
上一期对比了AI pro 和 RK3588 的CPU性能,AI pro 落后2-4倍。在这种不利开局下,实测 AI pro 在 NPU 性能上反超了 RK3588。同时还测试了“同价位”的RTX2060,瘦死的 NVIDIA 骆驼比这两匹马大。
纸面参数对比
从纸面参数上,AI pro 是领先的
测试方案:
具体实测,我使用 resnet50 和 yolov8n,它们是图像识别和目标检测的热门模型。接着在两台机器上部署“int8量化后模型”,测试 NPU 的性能差异。此外还请出了NVIDIA的甜品级显卡,RTX2060,4年前的产品,现在二手的价格也只有¥800,与AI pro & RK3588 都是同价位的对手。
结果:
总结
AI pro 的总体NPU性能是 RK3588 的2-4倍。在使用多任务并行时,两者基本没有差距。
但是对比NVIDIA大魔头还是逊色太多,老黄家的小弟都能胖揍 AI pro 和 RK3588。这有一方面是NVIDIA显卡高功耗占便宜。但NVIDIA的驱动可以充分发挥硬件的算力——YOLOV8n 在AI pro 和RK3588 都只能利用 50% NPU算力,在tensorrt上能到90% GPU使用率。华为优化昇腾NPU的驱动还有很长的路。
p.s. 我手上的AI pro 是8T版本,欢迎昇腾寄一块 20T的AIpro,我再做一期评测。