「AI pro 全面对比 RK3588」NPU 暂时领先,但仍远逊于NVIDIA(2)
收藏回复举报
「AI pro 全面对比 RK3588」NPU 暂时领先,但仍远逊于NVIDIA(2)
发表于2024-02-21 02:02:45
0 查看

上一期对比了AI pro 和 RK3588 的CPU性能,AI pro 落后2-4倍。在这种不利开局下,实测 AI pro 在 NPU 性能上反超了 RK3588。同时还测试了“同价位”的RTX2060,瘦死的 NVIDIA 骆驼比这两匹马大。

纸面参数对比

AI proRK3588
算力INT88T6T
备注3个核心平分

从纸面参数上,AI pro 是领先的

  • AI pro 的NPU算力 8TOPs,超过了 RK3588 的 6TOPs。
  • RK3588的另外讨厌之处在于其6T算力是平均分配到3个独立的核心上,用户的模型只能调用1个核心(因为不能跨节点),因此单模型最大算力是2T。只有创建3个网络模型,平均分配到3个NPU核心,才能最大程度利用上RK3588的算力 —— 这要求你项目的任务是可以并行的,即使这样编程也很痛苦。

测试方案:

具体实测,我使用 resnet50yolov8n,它们是图像识别和目标检测的热门模型。接着在两台机器上部署“int8量化后模型”,测试 NPU 的性能差异。此外还请出了NVIDIA的甜品级显卡,RTX2060,4年前的产品,现在二手的价格也只有¥800,与AI pro & RK3588 都是同价位的对手。

深度学习模型推断速度
AI proRK3588RK3588(多任务)RTX2060
推理平台MindX (INT8)RKNN (INT8)Tensorrt (fp16)
NPU 调用-第1个核心所有3个核心-
进程数113进程任务分摊1
Resnet50 速度2861063011010
YOLOv8n 速度852264634

结果:

  1. 单任务场景下(用户一般场景),AI pro 都比 RK3588 更快。此时RK3588只有1个NPU核心在运行。Restnet50 推断中,AI pro 是 2.7x 速度提升;YOLOv8n 是 3.9x 速度提升。
  2. 任务可以并行的情况,AI pro 和 RK3588 各有胜负。RK3588的3个NPU都充分利用。RK3588在resnet50中稍快,AI pro在YOLOv8n 快的更明显。
  3. YOLOv8n 的模型并没有“赛满” AI pro 和 RK3588 的NPU算力。两个机器的NPU利用率都卡在30-55%的瓶颈上,即使使用多线程加塞,也不能提升NPU利用率。 RTX2060 利用率任维持90%。因此NPU的利用率上不去既有模型算法问题,也有平台原因
  4. 同价位的RTX2060 快很多,是 AI pro 的 3.5x (Resnet)和 7.5x (YOLOv8n) 速度提升。此时 RTX2060 还没开启INT8量化,量化之后,领先的幅度可能会更拉开。我搞不定 tensorrt 的量化,也就没进一步测试了。

总结

AI pro 的总体NPU性能是 RK3588 的2-4倍。在使用多任务并行时,两者基本没有差距。

但是对比NVIDIA大魔头还是逊色太多,老黄家的小弟都能胖揍 AI pro 和 RK3588。这有一方面是NVIDIA显卡高功耗占便宜。但NVIDIA的驱动可以充分发挥硬件的算力——YOLOV8n 在AI pro 和RK3588 都只能利用 50% NPU算力,在tensorrt上能到90% GPU使用率。华为优化昇腾NPU的驱动还有很长的路。

p.s. 我手上的AI pro 是8T版本,欢迎昇腾寄一块 20T的AIpro,我再做一期评测。

本帖最后由 匿名用户2025/04/01 16:16:25 编辑

我要发帖子