环境:Atlas 200I DK A2
前提:进行算力测试,使用官方提供的MindX DL测试模型极限算力,确实可以得到20TOPS@INT8或者10TFLOPS@FP16。
(1)问题1描述:在不进行后处理的情况下,启动6个推理线程,每个推理线程均加载了Yolov5N FP16模型,此时NPU负载大概在37%左右,平均每秒推理140张图片左右;继续增加推理线程至7路,8路,9路,这种情况下推理帧率反而下降了。
疑问:根据上述现象,怀疑是模型的并行能力不足导致的,请问有什么方法能够增加小参数量模型(如Yolo系列的n,s模型)的并行推理能力?
(2)问题2描述:在不进行后处理的情况下,运行Yolov7X FP16模型,无论启动几个线程,NPU负载大概在85%左右,平均每秒推理17张图片左右;
疑问:根据上述现象,是否已经说明NPU负载达到了极限,为何始终维持在85%无法提升
环境:Atlas 200I DK A2
前提:进行算力测试,使用官方提供的MindX DL测试模型极限算力,确实可以得到20TOPS@INT8或者10TFLOPS@FP16。
(1)问题1描述:在不进行后处理的情况下,启动6个推理线程,每个推理线程均加载了Yolov5N FP16模型,此时NPU负载大概在37%左右,平均每秒推理140张图片左右;继续增加推理线程至7路,8路,9路,这种情况下推理帧率反而下降了。
疑问:根据上述现象,怀疑是模型的并行能力不足导致的,请问有什么方法能够增加小参数量模型(如Yolo系列的n,s模型)的并行推理能力?
(2)问题2描述:在不进行后处理的情况下,运行Yolov7X FP16模型,无论启动几个线程,NPU负载大概在85%左右,平均每秒推理17张图片左右;
疑问:根据上述现象,是否已经说明NPU负载达到了极限,为何始终维持在85%无法提升