算力切分容器中进行模型推理出现的Load model from file return 507009报错(论坛中未检索到类似错误提示及有效解决方案)
收藏回复举报
算力切分容器中进行模型推理出现的Load model from file return 507009报错(论坛中未检索到类似错误提示及有效解决方案)
t('forum.solved') 已解决
发表于2025-09-08 16:19:24
0 查看

一、问题概况

宿主机硬件平台:Atlas 300I Pro

CANN版本:8.0.RC3;

驱动版本:24.1.RC2;

系统:"openEuler 22.03 LTS"

目前是在该硬件平台上进行算力切分性能的测试,首先已经在未经过算力切分操作的单个容器中完成了yolov8模型的推理,正常推理的日志如下:

[root@localhost out]# ./main
[INFO]  Acl init ok
[INFO]  Open device 0 ok
[INFO]  Use default context currently
[INFO]  dvpp init resource ok
[INFO]  Load model ../model/yolov8s.om success
[INFO]  Create model description success
[INFO]  Create model(../model/yolov8s.om) output success
[INFO]  Init model ../model/yolov8s.om success
[INFO]  filter boxes by confidence threshold > 0.100000 success, boxes size is 64
[INFO]  filter boxes by NMS threshold > 0.450000 success, result size is 6
[INFO]  object detect [0.829102:car] success
[INFO]  object detect [0.826660:car] success
[INFO]  object detect [0.818848:car] success
[INFO]  object detect [0.791992:car] success
[INFO]  object detect [0.786621:car] success
[INFO]  object detect [0.656738:car] success
[INFO]  Inference elapsed time : 4.841638 ms , fps is 206.541670
[INFO]  filter boxes by confidence threshold > 0.100000 success, boxes size is 53
[INFO]  filter boxes by NMS threshold > 0.450000 success, result size is 5

[INFO]  Unload model ../model/yolov8s.om success
[INFO]  destroy context ok
[INFO]  Reset device 0 ok
[INFO]  Finalize acl ok

之后按照vir04和vir04_3c策略进行动态算力切分,各自容器内固件驱动CANN工具均正常,并在两个容器中分别调用切分后的NPU进行模型推理:

容器1基本情况:
image.png

容器2基本情况:

image.png

推理过程中出现了下面的报错:

[root@localhost out]# ./main
参数配置时间:0.124501ms
[INFO]  Acl init ok
[INFO]  Open device 0 ok
[INFO]  Use default context currently
[INFO]  dvpp init resource ok
[ERROR]  Load model(../model/yolov8s.om) from file return 507009
[ERROR]  Load model ../model/yolov8s.om from file failed
环境初始化时间:3054.16ms
图片预处理时间:10.2297ms
图片预处理FPS:97.7543
[ERROR]  Create input failed for no input data
[ERROR]  Execute model(../model/yolov8s.om) error:100000
[ERROR]  execute model failed, errorCode is 309
平均推理时间:0.179584ms
推理FPS:5568.42
[ERROR]  Inference failed, errorCode is 1
[INFO]  Model(../model/yolov8s.om) had not been loaded or unload already
[INFO]  destroy context ok
[INFO]  Reset device 0 ok
[INFO]  Finalize acl ok
[root@localhost out]#


问题出在模型load阶段,排查了模型路径及名称,发现并不是这一部分的错误,想请教一下华为工程师,为什么会在算力切分场景下会出现这个报错。

备注:

atc模型转换命令:atc --model=yolov8s.onnx --framework=5 --output=yolov8s_new --input_shape="images:1,3,640,640" --soc_version=Ascend310P3 --insert_op_conf=aipp.cfg 

本帖最后由 匿名用户2025/09/09 09:52:39 编辑

我要发帖子