使用MindIE,1.0.RC3镜像,测试MiniCPM-Llama3-V-2_5报错, No module named 'atb_llm.models.minicpm_llama3_v2.configuration_minicpm'
收藏回复举报
使用MindIE,1.0.RC3镜像,测试MiniCPM-Llama3-V-2_5报错, No module named 'atb_llm.models.minicpm_llama3_v2.configuration_minicpm'
t('forum.solved') 已解决
发表于2024-12-12 14:39:40
0 查看

路径:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2

执行:bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg

在尝试: mindie-server 推理时也出现 ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.conf 的错误

完整错误信息:

root@bogon:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2# bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg  

[RUN_OPTION]: --run 

[MODEL_PATH]: /home/models/MiniCPM-Llama3-V-2_5/ 

[IMAGE_PATH]: /home/models/a.jpeg 

2024-12-12 06:32:31,317 [INFO] [pid: 2598] cpu_binding.py-205: rank_id: 0, device_id: 3, numa_id: 1, shard_devices: [3], cpus: [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63] 

2024-12-12 06:32:31,319 [INFO] [pid: 2598] cpu_binding.py-231: process 2598, new_affinity is [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63], cpu count 32 

Traceback (most recent call last): 

  File "<frozen runpy>", line 198, in _run_module_as_main 

  File "<frozen runpy>", line 88, in _run_code 

  File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 435, in <module> 

    pa_runner = MultiModalPARunner(**input_dict) 

                ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ 

  File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 90, in __init__ 

    super().__init__(**kwargs) 

  File "/usr/local/Ascend/llm_model/examples/run_pa.py", line 60, in __init__ 

    self.model = ModelRunner( 

                 ^^^^^^^^^^^^ 

  File "/usr/local/Ascend/llm_model/atb_llm/runner/model_runner.py", line 60, in __init__ 

    router_ins = get_model(model_name_or_path, is_flash_causal_lm=is_flash_causal_lm, load_tokenizer=load_tokenizer, 

                 ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ 

  File "/usr/local/Ascend/llm_model/atb_llm/models/__init__.py", line 69, in get_model 

    router = importlib.import_module(router_path) 

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ 

  File "/usr/local/python3.11.10/lib/python3.11/importlib/__init__.py", line 126, in import_module 

    return _bootstrap._gcd_import(name[level:], package, level) 

           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ 

  File "<frozen importlib._bootstrap>", line 1204, in _gcd_import 

  File "<frozen importlib._bootstrap>", line 1176, in _find_and_load 

  File "<frozen importlib._bootstrap>", line 1147, in _find_and_load_unlocked 

  File "<frozen importlib._bootstrap>", line 690, in _load_unlocked 

  File "<frozen importlib._bootstrap_external>", line 940, in exec_module 

  File "<frozen importlib._bootstrap>", line 241, in _call_with_frames_removed 

  File "/usr/local/Ascend/llm_model/atb_llm/models/minicpm_llama3_v2/router_minicpm_llama3_v2.py", line 7, in <module> 

    from .configuration_minicpm import MiniCPMVConfig 

ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.configuration_minicpm' 

[ERROR] 2024-12-12-06:32:31 (PID:2598, Device:-1, RankID:-1) ERR99999 UNKNOWN application exception 

[2024-12-12 06:32:35,380] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 2598) of binary: /usr/local/python3.11.10/bin/python3.11 

Traceback (most recent call last): 

  File "/usr/local/python3.11.10/bin/torchrun", line 8, in <module> 

    sys.exit(main()) 

             ^^^^^^ 

  File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper 

    return f(*args, **kwargs) 

           ^^^^^^^^^^^^^^^^^^ 

  File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 806, in main 

    run(args) 

  File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 797, in run 

    elastic_launch( 

  File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 134, in __call__ 

    return launch_agent(self._config, self._entrypoint, list(args)) 

           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ 

  File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent 

    raise ChildFailedError( 

torch.distributed.elastic.multiprocessing.errors.ChildFailedError:  

============================================================ 

examples.models.minicpm_llama3_v2.minicpm_llama3_v2 FAILED 

------------------------------------------------------------ 

Failures: 

  <NO_OTHER_FAILURES> 

------------------------------------------------------------ 

Root Cause (first observed failure): 

[0]: 

  time      : 2024-12-12_06:32:35 

  host      : bogon 

  rank      : 0 (local_rank: 0) 

  exitcode  : 1 (pid: 2598) 

  error_file: <N/A> 

  traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html 

============================================================ 

本帖最后由 匿名用户2024/12/12 14:41:04 编辑

我要发帖子