路径:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2
执行:bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg
在尝试: mindie-server 推理时也出现 ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.conf 的错误
完整错误信息:
root@bogon:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2# bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg
[RUN_OPTION]: --run
[MODEL_PATH]: /home/models/MiniCPM-Llama3-V-2_5/
[IMAGE_PATH]: /home/models/a.jpeg
2024-12-12 06:32:31,317 [INFO] [pid: 2598] cpu_binding.py-205: rank_id: 0, device_id: 3, numa_id: 1, shard_devices: [3], cpus: [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63]
2024-12-12 06:32:31,319 [INFO] [pid: 2598] cpu_binding.py-231: process 2598, new_affinity is [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63], cpu count 32
Traceback (most recent call last):
File "<frozen runpy>", line 198, in _run_module_as_main
File "<frozen runpy>", line 88, in _run_code
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 435, in <module>
pa_runner = MultiModalPARunner(**input_dict)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 90, in __init__
super().__init__(**kwargs)
File "/usr/local/Ascend/llm_model/examples/run_pa.py", line 60, in __init__
self.model = ModelRunner(
^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/atb_llm/runner/model_runner.py", line 60, in __init__
router_ins = get_model(model_name_or_path, is_flash_causal_lm=is_flash_causal_lm, load_tokenizer=load_tokenizer,
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/atb_llm/models/__init__.py", line 69, in get_model
router = importlib.import_module(router_path)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/importlib/__init__.py", line 126, in import_module
return _bootstrap._gcd_import(name[level:], package, level)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "<frozen importlib._bootstrap>", line 1204, in _gcd_import
File "<frozen importlib._bootstrap>", line 1176, in _find_and_load
File "<frozen importlib._bootstrap>", line 1147, in _find_and_load_unlocked
File "<frozen importlib._bootstrap>", line 690, in _load_unlocked
File "<frozen importlib._bootstrap_external>", line 940, in exec_module
File "<frozen importlib._bootstrap>", line 241, in _call_with_frames_removed
File "/usr/local/Ascend/llm_model/atb_llm/models/minicpm_llama3_v2/router_minicpm_llama3_v2.py", line 7, in <module>
from .configuration_minicpm import MiniCPMVConfig
ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.configuration_minicpm'
[ERROR] 2024-12-12-06:32:31 (PID:2598, Device:-1, RankID:-1) ERR99999 UNKNOWN application exception
[2024-12-12 06:32:35,380] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 2598) of binary: /usr/local/python3.11.10/bin/python3.11
Traceback (most recent call last):
File "/usr/local/python3.11.10/bin/torchrun", line 8, in <module>
sys.exit(main())
^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper
return f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 806, in main
run(args)
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 797, in run
elastic_launch(
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 134, in __call__
return launch_agent(self._config, self._entrypoint, list(args))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
examples.models.minicpm_llama3_v2.minicpm_llama3_v2 FAILED
------------------------------------------------------------
Failures:
<NO_OTHER_FAILURES>
------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2024-12-12_06:32:35
host : bogon
rank : 0 (local_rank: 0)
exitcode : 1 (pid: 2598)
error_file: <N/A>
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html
============================================================
路径:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2
执行:bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg
在尝试: mindie-server 推理时也出现 ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.conf 的错误
完整错误信息:
root@bogon:/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2# bash run_pa.sh --run /home/models/MiniCPM-Llama3-V-2_5/ /home/models/a.jpeg
[RUN_OPTION]: --run
[MODEL_PATH]: /home/models/MiniCPM-Llama3-V-2_5/
[IMAGE_PATH]: /home/models/a.jpeg
2024-12-12 06:32:31,317 [INFO] [pid: 2598] cpu_binding.py-205: rank_id: 0, device_id: 3, numa_id: 1, shard_devices: [3], cpus: [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63]
2024-12-12 06:32:31,319 [INFO] [pid: 2598] cpu_binding.py-231: process 2598, new_affinity is [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63], cpu count 32
Traceback (most recent call last):
File "<frozen runpy>", line 198, in _run_module_as_main
File "<frozen runpy>", line 88, in _run_code
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 435, in <module>
pa_runner = MultiModalPARunner(**input_dict)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 90, in __init__
super().__init__(**kwargs)
File "/usr/local/Ascend/llm_model/examples/run_pa.py", line 60, in __init__
self.model = ModelRunner(
^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/atb_llm/runner/model_runner.py", line 60, in __init__
router_ins = get_model(model_name_or_path, is_flash_causal_lm=is_flash_causal_lm, load_tokenizer=load_tokenizer,
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/atb_llm/models/__init__.py", line 69, in get_model
router = importlib.import_module(router_path)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/importlib/__init__.py", line 126, in import_module
return _bootstrap._gcd_import(name[level:], package, level)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "<frozen importlib._bootstrap>", line 1204, in _gcd_import
File "<frozen importlib._bootstrap>", line 1176, in _find_and_load
File "<frozen importlib._bootstrap>", line 1147, in _find_and_load_unlocked
File "<frozen importlib._bootstrap>", line 690, in _load_unlocked
File "<frozen importlib._bootstrap_external>", line 940, in exec_module
File "<frozen importlib._bootstrap>", line 241, in _call_with_frames_removed
File "/usr/local/Ascend/llm_model/atb_llm/models/minicpm_llama3_v2/router_minicpm_llama3_v2.py", line 7, in <module>
from .configuration_minicpm import MiniCPMVConfig
ModuleNotFoundError: No module named 'atb_llm.models.minicpm_llama3_v2.configuration_minicpm'
[ERROR] 2024-12-12-06:32:31 (PID:2598, Device:-1, RankID:-1) ERR99999 UNKNOWN application exception
[2024-12-12 06:32:35,380] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 2598) of binary: /usr/local/python3.11.10/bin/python3.11
Traceback (most recent call last):
File "/usr/local/python3.11.10/bin/torchrun", line 8, in <module>
sys.exit(main())
^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper
return f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 806, in main
run(args)
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 797, in run
elastic_launch(
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 134, in __call__
return launch_agent(self._config, self._entrypoint, list(args))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
examples.models.minicpm_llama3_v2.minicpm_llama3_v2 FAILED
------------------------------------------------------------
Failures:
<NO_OTHER_FAILURES>
------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2024-12-12_06:32:35
host : bogon
rank : 0 (local_rank: 0)
exitcode : 1 (pid: 2598)
error_file: <N/A>
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html
============================================================