镜像:1.0.RC3镜像, 模型:MiniCPM-Llama3-V-2_5
操作步骤,参考README.md:
1、将权重目录中的configuration_minicpm.py、resampler.py拷贝到${llm_path}/examples/atb_models/atb_llm/models/minicpm_llama3_v2目录下
2、bash ${script_path}/run_pa.sh --run ${weight_path} ${image_path}
日志如下:
[RUN_OPTION]: --run
[MODEL_PATH]: /home/models/MiniCPM-Llama3-V-2_5/
[IMAGE_PATH]: /home/models/
2024-12-17 07:30:48,166 [INFO] [pid: 3298] cpu_binding.py-205: rank_id: 0, device_id: 3, numa_id: 1, shard_devices: [3], cpus: [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63]
2024-12-17 07:30:48,168 [INFO] [pid: 3298] cpu_binding.py-231: process 3298, new_affinity is [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63], cpu count 32
2024-12-17 07:30:48,583 [INFO] [pid: 3298] logging.py-180: model_runner.quantize: None
, model_runner.kv_quant_type: None
, model_runner.dytpe: torch.float16
2024-12-17 07:30:53,542 [INFO] [pid: 3298] dist.py-79: initialize_distributed has been Set
…………………省略
2024-12-17 07:31:03,355 [INFO] [pid: 3298] logging.py-180: hbm_capacity(GB): 21.0390625, init_memory(GB): 3.366249999962747
/usr/local/python3.11.10/lib/python3.11/site-packages/transformers/models/auto/image_processing_auto.py:513: FutureWarning: The image_processor_class argument is deprecated and will be removed in v4.42. Please use `slow_image_processor_class`, or `fast_image_processor_class` instead
warnings.warn(
2024-12-17 07:31:04,449 [INFO] [pid: 3298] logging.py-180: ---------------begin warm_up---------------
2024-12-17 07:31:04,449 [INFO] [pid: 3298] cache.py-76: kv cache will allocate 0.28125GB memory
Traceback (most recent call last):
File "<frozen runpy>", line 198, in _run_module_as_main
File "<frozen runpy>", line 88, in _run_code
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 445, in <module>
pa_runner.warm_up()
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 187, in warm_up
req_list = [request_from_text_and_image(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 190, in <listcomp>
MultiModalRequestParams(new_input_texts[0],
~~~~~~~~~~~~~~~^^^
TypeError: 'NoneType' object is not subscriptable
[ERROR] 2024-12-17-07:31:06 (PID:3298, Device:0, RankID:-1) ERR99999 UNKNOWN application exception
[2024-12-17 07:31:12,276] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 3298) of binary: /usr/local/python3.11.10/bin/python3.11
Traceback (most recent call last):
File "/usr/local/python3.11.10/bin/torchrun", line 8, in <module>
sys.exit(main())
^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper
return f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 806, in main
run(args)
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 797, in run
elastic_launch(
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 134, in __call__
return launch_agent(self._config, self._entrypoint, list(args))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
examples.models.minicpm_llama3_v2.minicpm_llama3_v2 FAILED
------------------------------------------------------------
Failures:
<NO_OTHER_FAILURES>
------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2024-12-17_07:31:12
host : bogon
rank : 0 (local_rank: 0)
exitcode : 1 (pid: 3298)
error_file: <N/A>
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html
============================================================
镜像:1.0.RC3镜像, 模型:MiniCPM-Llama3-V-2_5
操作步骤,参考README.md:
1、将权重目录中的configuration_minicpm.py、resampler.py拷贝到${llm_path}/examples/atb_models/atb_llm/models/minicpm_llama3_v2目录下
2、bash ${script_path}/run_pa.sh --run ${weight_path} ${image_path}
日志如下:
[RUN_OPTION]: --run
[MODEL_PATH]: /home/models/MiniCPM-Llama3-V-2_5/
[IMAGE_PATH]: /home/models/
2024-12-17 07:30:48,166 [INFO] [pid: 3298] cpu_binding.py-205: rank_id: 0, device_id: 3, numa_id: 1, shard_devices: [3], cpus: [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63]
2024-12-17 07:30:48,168 [INFO] [pid: 3298] cpu_binding.py-231: process 3298, new_affinity is [32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 61, 62, 63], cpu count 32
2024-12-17 07:30:48,583 [INFO] [pid: 3298] logging.py-180: model_runner.quantize: None
, model_runner.kv_quant_type: None
, model_runner.dytpe: torch.float16
2024-12-17 07:30:53,542 [INFO] [pid: 3298] dist.py-79: initialize_distributed has been Set
…………………省略
2024-12-17 07:31:03,355 [INFO] [pid: 3298] logging.py-180: hbm_capacity(GB): 21.0390625, init_memory(GB): 3.366249999962747
/usr/local/python3.11.10/lib/python3.11/site-packages/transformers/models/auto/image_processing_auto.py:513: FutureWarning: The image_processor_class argument is deprecated and will be removed in v4.42. Please use `slow_image_processor_class`, or `fast_image_processor_class` instead
warnings.warn(
2024-12-17 07:31:04,449 [INFO] [pid: 3298] logging.py-180: ---------------begin warm_up---------------
2024-12-17 07:31:04,449 [INFO] [pid: 3298] cache.py-76: kv cache will allocate 0.28125GB memory
Traceback (most recent call last):
File "<frozen runpy>", line 198, in _run_module_as_main
File "<frozen runpy>", line 88, in _run_code
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 445, in <module>
pa_runner.warm_up()
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 187, in warm_up
req_list = [request_from_text_and_image(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/Ascend/llm_model/examples/models/minicpm_llama3_v2/minicpm_llama3_v2.py", line 190, in <listcomp>
MultiModalRequestParams(new_input_texts[0],
~~~~~~~~~~~~~~~^^^
TypeError: 'NoneType' object is not subscriptable
[ERROR] 2024-12-17-07:31:06 (PID:3298, Device:0, RankID:-1) ERR99999 UNKNOWN application exception
[2024-12-17 07:31:12,276] torch.distributed.elastic.multiprocessing.api: [ERROR] failed (exitcode: 1) local_rank: 0 (pid: 3298) of binary: /usr/local/python3.11.10/bin/python3.11
Traceback (most recent call last):
File "/usr/local/python3.11.10/bin/torchrun", line 8, in <module>
sys.exit(main())
^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/__init__.py", line 346, in wrapper
return f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 806, in main
run(args)
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/run.py", line 797, in run
elastic_launch(
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 134, in __call__
return launch_agent(self._config, self._entrypoint, list(args))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/usr/local/python3.11.10/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 264, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:
============================================================
examples.models.minicpm_llama3_v2.minicpm_llama3_v2 FAILED
------------------------------------------------------------
Failures:
<NO_OTHER_FAILURES>
------------------------------------------------------------
Root Cause (first observed failure):
[0]:
time : 2024-12-17_07:31:12
host : bogon
rank : 0 (local_rank: 0)
exitcode : 1 (pid: 3298)
error_file: <N/A>
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html
============================================================