想要在300I Duo上部署大模型
收藏回复举报
想要在300I Duo上部署大模型
t('forum.solved') 已解决
发表于2025-02-17 16:29:51
0 查看

报错如下:

[root@ubuntu bin]# ./mindieservice_daemon 

'0', 'ep': '0', 'executor_type': 'LLM_EXECUTOR_PYTHON', 'globalRankIds': '', 'globalWorldSize': '0', 'interNodeKmcKsfMaster': 'tools/pmt/master/ksfa', 'interNodeKmcKsfStandby': 'tools/pmt/standby/ksfb', 'interNodeTLSEnabled': '1', 'interNodeTlsCaFiles': 'ca.pem,', 'interNodeTlsCaPath': 'security/grpc/ca/', 'interNodeTlsCert': 'security/grpc/certs/server.pem', 'interNodeTlsCrlFiles': 'server_crl.pem,', 'interNodeTlsCrlPath': 'security/grpc/certs/', 'interNodeTlsPk': 'security/grpc/keys/server.key.pem', 'interNodeTlsPkPwd': 'security/grpc/pass/mindie_server_key_pwd.txt', 'isMaster': '0', 'localIP': '', 'local_rank': '0', 'log_error': '1', 'log_file_num': '20', 'log_file_size': '20', 'log_info': '1', 'log_verbose': '0', 'log_warning': '1', 'masterIP': '', 'max_input_len': '2048', 'max_iter_times': '512', 'max_prefill_tokens': '8192', 'max_seq_len': '2560', 'model_cut_policy': 'standard', 'model_id': '/data/model/Qwen1.5-7B-Chat', 'model_instance_number': '1', 'model_instance_type': 'Standard', 'model_name': 'qwen', 'multiNodesInferEnabled': '0', 'multiNodesInferPort': '1120', 'npu_device_id': '0', 'npu_device_ids': '0', 'npu_mem': '-1', 'pp': '0', 'rank': '0', 'slaveIPs': '', 'speculation_gamma': '0', 'tp': '0', 'trust_remote_code': '0', 'world_size': '1'}
2025-02-17 16:12:46,085 [INFO] config.py:35 - do not init dmi config
2025-02-17 16:12:46,085 [INFO] standard_model.py:145 - rank id 0 get model config: {'backend_bin_path': '/usr/local/Ascend/mindie/1.0.0/mindie-llm/bin/', 'backend_log_file': '/usr/local/Ascend/mindie/1.0.0/mindie-service/logs/mindservice.log', 'backend_modelInstance_id': '0', 'backend_type': 'atb', 'block_size': '128', 'cpu_mem': '5', 'deploy_type': 'INTER_PROCESS', 'dp': '0', 'ep': '0', 'executor_type': 'LLM_EXECUTOR_PYTHON', 'globalRankIds': '', 'globalWorldSize': '0', 'interNodeKmcKsfMaster': 'tools/pmt/master/ksfa', 'interNodeKmcKsfStandby': 'tools/pmt/standby/ksfb', 'interNodeTLSEnabled': '1', 'interNodeTlsCaFiles': 'ca.pem,', 'interNodeTlsCaPath': 'security/grpc/ca/', 'interNodeTlsCert': 'security/grpc/certs/server.pem', 'interNodeTlsCrlFiles': 'server_crl.pem,', 'interNodeTlsCrlPath': 'security/grpc/certs/', 'interNodeTlsPk': 'security/grpc/keys/server.key.pem', 'interNodeTlsPkPwd': 'security/grpc/pass/mindie_server_key_pwd.txt', 'isMaster': '0', 'localIP': '', 'local_rank': '0', 'log_error': '1', 'log_file_num': '20', 'log_file_size': '20', 'log_info': '1', 'log_verbose': '0', 'log_warning': '1', 'masterIP': '', 'max_input_len': '2048', 'max_iter_times': '512', 'max_prefill_tokens': '8192', 'max_seq_len': '2560', 'model_cut_policy': 'standard', 'model_id': '/data/model/Qwen1.5-7B-Chat', 'model_instance_number': '1', 'model_instance_type': 'Standard', 'model_name': 'qwen', 'multiNodesInferEnabled': '0', 'multiNodesInferPort': '1120', 'npu_device_id': '0', 'npu_device_ids': '0', 'npu_mem': '-1', 'pp': '0', 'rank': '0', 'slaveIPs': '', 'speculation_gamma': '0', 'tp': '0', 'trust_remote_code': '0', 'world_size': '1'}
[2025-02-17 16:12:56,394] [256] [281467192078688] [llm] [INFO] [cpu_binding.py-212] : rank_id: 0, device_id: 0, numa_id: 0, shard_devices: [0, 1, 2, 3], cpus: [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30, 31]
[2025-02-17 16:12:56,397] [256] [281467192078688] [llm] [INFO] [cpu_binding.py-238] : process 256, new_affinity is [0, 1, 2, 3, 4, 5, 6, 7], cpu count 8
[2025-02-17 16:12:56,900] [256] [281467192078688] [llm] [INFO] [logging.py-331] : model_runner.quantize: None, model_runner.kv_quant_type: None, model_runner.fa_quant_type: None, model_runner.dtype: torch.float16
[2025-02-17 16:13:02,535] [256] [281467192078688] [llm] [INFO] [dist.py-77] : initialize_distributed has been Set
[2025-02-17 16:13:02,536] [256] [281467192078688] [llm] [INFO] [logging.py-331] : init tokenizer done: Qwen2TokenizerFast(name_or_path='/data/model/Qwen1.5-7B-Chat', vocab_size=151643, model_max_length=32768, is_fast=True, padding_side='left', truncation_side='right', special_tokens={'eos_token': '<|im_end|>', 'pad_token': '<|endoftext|>', 'additional_special_tokens': ['<|im_start|>', '<|im_end|>']}, clean_up_tokenization_spaces=False),  added_tokens_decoder={
        151643: AddedToken("<|endoftext|>", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True),
        151644: AddedToken("<|im_start|>", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True),
        151645: AddedToken("<|im_end|>", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True),
}

ator_backend
    return generator_cls(model_config)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 96, in __init__
    super().__init__(model_config)
  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_backend.py", line 107, in __init__
    self.model_wrapper = get_model_wrapper(model_config, backend_type)
                         ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/__init__.py", line 15, in get_model_wrapper
    return wrapper_cls(**model_config)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 46, in __init__
    self.model_runner.load_weights()
  File "/usr/local/Ascend/atb-models/atb_llm/runner/model_runner.py", line 139, in load_weights
    weights = Weights(
              ^^^^^^^^
  File "/usr/local/Ascend/atb-models/atb_llm/utils/weights.py", line 39, in __init__
    routing = self.load_routing(process_group)
              ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/local/Ascend/atb-models/atb_llm/utils/weights.py", line 63, in load_routing
    with safe_open(filename, framework="pytorch") as f:
         ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
safetensors_rust.SafetensorError: Error while deserializing header: HeaderTooLarge
2025-02-17 16:13:02,542 [ERROR] model.py:42 - [Model]   >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0'}
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
[ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
Process ForkServerProcess-9:
Process ForkServerProcess-3:
Traceback (most recent call last):
Traceback (most recent call last):
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 814, in _callmethod
    conn = self._tls.connection
           ^^^^^^^^^^^^^^^^^^^^
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 814, in _callmethod
    conn = self._tls.connection
           ^^^^^^^^^^^^^^^^^^^^
AttributeError: 'ForkAwareLocal' object has no attribute 'connection'
AttributeError: 'ForkAwareLocal' object has no attribute 'connection'

During handling of the above exception, another exception occurred:


During handling of the above exception, another exception occurred:

Traceback (most recent call last):
Traceback (most recent call last):
  File "/usr/lib64/python3.11/multiprocessing/process.py", line 314, in _bootstrap
    self.run()
  File "/usr/lib64/python3.11/multiprocessing/process.py", line 314, in _bootstrap
    self.run()
  File "/usr/lib64/python3.11/multiprocessing/process.py", line 108, in run
    self._target(*self._args, **self._kwargs)
  File "/usr/lib64/python3.11/multiprocessing/process.py", line 108, in run
    self._target(*self._args, **self._kwargs)
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 71, in wrapper
    raise exp
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 71, in wrapper
    raise exp
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 63, in wrapper
    func(*args, **kwargs)
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 63, in wrapper
    func(*args, **kwargs)
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 264, in task_distribute
    resource_proxy[SUB_PROCESS_STATE].append(True)
  File "/usr/local/Ascend/ascend-toolkit/latest/python/site-packages/tbe/common/repository_manager/route.py", line 264, in task_distribute
    resource_proxy[SUB_PROCESS_STATE].append(True)
  File "<string>", line 2, in append
  File "<string>", line 2, in append
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 818, in _callmethod
    self._connect()
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 818, in _callmethod
    self._connect()
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 805, in _connect
    conn = self._Client(self._token.address, authkey=self._authkey)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/lib64/python3.11/multiprocessing/managers.py", line 805, in _connect
    conn = self._Client(self._token.address, authkey=self._authkey)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/usr/lib64/python3.11/multiprocessing/connection.py", line 518, in Client
    c = SocketClient(address)
        ^^^^^^^^^^^^^^^^^^^^^
  File "/usr/lib64/python3.11/multiprocessing/connection.py", line 518, in Client
    c = SocketClient(address)
        ^^^^^^^^^^^^^^^^^^^^^
  File "/usr/lib64/python3.11/multiprocessing/connection.py", line 646, in SocketClient
    s.connect(address)
  File "/usr/lib64/python3.11/multiprocessing/connection.py", line 646, in SocketClient
    s.connect(address)
ConnectionRefusedError: [Errno 111] Connection refused
ConnectionRefusedError: [Errno 111] Connection refused
/usr/lib64/python3.11/multiprocessing/resource_tracker.py:254: UserWarning: resource_tracker: There appear to be 30 leaked semaphore objects to clean up at shutdown
  warnings.warn('resource_tracker: There appear to be %d '
Daemon is killing...
Killed

mindservice.log信息如下

[2025-02-17 11:18:01.153+08:00] [80] [82] [server] [INFO] [connector_launcher.cpp:124] : Child handler has been registered, register is back.
[2025-02-17 11:18:01.153+08:00] [80] [82] [server] [INFO] [share_memory.cpp:167] : total shared memory size:128518MB, and available shared memory size:128518MB.
[2025-02-17 11:18:01.153+08:00] [80] [82] [server] [INFO] [share_memory.cpp:168] : [ShareMemory::SharedMemorySizeCheck] shared memory size check success.
[2025-02-17 11:18:01.181+08:00] [80] [82] [server] [INFO] [share_memory.cpp:167] : total shared memory size:128518MB, and available shared memory size:128486MB.
[2025-02-17 11:18:01.181+08:00] [80] [82] [server] [INFO] [share_memory.cpp:168] : [ShareMemory::SharedMemorySizeCheck] shared memory size check success.
[2025-02-17 11:18:01.209+08:00] [80] [82] [server] [INFO] [share_memory.cpp:167] : total shared memory size:128518MB, and available shared memory size:128454MB.
[2025-02-17 11:18:01.209+08:00] [80] [82] [server] [INFO] [share_memory.cpp:168] : [ShareMemory::SharedMemorySizeCheck] shared memory size check success.
[2025-02-17 11:18:24.756016+08:00] [80] [82] [server] [WARN] [llm_daemon.cpp:64] : [Daemon] received exit signal[17]
[2025-02-17 11:18:24.756085+08:00] [80] [82] [server] [INFO] [llm_daemon.cpp:69] : Daemon wait pid with 221, status 9
[2025-02-17 11:18:24.756090+08:00] [80] [82] [server] [ERROR] [llm_daemon.cpp:74] : ERR: Daemon wait pid with 221 exit, Please check the service log or python log.
[2025-02-17 11:18:24.878427+08:00] [80] [80] [server] [WARN] [llm_daemon.cpp:64] : [Daemon] received exit signal[17]
[2025-02-17 11:18:24.878497+08:00] [80] [80] [server] [INFO] [llm_daemon.cpp:69] : Daemon wait pid with 223, status 9
[2025-02-17 11:18:24.878504+08:00] [80] [80] [server] [ERROR] [llm_daemon.cpp:74] : ERR: Daemon wait pid with 223 exit, Please check the service log or python log.
[2025-02-17 11:34:38.046+08:00] [2180] [2182] [server] [INFO] [connector_launcher.cpp:124] : Child handler has been registered, register is back.
[2025-02-17 11:34:38.046+08:00] [2180] [2182] [server] [INFO] [share_memory.cpp:167] : total shared memory size:128518MB, and available shared memory size:128518MB.

搜了下说是模型下载有问题,按道理我是git下载的,git clone https://www.modelscope.cn/Qwen/Qwen1.5-7B-Chat.git

驱动版本 :

-rw-rw-r-- 1 user user   6721679 Feb 14 10:32 Ascend-docker-runtime_6.0.RC3_linux-aarch64.run 

-rw-rw-r-- 1 user user 138390494 Feb 14 10:29 Ascend-hdk-310p-npu-driver_24.1.rc3_linux-aarch64.run 

-rw-rw-r-- 1 user user    904896 Feb 14 10:18 Ascend-hdk-310p-npu-firmware_7.5.0.1.129.run 

-rw-rw-r-- 1 user user   2885666 Feb 14 10:14 Ascend-mindx-toolbox_5.0.1_linux-aarch64.run

MindIE镜像:

swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie   1.0.0-300I-Duo-py311-openeuler24.03-lts   3a7f38bed48b   4 weeks ago   13.8GB 

docker部署:
sudo docker run -it --user root \

--name MindIE \

--ipc=host \

--net=host \

--device=/dev/davinci0 \

--device=/dev/davinci1 \

--device=/dev/davinci2 \

--device=/dev/davinci3 \

--device=/dev/davinci4 \

--device=/dev/davinci5 \

--device=/dev/davinci6 \

--device=/dev/davinci7 \

--device=/dev/davinci_manager \

--device=/dev/devmm_svm \

--device=/dev/hisi_hdc \

-v /usr/local/dcmi:/usr/local/dcmi \

-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \

-v /usr/local/Ascend/driver/lib64/common:/usr/local/Ascend/driver/lib64/common \

-v /usr/local/Ascend/driver/lib64/driver:/usr/local/Ascend/driver/lib64/driver \

-v /etc/ascend_install.info:/etc/ascend_install.info \

-v /etc/vnpu.cfg:/etc/vnpu.cfg \

-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \

-v /home/user/project/InternVL2:/data/InternVL2 \

-v /home/user/project/model:/data/model \

-e LANG=C.UTF-8 \ swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts /bin/bash

我用qwen1.5-7b-chat去测试,看手册只能单卡跑,配置文件如下:就改了worldsize和前面的那个https改成false

cke_36283.png

我要发帖子