docker vllm-ascend容器启动模型失败
收藏回复举报
docker vllm-ascend容器启动模型失败
t('forum.solved') 已解决
发表于2025-06-25 01:13:23
0 查看

本来想提交工单,但是提了八次都提示我提交失败,只能发帖求助o(╥﹏╥)o

我安装了docker版的vllm-ascend,启动大模型时报错,错误日志如下

驱动版本为25.0.rc1.1,固件版本为7.7.0.1.231, 均安装正常,系统为欧拉22.03,docker版本为24.0.8,安装的镜像为quay.io/ascend/vllm-ascend:v0.7.3-dev-openeuler

创建容器命令为

docker run -itd \

    --name vllm-ascend-env \

    --device /dev/davinci0 \

    --device /dev/davinci1 \

    --device /dev/davinci_manager \

    --device /dev/devmm_svm \

    --device /dev/hisi_hdc \

    -v /usr/local/dcmi:/usr/local/dcmi \

    -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \

    -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \

    -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \

    -v /etc/ascend_install.info:/etc/ascend_install.info \

    -v /home/models:/home/models \

    -it quay.io/ascend/vllm-ascend:v0.7.3-dev-openeuler bash

启动大模型时报错 ,日志如下:

[root@09be6b1eee4f models]# vllm serve /home/models/Qwen2.5-7B --dtype auto --port 8000

INFO 06-24 16:50:05 __init__.py:30] Available plugins for group vllm.platform_plugins:

INFO 06-24 16:50:05 __init__.py:32] name=ascend, value=vllm_ascend:register

INFO 06-24 16:50:05 __init__.py:34] all available plugins for group vllm.platform_plugins will be loaded.

INFO 06-24 16:50:05 __init__.py:36] set environment variable VLLM_PLUGINS to control which plugins to load.

INFO 06-24 16:50:05 __init__.py:44] plugin ascend loaded.

INFO 06-24 16:50:05 __init__.py:198] Platform plugin ascend is activated

WARNING:root:Warning: Failed to register custom ops, all custom ops will be disabled

INFO 06-24 16:50:05 __init__.py:30] Available plugins for group vllm.general_plugins:

INFO 06-24 16:50:05 __init__.py:32] name=ascend_enhanced_model, value=vllm_ascend:register_model

INFO 06-24 16:50:05 __init__.py:34] all available plugins for group vllm.general_plugins will be loaded.

INFO 06-24 16:50:05 __init__.py:36] set environment variable VLLM_PLUGINS to control which plugins to load.

INFO 06-24 16:50:05 __init__.py:44] plugin ascend_enhanced_model loaded.

WARNING 06-24 16:50:05 registry.py:351] Model architecture Qwen2VLForConditionalGeneration is already registered, and will be overwritten by the new model class vllm_ascend.models.qwen2_vl:AscendQwen2VLForConditionalGeneration.

WARNING 06-24 16:50:05 registry.py:351] Model architecture Qwen2_5_VLForConditionalGeneration is already registered, and will be overwritten by the new model class vllm_ascend.models.qwen2_5_vl:AscendQwen2_5_VLForConditionalGeneration.

WARNING 06-24 16:50:05 registry.py:351] Model architecture DeepseekV2ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v2:CustomDeepseekV2ForCausalLM.

WARNING 06-24 16:50:05 registry.py:351] Model architecture DeepseekV3ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v2:CustomDeepseekV3ForCausalLM.

WARNING 06-24 16:50:05 registry.py:351] Model architecture DeepSeekMTPModel is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_mtp:CustomDeepSeekMTP.

INFO 06-24 16:50:05 importing.py:16] Triton not installed or not compatible; certain GPU-related functions will not be available.

INFO 06-24 16:50:05 api_server.py:912] vLLM API server version 0.7.3

INFO 06-24 16:50:05 api_server.py:913] args: Namespace(subparser='serve', model_tag='/home/models/Qwen2.5-7B', config='', host=None, port=8000, uvicorn_log_level='info', allow_credentials=False, allowed_origins=['*'], allowed_methods=['*'], allowed_headers=['*'], api_key=None, lora_modules=None, prompt_adapters=None, chat_template=None, chat_template_content_format='auto', response_role='assistant', ssl_keyfile=None, ssl_certfile=None, ssl_ca_certs=None, ssl_cert_reqs=0, root_path=None, middleware=[], return_tokens_as_token_ids=False, disable_frontend_multiprocessing=False, enable_request_id_headers=False, enable_auto_tool_choice=False, enable_reasoning=False, reasoning_parser=None, tool_call_parser=None, tool_parser_plugin='', model='/home/models/Qwen2.5-7B', task='auto', tokenizer=None, skip_tokenizer_init=False, revision=None, code_revision=None, tokenizer_revision=None, tokenizer_mode='auto', trust_remote_code=False, allowed_local_media_path=None, download_dir=None, load_format='auto', config_format=<ConfigFormat.AUTO: 'auto'>, dtype='auto', kv_cache_dtype='auto', max_model_len=None, guided_decoding_backend='xgrammar', logits_processor_pattern=None, model_impl='auto', distributed_executor_backend=None, pipeline_parallel_size=1, tensor_parallel_size=1, max_parallel_loading_workers=None, ray_workers_use_nsight=False, block_size=None, enable_prefix_caching=None, disable_sliding_window=False, use_v2_block_manager=True, num_lookahead_slots=0, seed=0, swap_space=4, cpu_offload_gb=0, gpu_memory_utilization=0.9, num_gpu_blocks_override=None, max_num_batched_tokens=None, max_num_partial_prefills=1, max_long_partial_prefills=1, long_prefill_token_threshold=0, max_num_seqs=None, max_logprobs=20, disable_log_stats=False, quantization=None, rope_scaling=None, rope_theta=None, hf_overrides=None, enforce_eager=False, max_seq_len_to_capture=8192, disable_custom_all_reduce=False, tokenizer_pool_size=0, tokenizer_pool_type='ray', tokenizer_pool_extra_config=None, limit_mm_per_prompt=None, mm_processor_kwargs=None, disable_mm_preprocessor_cache=False, enable_lora=False, enable_lora_bias=False, max_loras=1, max_lora_rank=16, lora_extra_vocab_size=256, lora_dtype='auto', long_lora_scaling_factors=None, max_cpu_loras=None, fully_sharded_loras=False, enable_prompt_adapter=False, max_prompt_adapters=1, max_prompt_adapter_token=0, device='auto', num_scheduler_steps=1, multi_step_stream_outputs=True, scheduler_delay_factor=0.0, enable_chunked_prefill=None, speculative_model=None, speculative_model_quantization=None, num_speculative_tokens=None, speculative_disable_mqa_scorer=False, speculative_draft_tensor_parallel_size=None, speculative_max_model_len=None, speculative_disable_by_batch_size=None, ngram_prompt_lookup_max=None, ngram_prompt_lookup_min=None, spec_decoding_acceptance_method='rejection_sampler', typical_acceptance_sampler_posterior_threshold=None, typical_acceptance_sampler_posterior_alpha=None, disable_logprobs_during_spec_decoding=None, model_loader_extra_config=None, ignore_patterns=[], preemption_mode=None, served_model_name=None, qlora_adapter_name_or_path=None, otlp_traces_endpoint=None, collect_detailed_traces=None, disable_async_output_proc=False, scheduling_policy='fcfs', scheduler_cls='vllm.core.scheduler.Scheduler', override_neuron_config=None, override_pooler_config=None, compilation_config=None, kv_transfer_config=None, worker_cls='auto', generation_config=None, override_generation_config=None, enable_sleep_mode=False, calculate_kv_scales=False, additional_config=None, disable_log_requests=False, max_log_len=None, disable_fastapi_docs=False, enable_prompt_tokens_details=False, dispatch_function=<function ServeSubcommand.cmd at 0x7f30970ee4d0>)

INFO 06-24 16:50:05 api_server.py:209] Started engine process with PID 371

INFO 06-24 16:50:08 __init__.py:30] Available plugins for group vllm.platform_plugins:

INFO 06-24 16:50:08 __init__.py:32] name=ascend, value=vllm_ascend:register

INFO 06-24 16:50:08 __init__.py:34] all available plugins for group vllm.platform_plugins will be loaded.

INFO 06-24 16:50:08 __init__.py:36] set environment variable VLLM_PLUGINS to control which plugins to load.

INFO 06-24 16:50:08 __init__.py:44] plugin ascend loaded.

INFO 06-24 16:50:08 __init__.py:198] Platform plugin ascend is activated

WARNING:root:Warning: Failed to register custom ops, all custom ops will be disabled

INFO 06-24 16:50:09 __init__.py:30] Available plugins for group vllm.general_plugins:

INFO 06-24 16:50:09 __init__.py:32] name=ascend_enhanced_model, value=vllm_ascend:register_model

INFO 06-24 16:50:09 __init__.py:34] all available plugins for group vllm.general_plugins will be loaded.

INFO 06-24 16:50:09 __init__.py:36] set environment variable VLLM_PLUGINS to control which plugins to load.

INFO 06-24 16:50:09 __init__.py:44] plugin ascend_enhanced_model loaded.

WARNING 06-24 16:50:09 registry.py:351] Model architecture Qwen2VLForConditionalGeneration is already registered, and will be overwritten by the new model class vllm_ascend.models.qwen2_vl:AscendQwen2VLForConditionalGeneration.

WARNING 06-24 16:50:09 registry.py:351] Model architecture Qwen2_5_VLForConditionalGeneration is already registered, and will be overwritten by the new model class vllm_ascend.models.qwen2_5_vl:AscendQwen2_5_VLForConditionalGeneration.

WARNING 06-24 16:50:09 registry.py:351] Model architecture DeepseekV2ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v2:CustomDeepseekV2ForCausalLM.

WARNING 06-24 16:50:09 registry.py:351] Model architecture DeepseekV3ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v2:CustomDeepseekV3ForCausalLM.

WARNING 06-24 16:50:09 registry.py:351] Model architecture DeepSeekMTPModel is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_mtp:CustomDeepSeekMTP.

INFO 06-24 16:50:09 importing.py:16] Triton not installed or not compatible; certain GPU-related functions will not be available.

INFO 06-24 16:50:10 config.py:549] This model supports multiple tasks: {'score', 'classify', 'embed', 'reward', 'generate'}. Defaulting to 'generate'.

WARNING 06-24 16:50:10 arg_utils.py:1197] The model has a long context length (131072). This may cause OOM errors during the initial memory profiling phase, or result in low performance due to small KV cache space. Consider setting --max-model-len to a smaller value.

INFO 06-24 16:50:13 config.py:549] This model supports multiple tasks: {'embed', 'score', 'reward', 'classify', 'generate'}. Defaulting to 'generate'.

WARNING 06-24 16:50:13 arg_utils.py:1197] The model has a long context length (131072). This may cause OOM errors during the initial memory profiling phase, or result in low performance due to small KV cache space. Consider setting --max-model-len to a smaller value.

INFO 06-24 16:50:14 llm_engine.py:234] Initializing a V0 LLM engine (v0.7.3) with config: model='/home/models/Qwen2.5-7B', speculative_config=None, tokenizer='/home/models/Qwen2.5-7B', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, override_neuron_config=None, tokenizer_revision=None, trust_remote_code=False, dtype=torch.bfloat16, max_seq_len=131072, download_dir=None, load_format=auto, tensor_parallel_size=1, pipeline_parallel_size=1, disable_custom_all_reduce=False, quantization=None, enforce_eager=False, kv_cache_dtype=auto,  device_config=npu, decoding_config=DecodingConfig(guided_decoding_backend='xgrammar'), observability_config=ObservabilityConfig(otlp_traces_endpoint=None, collect_model_forward_time=False, collect_model_execute_time=False), seed=0, served_model_name=/home/models/Qwen2.5-7B, num_scheduler_steps=1, multi_step_stream_outputs=True, enable_prefix_caching=False, chunked_prefill_enabled=False, use_async_output_proc=True, disable_mm_preprocessor_cache=False, mm_processor_kwargs=None, pooler_config=None, compilation_config={"splitting_ops":[],"compile_sizes":[],"cudagraph_capture_sizes":[256,248,240,232,224,216,208,200,192,184,176,168,160,152,144,136,128,120,112,104,96,88,80,72,64,56,48,40,32,24,16,8,4,2,1],"max_capture_size":256}, use_cached_outputs=True, 

WARNING 06-24 16:50:14 camem.py:69] Failed to import vllm_ascend_C:No module named 'vllm_ascend.vllm_ascend_C'

/usr/local/python3.10.17/lib/python3.10/site-packages/torch_npu/contrib/transfer_to_npu.py:292: ImportWarning: 

    *************************************************************************************************************

    The torch.Tensor.cuda and torch.nn.Module.cuda are replaced with torch.Tensor.npu and torch.nn.Module.npu now..

    The torch.cuda.DoubleTensor is replaced with torch.npu.FloatTensor cause the double type is not supported now..

    The backend in torch.distributed.init_process_group set to hccl now..

    The torch.cuda.* and torch.cuda.amp.* are replaced with torch.npu.* and torch.npu.amp.* now..

    The device parameters have been replaced with npu in the function below:

    torch.logspace, torch.randint, torch.hann_window, torch.rand, torch.full_like, torch.ones_like, torch.rand_like, torch.randperm, torch.arange, torch.frombuffer, torch.normal, torch._empty_per_channel_affine_quantized, torch.empty_strided, torch.empty_like, torch.scalar_tensor, torch.tril_indices, torch.bartlett_window, torch.ones, torch.sparse_coo_tensor, torch.randn, torch.kaiser_window, torch.tensor, torch.triu_indices, torch.as_tensor, torch.zeros, torch.randint_like, torch.full, torch.eye, torch._sparse_csr_tensor_unsafe, torch.empty, torch._sparse_coo_tensor_unsafe, torch.blackman_window, torch.zeros_like, torch.range, torch.sparse_csr_tensor, torch.randn_like, torch.from_file, torch._cudnn_init_dropout_state, torch._empty_affine_quantized, torch.linspace, torch.hamming_window, torch.empty_quantized, torch._pin_memory, torch.autocast, torch.load, torch.Generator, torch.set_default_device, torch.Tensor.new_empty, torch.Tensor.new_empty_strided, torch.Tensor.new_full, torch.Tensor.new_ones, torch.Tensor.new_tensor, torch.Tensor.new_zeros, torch.Tensor.to, torch.Tensor.pin_memory, torch.nn.Module.to, torch.nn.Module.to_empty

    *************************************************************************************************************

    

  warnings.warn(msg, ImportWarning)

/usr/local/python3.10.17/lib/python3.10/site-packages/torch_npu/contrib/transfer_to_npu.py:247: RuntimeWarning: torch.jit.script and torch.jit.script_method will be disabled by transfer_to_npu, which currently does not support them, if you need to enable them, please do not use transfer_to_npu.

  warnings.warn(msg, RuntimeWarning)

WARNING 06-24 16:50:14 utils.py:2262] Methods add_prompt_adapter,cache_config,compilation_config,current_platform,list_prompt_adapters,load_config,pin_prompt_adapter,remove_prompt_adapter not implemented in <vllm_ascend.worker.worker.NPUWorker object at 0x7fef3a077940>

INFO 06-24 16:50:20 model_runner.py:902] Starting to load model /home/models/Qwen2.5-7B...

Loading safetensors checkpoint shards:   0% Completed | 0/4 [00:00<?, ?it/s]

Loading safetensors checkpoint shards:   0% Completed | 0/4 [00:00<?, ?it/s]

ERROR 06-24 16:50:35 engine.py:400] Error while deserializing header: HeaderTooLarge

ERROR 06-24 16:50:35 engine.py:400] Traceback (most recent call last):

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 391, in run_mp_engine

ERROR 06-24 16:50:35 engine.py:400]     engine = MQLLMEngine.from_engine_args(engine_args=engine_args,

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 124, in from_engine_args

ERROR 06-24 16:50:35 engine.py:400]     return cls(ipc_path=ipc_path,

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 76, in __init__

ERROR 06-24 16:50:35 engine.py:400]     self.engine = LLMEngine(*args, **kwargs)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/engine/llm_engine.py", line 273, in __init__

ERROR 06-24 16:50:35 engine.py:400]     self.model_executor = executor_class(vllm_config=vllm_config, )

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/executor/executor_base.py", line 52, in __init__

ERROR 06-24 16:50:35 engine.py:400]     self._init_executor()

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/executor/uniproc_executor.py", line 47, in _init_executor

ERROR 06-24 16:50:35 engine.py:400]     self.collective_rpc("load_model")

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/executor/uniproc_executor.py", line 56, in collective_rpc

ERROR 06-24 16:50:35 engine.py:400]     answer = run_method(self.driver_worker, method, args, kwargs)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/utils.py", line 2196, in run_method

ERROR 06-24 16:50:35 engine.py:400]     return func(*args, **kwargs)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm-ascend/vllm_ascend/worker/worker.py", line 207, in load_model

ERROR 06-24 16:50:35 engine.py:400]     self.model_runner.load_model()

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm-ascend/vllm_ascend/worker/model_runner.py", line 904, in load_model

ERROR 06-24 16:50:35 engine.py:400]     self.model = get_model(vllm_config=self.vllm_config)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/model_loader/__init__.py", line 14, in get_model

ERROR 06-24 16:50:35 engine.py:400]     return loader.load_model(vllm_config=vllm_config)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 409, in load_model

ERROR 06-24 16:50:35 engine.py:400]     loaded_weights = model.load_weights(

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/models/qwen2.py", line 515, in load_weights

ERROR 06-24 16:50:35 engine.py:400]     return loader.load_weights(weights)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 235, in load_weights

ERROR 06-24 16:50:35 engine.py:400]     autoloaded_weights = set(self._load_module("", self.module, weights))

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 187, in _load_module

ERROR 06-24 16:50:35 engine.py:400]     for child_prefix, child_weights in self._groupby_prefix(weights):

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 101, in _groupby_prefix

ERROR 06-24 16:50:35 engine.py:400]     for prefix, group in itertools.groupby(weights_by_parts,

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 98, in <genexpr>

ERROR 06-24 16:50:35 engine.py:400]     weights_by_parts = ((weight_name.split(".", 1), weight_data)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 385, in _get_all_weights

ERROR 06-24 16:50:35 engine.py:400]     yield from self._get_weights_iterator(primary_weights)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 368, in <genexpr>

ERROR 06-24 16:50:35 engine.py:400]     return ((source.prefix + name, tensor)

ERROR 06-24 16:50:35 engine.py:400]   File "/vllm-workspace/vllm/vllm/model_executor/model_loader/weight_utils.py", line 425, in safetensors_weights_iterator

ERROR 06-24 16:50:35 engine.py:400]     with safe_open(st_file, framework="pt") as f:

ERROR 06-24 16:50:35 engine.py:400] safetensors_rust.SafetensorError: Error while deserializing header: HeaderTooLarge

Process SpawnProcess-1:

Traceback (most recent call last):

  File "/usr/local/python3.10.17/lib/python3.10/multiprocessing/process.py", line 314, in _bootstrap

    self.run()

  File "/usr/local/python3.10.17/lib/python3.10/multiprocessing/process.py", line 108, in run

    self._target(*self._args, **self._kwargs)

  File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 402, in run_mp_engine

    raise e

  File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 391, in run_mp_engine

    engine = MQLLMEngine.from_engine_args(engine_args=engine_args,

  File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 124, in from_engine_args

    return cls(ipc_path=ipc_path,

  File "/vllm-workspace/vllm/vllm/engine/multiprocessing/engine.py", line 76, in __init__

    self.engine = LLMEngine(*args, **kwargs)

  File "/vllm-workspace/vllm/vllm/engine/llm_engine.py", line 273, in __init__

    self.model_executor = executor_class(vllm_config=vllm_config, )

  File "/vllm-workspace/vllm/vllm/executor/executor_base.py", line 52, in __init__

    self._init_executor()

  File "/vllm-workspace/vllm/vllm/executor/uniproc_executor.py", line 47, in _init_executor

    self.collective_rpc("load_model")

  File "/vllm-workspace/vllm/vllm/executor/uniproc_executor.py", line 56, in collective_rpc

    answer = run_method(self.driver_worker, method, args, kwargs)

  File "/vllm-workspace/vllm/vllm/utils.py", line 2196, in run_method

    return func(*args, **kwargs)

  File "/vllm-workspace/vllm-ascend/vllm_ascend/worker/worker.py", line 207, in load_model

    self.model_runner.load_model()

  File "/vllm-workspace/vllm-ascend/vllm_ascend/worker/model_runner.py", line 904, in load_model

    self.model = get_model(vllm_config=self.vllm_config)

  File "/vllm-workspace/vllm/vllm/model_executor/model_loader/__init__.py", line 14, in get_model

    return loader.load_model(vllm_config=vllm_config)

  File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 409, in load_model

    loaded_weights = model.load_weights(

  File "/vllm-workspace/vllm/vllm/model_executor/models/qwen2.py", line 515, in load_weights

    return loader.load_weights(weights)

  File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 235, in load_weights

    autoloaded_weights = set(self._load_module("", self.module, weights))

  File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 187, in _load_module

    for child_prefix, child_weights in self._groupby_prefix(weights):

  File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 101, in _groupby_prefix

    for prefix, group in itertools.groupby(weights_by_parts,

  File "/vllm-workspace/vllm/vllm/model_executor/models/utils.py", line 98, in <genexpr>

    weights_by_parts = ((weight_name.split(".", 1), weight_data)

  File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 385, in _get_all_weights

    yield from self._get_weights_iterator(primary_weights)

  File "/vllm-workspace/vllm/vllm/model_executor/model_loader/loader.py", line 368, in <genexpr>

    return ((source.prefix + name, tensor)

  File "/vllm-workspace/vllm/vllm/model_executor/model_loader/weight_utils.py", line 425, in safetensors_weights_iterator

    with safe_open(st_file, framework="pt") as f:

safetensors_rust.SafetensorError: Error while deserializing header: HeaderTooLarge

Traceback (most recent call last):

  File "/usr/local/python3.10.17/bin/vllm", line 8, in <module>

    sys.exit(main())

  File "/vllm-workspace/vllm/vllm/entrypoints/cli/main.py", line 73, in main

    args.dispatch_function(args)

  File "/vllm-workspace/vllm/vllm/entrypoints/cli/serve.py", line 34, in cmd

    uvloop.run(run_server(args))

  File "/usr/local/python3.10.17/lib/python3.10/site-packages/uvloop/__init__.py", line 82, in run

    return loop.run_until_complete(wrapper())

  File "uvloop/loop.pyx", line 1518, in uvloop.loop.Loop.run_until_complete

  File "/usr/local/python3.10.17/lib/python3.10/site-packages/uvloop/__init__.py", line 61, in wrapper

    return await main

  File "/vllm-workspace/vllm/vllm/entrypoints/openai/api_server.py", line 947, in run_server

    async with build_async_engine_client(args) as engine_client:

  File "/usr/local/python3.10.17/lib/python3.10/contextlib.py", line 199, in __aenter__

    return await anext(self.gen)

  File "/vllm-workspace/vllm/vllm/entrypoints/openai/api_server.py", line 139, in build_async_engine_client

    async with build_async_engine_client_from_engine_args(

  File "/usr/local/python3.10.17/lib/python3.10/contextlib.py", line 199, in __aenter__

    return await anext(self.gen)

  File "/vllm-workspace/vllm/vllm/entrypoints/openai/api_server.py", line 233, in build_async_engine_client_from_engine_args

    raise RuntimeError(

RuntimeError: Engine process failed to start. See stack trace for the root cause.

[ERROR] 2025-06-24-16:50:41 (PID:346, Device:-1, RankID:-1) ERR99999 UNKNOWN applicaiton exception

我要发帖子