使用vllm-ascend的docker无法启动Qwen3.5-27B,进程卡死。
收藏回复举报
使用vllm-ascend的docker无法启动Qwen3.5-27B,进程卡死。
t('forum.solved') 已解决
发表于2026-06-29 11:51:05
0 查看

问题:在910B上,使用vllm-ascend镜像部署容器后,尝试启动Qwen3.5-27B模型,启动服务卡死,日志停留在“Loading safetensors checkpoint shards”步骤,服务和卡上进程也卡主不动。

卡:910B3
驱动:driver=26.0.rc1
固件:firmware=9.0.0.0.205
镜像:quay.io/ascend/vllm-ascend:v0.21.0rc1-openeuler
容器部署命令:

docker run -itd \
--name vllm-ascend_v0210rc1_xxx_8ka \
--net=host \
--shm-size=256g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /mnt/xxx/model:/model \
quay.io/ascend/vllm-ascend:v0.21.0rc1-openeuler bash

在容器内,模型启动命令:

#!/bin/sh

export ASCEND_RT_VISIBLE_DEVICES=0,1
# Load model from ModelScope to speed up download
export VLLM_USE_MODELSCOPE=True
# To reduce memory fragmentation and avoid out of memory
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=512
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export TASK_QUEUE_ENABLE=1

vllm serve /model/Qwen3.5-27B \
--host 0.0.0.0 \
--port 8000 \
--data-parallel-size 1 \
--tensor-parallel-size 2 \
--seed 1024 \
--served-model-name Qwen3.5-27B \
--max-num-seqs 32 \
--max-model-len 133000 \
--max-num-batched-tokens 8096 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--no-enable-prefix-caching \
--speculative-config '{"method": "qwen3_5_mtp", "num_speculative_tokens": 3, "enforce_eager": true}' \
--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
--additional-config '{"enable_cpu_binding":true}' \
--async-scheduling

执行模型启动脚本后,大概2分钟后,日志卡主不动,日志如下:

......
INFO 06-29 03:19:14 [__init__.py:44] Available plugins for group vllm.platform_plugins:
INFO 06-29 03:19:14 [__init__.py:46] - ascend -> vllm_ascend:register
INFO 06-29 03:19:14 [__init__.py:49] All plugins in this group will be loaded. Set `VLLM_PLUGINS` to control which plugins to load.
INFO 06-29 03:19:14 [__init__.py:238] Platform plugin ascend is activated
INFO 06-29 03:19:14 [platform.py:61] [vllm-ascend] - Breakable cudagraph is force disabled on Ascend because DeepSeek V4 PIECEWISE cudagraph is not supported yet.
INFO 06-29 03:19:14 [__init__.py:44] Available plugins for group vllm.platform_plugins:
INFO 06-29 03:19:14 [__init__.py:46] - ascend -> vllm_ascend:register
INFO 06-29 03:19:14 [__init__.py:49] All plugins in this group will be loaded. Set `VLLM_PLUGINS` to control which plugins to load.
INFO 06-29 03:19:14 [__init__.py:238] Platform plugin ascend is activated
INFO 06-29 03:19:14 [platform.py:61] [vllm-ascend] - Breakable cudagraph is force disabled on Ascend because DeepSeek V4 PIECEWISE cudagraph is not supported yet.
2026-06-29 03:19:24,151 - 5914 - ServiceProfiler - INFO - VLLM_USE_V1 not set, auto-detected via vLLM 0.21.0+empty: default 1
WARNING 06-29 03:19:24 [registry.py:960] Model architecture DeepseekV4ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v4:AscendDeepseekV4ForCausalLM.
WARNING 06-29 03:19:24 [registry.py:960] Model architecture DeepSeekV4MTPModel is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v4_mtp:DeepSeekV4MTP.
2026-06-29 03:19:24,158 - 5913 - ServiceProfiler - INFO - VLLM_USE_V1 not set, auto-detected via vLLM 0.21.0+empty: default 1
WARNING 06-29 03:19:24 [registry.py:960] Model architecture DeepseekV4ForCausalLM is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v4:AscendDeepseekV4ForCausalLM.
WARNING 06-29 03:19:24 [registry.py:960] Model architecture DeepSeekV4MTPModel is already registered, and will be overwritten by the new model class vllm_ascend.models.deepseek_v4_mtp:DeepSeekV4MTP.
INFO 06-29 03:19:24 [__init__.py:110] Registered model loader `<class 'vllm_ascend.model_loader.netloader.netloader.ModelNetLoaderElastic'>` with load format `netloader`
INFO 06-29 03:19:24 [__init__.py:110] Registered model loader `<class 'vllm_ascend.model_loader.netloader.netloader.ModelNetLoaderElastic'>` with load format `netloader`
INFO 06-29 03:19:24 [__init__.py:110] Registered model loader `<class 'vllm_ascend.model_loader.rfork.rfork_loader.RForkModelLoader'>` with load format `rfork`
INFO 06-29 03:19:24 [__init__.py:110] Registered model loader `<class 'vllm_ascend.model_loader.rfork.rfork_loader.RForkModelLoader'>` with load format `rfork`
`Qwen2VLImageProcessorFast` is deprecated. The `Fast` suffix for image processors has been removed; use `Qwen2VLImageProcessor` instead.
`Qwen2VLImageProcessorFast` is deprecated. The `Fast` suffix for image processors has been removed; use `Qwen2VLImageProcessor` instead.
INFO 06-29 03:19:27 [ascend_config.py:768] [vllm-ascend] - Dynamic EPLB is False
INFO 06-29 03:19:27 [ascend_config.py:769] [vllm-ascend] - The number of redundant experts is 0
INFO 06-29 03:19:27 [ascend_config.py:768] [vllm-ascend] - Dynamic EPLB is False
INFO 06-29 03:19:27 [ascend_config.py:769] [vllm-ascend] - The number of redundant experts is 0
(Worker pid=5914) INFO 06-29 03:19:29 [parallel_state.py:1410] world_size=2 rank=1 local_rank=1 distributed_init_method=tcp://127.0.0.1:34927 backend=hccl
(Worker pid=5913) INFO 06-29 03:19:29 [parallel_state.py:1410] world_size=2 rank=0 local_rank=0 distributed_init_method=tcp://127.0.0.1:34927 backend=hccl
[Gloo] Rank 1 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
[Gloo] Rank 0 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
[Gloo] Rank 1 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
[Gloo] Rank 0 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
(Worker pid=5913) INFO 06-29 03:19:40 [parallel_state.py:1723] rank 0 in world size 2 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, EP rank N/A, EPLB rank N/A
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 0 is connected to 0 peer ranks. Expected number of connected peer ranks is : 0
[Gloo] Rank 1 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
[Gloo] Rank 0 is connected to 1 peer ranks. Expected number of connected peer ranks is : 1
(Worker pid=5914) WARNING 06-29 03:19:45 [__init__.py:204] min_p and logit_bias parameters won't work with speculative decoding.
(Worker pid=5913) WARNING 06-29 03:19:45 [__init__.py:204] min_p and logit_bias parameters won't work with speculative decoding.
(Worker pid=5913) The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
(Worker pid=5914) The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
(Worker pid=5913) WARNING 06-29 03:19:52 [__init__.py:204] min_p and logit_bias parameters won't work with speculative decoding.
(Worker_TP0 pid=5913) INFO 06-29 03:19:52 [model_runner_v1.py:3619] [vllm-ascend] [worker] - Starting to load model /model/Qwen3.5-27B...
(Worker pid=5914) WARNING 06-29 03:19:52 [__init__.py:204] min_p and logit_bias parameters won't work with speculative decoding.
(Worker_TP1 pid=5914) INFO 06-29 03:19:52 [model_runner_v1.py:3619] [vllm-ascend] [worker] - Starting to load model /model/Qwen3.5-27B...
(Worker_TP0 pid=5913) INFO 06-29 03:19:52 [interface.py:289] Using default backend AttentionBackendEnum.TORCH_SDPA for vit attention
(Worker_TP0 pid=5913) INFO 06-29 03:19:52 [mm_encoder_attention.py:372] Using AttentionBackendEnum.TORCH_SDPA for MMEncoderAttention.
(Worker_TP0 pid=5913) INFO 06-29 03:19:53 [gdn_linear_attn.py:169] Using Triton/FLA GDN prefill kernel
(Worker_TP0 pid=5913) INFO 06-29 03:19:54 [compilation.py:1049] Using OOT custom backend for compilation.
(Worker_TP1 pid=5914) INFO 06-29 03:19:54 [compilation.py:1049] Using OOT custom backend for compilation.
(Worker_TP0 pid=5913) INFO 06-29 03:19:54 [weight_utils.py:938] Filesystem type for checkpoints: EXT4. Checkpoint size: 51.75 GiB. Available RAM: 985.39 GiB.
(Worker_TP0 pid=5913) INFO 06-29 03:19:54 [weight_utils.py:961] Auto-prefetch is disabled because the filesystem (EXT4) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
Loading safetensors checkpoint shards:   0% Completed | 0/11 [00:00<?, ?it/s]

请问为什么执行启动命令后,会卡在 加载权重步骤中,也没有其他额外日志提示。

我要发帖子