vllm 多卡无法运行
收藏回复举报
vllm 多卡无法运行
t('forum.solved') 已解决
发表于2025-01-17 14:03:40
0 查看
#!/bin/bash 
# ATB加速库环境变量 

export ATB_LAYER_INTERNAL_TENSOR_REUSE=1 

export ATB_WORKSPACE_MEM_ALLOC_GLOBAL=1 

export ATB_OPERATION_EXECUTE_ASYNC=1 

export TASK_QUEUE_ENABLE=1 

export ATB_CONTENT_NCHW_TO_ND=1 

export ATB_CONTEXT_WORKSPACE_RING=1 

export HCCL_BUFFSIZE=120 

export LCCL_DETERMINISTIC=1 

export HCCL_DETERMINISTIC=true 

export ATB_OPSRUNNER_KERNEL_CACHE_LOCAL_COUNT=8 

export ATB_OPSRUNNER_KERNEL_CACHE_GLOABL_COUNT=16 

export ATB_LAUNCH_KERNEL_WITH_TILING=0 

export VLLM_NO_USAGE_STATS=1 # close vllm usage messages to avoid errors 

python -m vllm.entrypoints.openai.api_server --model="/home/ma-user/work/models/Qwen2.5-7B-Instruct" --trust-remote-code --enforce-eager --worker-use-ray --port 13001 --tensor-parallel-size 2

Error Log:

File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm_npu-0.4.2-py3.10.egg/vllm_npu/executor/ascend_ray_executor.py", line 182, in _run_workers
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm-0.4.2+npu-py3.10.egg/vllm/worker/worker_base.py", line 146, in execute_method
    raise e
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm-0.4.2+npu-py3.10.egg/vllm/worker/worker_base.py", line 137, in execute_method
    return executor(*args, **kwargs)
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/torch/utils/_contextlib.py", line 115, in decorate_context
    return func(*args, **kwargs)
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm_npu-0.4.2-py3.10.egg/vllm_npu/worker/ascend_worker.py", line 99, in determine_num_available_blocks
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/torch/utils/_contextlib.py", line 115, in decorate_context
    return func(*args, **kwargs)
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm_npu-0.4.2-py3.10.egg/vllm_npu/worker/ascend_model_runner.py", line 182, in profile_run
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/torch/utils/_contextlib.py", line 115, in decorate_context
    return func(*args, **kwargs)
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm_npu-0.4.2-py3.10.egg/vllm_npu/worker/ascend_model_runner.py", line 622, in execute_model
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm_npu-0.4.2-py3.10.egg/vllm_npu/worker/ascend_model_runner.py", line 551, in prepare_input_tensors
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/vllm-0.4.2+npu-py3.10.egg/vllm/distributed/communication_op.py", line 207, in broadcast_tensor_dict
    torch.distributed.broadcast(tensor,
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/torch/distributed/c10d_logger.py", line 47, in wrapper
    return func(*args, **kwargs)
  File "/home/ma-user/work/envs/test/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py", line 1906, in broadcast
    work = default_pg.broadcast([tensor], opts)
RuntimeError: create:build/CMakeFiles/torch_npu.dir/compiler_depend.ts:91 HCCL function error: HcclCommInitRootInfo(numRanks, &rootInfo, rank, &(comm->hcclComm_)), error code is 1
[ERROR] 2025-01-17-14:02:45 (PID:586043, Device:0, RankID:-1) ERR02200 DIST call hccl api failed.

我要发帖子