VLLM+ray 搭建分布式推理运行 Qwen3_235B,VLLM 跨节点寻找 npuID 逻辑错误
收藏回复举报
VLLM+ray 搭建分布式推理运行 Qwen3_235B,VLLM 跨节点寻找 npuID 逻辑错误
t('forum.solved') 已解决
新人帖
发表于2025-07-06 13:38:14
0 查看
单机 910B2 运行 235B 运行大模型太吃力,所以打算使用分布式部署推理 2 台 8x64G的 910B2 来运行,使用的 vllm 推理引擎。
这是 ray 的组网信息,可以看到 NPU 数量正确。
cke_2137.png
vllm serve /data     --tensor-parallel-size 16     --distributed-executor-backend ray     --gpu-memory-utilization 0.9     --max-num-batched-tokens 131072     --block-size 32     --max-model-len 32768     --host 0.0.0.0     --port 8080     --cpu-offload-gb 500     --swap-space 16 --enable-auto-tool-choice --tool-call-parser hermes
cke_4540.png
谁能帮忙解决下 一起看看 或者使用别的推理引擎也行 有过实践的朋友一起讨论下

我要发帖子