单机 910B2 运行 235B 运行大模型太吃力,所以打算使用分布式部署推理 2 台 8x64G的 910B2 来运行,使用的 vllm 推理引擎。
这是 ray 的组网信息,可以看到 NPU 数量正确。

vllm serve /data --tensor-parallel-size 16 --distributed-executor-backend ray --gpu-memory-utilization 0.9 --max-num-batched-tokens 131072 --block-size 32 --max-model-len 32768 --host 0.0.0.0 --port 8080 --cpu-offload-gb 500 --swap-space 16 --enable-auto-tool-choice --tool-call-parser hermes

谁能帮忙解决下 一起看看 或者使用别的推理引擎也行 有过实践的朋友一起讨论下



