GLM-4.5 vllm-mindspore 推理实践
收藏回复举报
GLM-4.5 vllm-mindspore 推理实践
发表于2025-08-12 18:16:17
0 查看

环境准备

硬件:2台(16卡)Atlas 800T/800I A2(64G)服务器

权重文件:https://modelers.cn/models/MindSpore-Lab/GLM-4.5

镜像文件:

docker pull swr.cn-central-221.ovaijisuan.com/mindformers/glm4.5moe-infer:20250728

主要步骤及注意事项

启动容器

服务化部署

环境变量设置

source /usr/local/Ascend/ascend-toolkit/set_env.sh
export GLOO_SOCKET_IFNAME="本机IP对应网卡名称"
export HCCL_SOCKET_IFNAME="本机IP对应网卡名称"
export TP_SOCKET_IFNAME="本机IP对应网卡名称"
export MS_ENABLE_LCCL=off
export HCCL_OP_EXPANSION_MODE=AIV
export MS_ALLOC_CONF=enable_vmm:true
export ASCEND_RT_VISIBLE_DEVICES=0,1,2,3,4,5,6,7
export vLLM_MODEL_BACKEND=MindFormers
export ASCEND_TOTAL_MEMORY_GB=64
export MS_ENABLE_TRACE_MEMORY=off

说明:"本机IP对应网卡名称"——可通过ifconfig进行查询

2台设备设置主机和辅机,通过ray进程关联

选择一台设备作为主节点,执行如下命令

ray start --head --port=6380

另一台设备作为辅节点,依次执行如下命令

ray start --address=主节点IP:6380

说明:若需要修改配置,须先执行ray stop,再配置相关环境变量,然后重新启动ray。

拉起服务化

python3 -m vllm_mindspore.entrypoints vllm.entrypoints.openai.api_server --model "/weight_path/GLM-4.5" --trust_remote_code --tensor_parallel_size=16 --max-num-seqs=192 --max_model_len=32768 --max-num-batched-tokens=16384 --block-size=32 --gpu-memory-utilization=0.93 --distributed-executor-backend=ray

说明:"/weight_path/GLM-4.5"修改为权重文件所在绝对路径

执行推理请求测试

curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "/mnt/data/GLM-4.5",
  "messages": [
    {"role": "user", "content": "介绍一下北京"}
  ],
  "temperature": 0.6,
  "top_p": 0.95,
  "top_k": 20,
  "min_p": 0,
  "max_tokens": 64,
  "presence_penalty": 1.05,
  "chat_template_kwargs": {"enable_thinking": true}
}'

本帖最后由 匿名用户2025/08/14 16:17:56 编辑

我要发帖子