---
title: LLM模型应用场景参考实践：热门模型一键部署、开箱即优！-官方技术文章-昇腾社区
description: 大语言模型（LLM）在昇腾平台广泛应用，vLLM Ascend作为常用高性能推理引擎，所支持的模型种类日益丰富。然而在实际生产落地过程中，模型服务的部署面临着环境依赖复杂、手工操作易错、调优文档分散且缺乏经验等痛点问题。 本参考实践提供DeepSeek/Qwen/GLM/MiniMax等系列大模型在Atlas 800I A2/Atlas 800I A3等不同硬件环境下vLLM Ascend的自动化
keywords: LLM,模型应用场景,参考实践,热门模型一键,部署,开箱即优,官方技术文章,昇腾社区
url: https://www.hiascend.com/developer/techArticles/20260629-1?envFlag=1
section: (其他)
---

# LLM模型应用场景参考实践：热门模型一键部署、开箱即优！-官方技术文章-昇腾社区

URL: https://www.hiascend.com/developer/techArticles/20260629-1?envFlag=1
描述: 大语言模型（LLM）在昇腾平台广泛应用，vLLM Ascend作为常用高性能推理引擎，所支持的模型种类日益丰富。然而在实际生产落地过程中，模型服务的部署面临着环境依赖复杂、手工操作易错、调优文档分散且缺乏经验等痛点问题。 本参考实践提供DeepSeek/Qwen/GLM/MiniMax等系列大模型在Atlas 800I A2/Atlas 800I A3等不同硬件环境下vLLM Ascend的自动化
关键词: LLM,模型应用场景,参考实践,热门模型一键,部署,开箱即优,官方技术文章,昇腾社区

官方技术文章 [了解详情](https://www.hiascend.com/zh/developer/techArticles)

LLM模型应用场景参考实践：热门模型一键部署、开箱即优！

LLM模型应用场景参考实践：热门模型一键部署、开箱即优！

昇腾CANN计算商业

发表于: 2026/06/29

# 1 非商用声明

该文档提供的内容为参考实践，仅供用户参考使用，用户可参考实践文档构建自己的软件，并按需进行安全、可靠性加固，但不建议直接将相关Demo或镜像文件集成到商用产品中。

# 2 概述

大语言模型（LLM）在昇腾平台广泛应用，vLLM Ascend作为常用高性能推理引擎，所支持的模型种类日益丰富。然而在实际生产落地过程中，模型服务的部署面临着环境依赖复杂、手工操作易错、调优文档分散且缺乏经验等痛点问题。

本参考实践提供DeepSeek/Qwen/GLM/MiniMax等系列大模型在Atlas 800I A2/Atlas 800I A3等不同硬件环境下vLLM Ascend的自动化部署、推荐配置和加速特性使能能力。通过声明式配置实现环境初始化、依赖安装、参数配置等全流程自动化，降低人工介入与出错风险。快速实现模型服务一键部署、开箱最优。

# 3 适用范围

模型列表与支持的操作系统列表，详细内容可参考README [了解详情](https://gitcode.com/Ascend/ascend-deployer/blob/appliance_deployer/kadt/llm_service/README.md)与脚本--help信息，部署前需确保OS版本在支持列表内。

| 部署模式 | 支持模型 |
| --- | ---|
| Atlas 800I A2 单机 / Atlas 300I A2 多卡 | Qwen3.5-27B-w8a8、Qwen3.5-397B-w4a8、MiniMax-M2.5-w8a8-QuaRot、DeepSeek-V4-Flash-w8a8-mtp |
| Atlas 800I A2 双机 | Kimi-K2.5-w4a8、GLM-5.1-w8a8 |
| Atlas 800I A3 单机 | Qwen3.5-27B-w8a8、Qwen3.5-397B-w4a8、MiniMax-M2.5-w8a8-QuaRot、Kimi-K2.5-w4a8、GLM-5.1-w8a8、DeepSeek-V4-Flash-w8a8-mtp |
| Atlas 800I A3 双机 | DeepSeek-V4-Pro-w4a8-mtp |

| 操作系统 | 支持的版本 |
| --- | ---|
| BCLinux | 21.10, 21.10U4 |
| CTyunOS | 22.06, 23.01 |
| CULinux | 3.0 |
| CentOS | 7.6 |
| Debian | 10 |
| EulerOS | 2.8, 2.9, 2.10, 2.12 |
| Kylin | V10, V10Halberd, V10Lance, V10Sword, V10Tercel, V11Swan25 |
| MTOS | 22.03LTS-SP4 |
| OpenEuler | 20.03LTS, 22.03LTS, 22.03LTS-SP1, 22.03LTS-SP4, 24.03LTS-SP1 |
| Ubuntu | 18.04, 20.04, 22.04, 22.04.4, 24.04 |
| UOS | 20-1020e, 20-1050e |
| veLinux | 1.3 |
| VesselOS | 1.0, 2.0 |

# 4 准备工作

- 确保系统已连接网络；
- 确保当前执行用户为 root 用户；
- 确保磁盘空间充足（本工具下载的镜像及模型默认保存在工具所在目录，至少 100GB，取决于模型大小）；
- 执行下载的机器需安装docker用于下载镜像，其余机器可通过本工具自动安装docker
- 克隆本代码仓：git clone https://gitcode.com/Ascend/ascend-deployer.git -b appliance_deployer。

# 5 使用指导

以Atlas800I A2机型、OpenEuler操作系统，部署Qwen3.5-27B模型为例，每个脚本支持的参数详见README [了解详情](https://gitcode.com/Ascend/ascend-deployer/blob/appliance_deployer/kadt/llm_service/README.md)和脚本对应help，请根据实际使用场景进行设置。

1.下载软件包和LLM模型

```
bash download.sh --os OpenEuler_22.03LTS-SP4_aarch64 --model Eco-Tech/Qwen3.5-27B-w8a8-mtp --download-model
```

执行该命令后会一键下载vLLM-Ascend镜像、NPU驱动与固件、操作系统依赖、等软件包及对应的模型权重文件。

2.安装基础软件

```
bash install_base_sw.sh
```

执行该命令后会一键安装操作系统依赖、NPU驱动与固件等软件。

3.一键拉起LLM模型服务

```
bash install_llm.sh --model Qwen3.5-27B-w8a8-mtp  --port 8000 --api-key <YOUR_API_KEY>
```

4.模型服务使用示例

```
curl http://${ip}:${port}/v1/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${api_key}" \
-d '{
"model": "Qwen3.5-27B-w8a8-mtp",
"prompt": "介绍一下你自己",
"temperature": 0,
"max_tokens": 100
}'
```

ip、prot、api_key注意替换为实际配置的配置。

5.卸载模型服务

```
# 查看所有容器
docker ps -a  
# 停止并删除 vllm_ascend_0 容器
docker stop vllm_ascend_0 
docker rm vllm_ascend_0
```

容器名默认为vllm_ascend_x格式（如vllm_ascend_0、vllm_ascend_1等），卸载容器不会删除模型权重文件，如需彻底清理请手动删除 --weight_path 指定的模型权重目录。

本页内容
