---
title: 一文吃透模型量化，解锁DeepSeek轻量级部署密码-官方技术文章-昇腾社区
description: 小伙伴们&#xff0c;最近 AI 圈可以说是被新晋“顶流”DeepSeek刷屏了&#xff0c;新发布的 V3/R1 系列模型&#xff0c;直接在全球火出圈&#xff0c;它的性能强劲到足以和全球那些顶尖模型一较高下&#xff01;不过你知道吗&#xff1f;虽然网络版和App版已经足够好用&#xff0c;但只有把模型搬进自家地盘&#xff0c;进行本地部署&#xff0c;你才能享受到真正的“
keywords: 一文吃透模型量化,DeepSeek,解锁,轻量级部署密,官方技术文章,昇腾社区,什么是大模型量化,减少内存
url: https://www.hiascend.com/developer/techArticles/20250225-1
section: (其他)
---

# 一文吃透模型量化，解锁DeepSeek轻量级部署密码-官方技术文章-昇腾社区

URL: https://www.hiascend.com/developer/techArticles/20250225-1
描述: 小伙伴们&#xff0c;最近 AI 圈可以说是被新晋“顶流”DeepSeek刷屏了&#xff0c;新发布的 V3/R1 系列模型&#xff0c;直接在全球火出圈&#xff0c;它的性能强劲到足以和全球那些顶尖模型一较高下&#xff01;不过你知道吗&#xff1f;虽然网络版和App版已经足够好用&#xff0c;但只有把模型搬进自家地盘&#xff0c;进行本地部署&#xff0c;你才能享受到真正的“
关键词: 一文吃透模型量化,DeepSeek,解锁,轻量级部署密,官方技术文章,昇腾社区,什么是大模型量化,减少内存

官方技术文章 [了解详情](https://www.hiascend.com/zh/developer/techArticles)

一文吃透模型量化，解锁DeepSeek轻量级部署密码

一文吃透模型量化，解锁DeepSeek轻量级部署密码

DeepSeek

发表于: 2025/02/25

2.6k

6

## 什么是大模型量化

近年来，随着人工智能的发展和Transformer等架构的提出，使得深度学习的模型参数达上万亿规模，从而使得模型变得越来越大，计算和存储资源的需求也急剧增加。因此，为了降低计算和存储的开销，我们需要一些大模型压缩技术来降低模型部署的成本，并提升模型的推理的性能。模型压缩主要有几种方法：量化、知识蒸馏、剪枝和低秩分解。

量化（Quantization）是通过降低模型当中的参数精度（权重或者激活值）将从较高位宽转化为（如32为浮点数）转化为较低位宽（如8位整数或4位整数），实现模型的压缩和优化，从而降低模型的占用显存和算力，提高运行效率。通常会伴随着一定量精度的损失，需要注意的是，在计算过程中我们还会将量化后的整数反量化为浮点数，得到结果。通过量化主要有以下收益：

### 1. 减少内存（显存）占用

整数数据类型（如8位整数）占用的内存比浮点数（如32位浮点数）少得多。假设一个模型有1亿个参数，使用FP32数据格式表示，需要的内存为：内存占用4x108字节， 将字节转换为MB（1MB = 1,048,576字节）：内存占用约381.47MB；若使用INT8表示数据参数：内存占用=1 x108字节，将字节转换为MB（1MB = 1,048,576字节）：内存占用约95.37MB。所以bit越短，内存占用越少，对硬件要求越低。

### 2. 提升计算效率

在硬件层面，整数运算更容易实现，许多处理器和加速器专门优化了整数运算，提供张量运算的专用指令集，所以整数运算（加法、乘法等）通常比浮点运算更简单和快速。

### 3. 能耗降低

整数运算搬运的数据量变少，减少了访存开销，同时计算过程中，NPU 所需的乘法器数目也减少，所以消耗的能量通常比浮点运算低。

当前模型量化主要包括后训练量化（Post-Training Quantization, PTQ）和量化感知训练（Quantization Aware Training, QAT）。PTQ可以在没有原始的训练过程的情况下，就能将预训练的FP32模型直接转换为定点计算的网络。PTQ最大的特点就是不需要数据或者只需要很少的校准数据集，且几乎不需要调整超参数，使得我们可以很方便的进行模型量化，是一种在训练期间模拟量化操作的方法。QAT 通过在模型中插入伪量化节点（FakeQuant）来模拟量化误差，并在训练过程中最小化这些误差，最终得到一个适应量化环境的模型。

量化在降低显存占用和算力的同时，不可避免存在一些挑战，如量化方法的精确性、低比特数带来的精度损失，与此同时，模型大小与精度之间也存在一种权衡。一般来说，模型越小，其表达能力和容纳参数的能力也越有限，所以较小模型，量化后精度损失可能更加显著。

在进行模型量化时，要综合考虑任务、模型大小、精度要求以及实际的应用场景，以最合适的量化策略。基于以上场景，MindStudio模型压缩工具可以支持DeepSeek系列模型的量化，并且更加高效。

## MindStudio模型压缩工具介绍

msModelSlim（MindStudio模型压缩工具），是一个以加速为目标、压缩为技术、昇腾为根本的亲和压缩工具。支持训练加速和推理加速，包括模型低秩分解、稀疏训练、训练后量化、量化感知训练等功能，昇腾AI模型开发用户可以灵活调用Python API接口，对模型进行性能调优，并支持导出不同格式模型，在昇腾AI处理器上运行。

当前msModelSlim根据开发者差异化需求，提供了模型蒸馏、大模型量化、大模型稀疏量化和权重压缩、训练后量化等多种模型压缩方案。

针对DeepSeek系列模型，msModelSlim提供了支持W8A8、W8A16的量化方案，同时也在开发W4A16、W4A8量化算法，满足不同客户需求。

同时，针对DeepSeek-V3/R1的W8A8动态量化方案，大体分为三步：

1. 调整离群值抑制：通过一致量化过程中异常值，使能后续的量化更优。针对V3/R1版本，采用SmoothQuant优化算法。
2. 量化参数的选择：根据以往经验，选择指定的层回退（即对精度敏感的层使用浮点数计算）；激活值量化方式选择Min-Max方式；采用混合量化方式，即MoE层选用W8A8-Dynamic量化，MLA层选用W8A8量化。
3. 校准集调整，通过更新业务校准集进行Label-Free量化。

量化流程如下：

基于msModelSlim模型压缩工具的量化压缩能力，互联网、运营商、金融等20+行业客户均在本地部署上线DeepSeek-V3/R1满血版量化模型。下载DeepSeek-V3/R1量化模型目前经过W8A8量化的DeepSeek模型也已经上线魔乐社区，帮助你更高效地进行下载和本地部署。链接奉上：DeepSeek-R1-W8A8：https://modelers.cn/models/State_Cloud/DeepSeek-R1-W8A8 [了解详情](https://modelers.cn/models/State_Cloud/DeepSeek-R1-W8A8)DeepSeek-V3-w8a8：https://modelers.cn/models/State_Cloud/DeepSeek-V3-w8a8 [了解详情](https://modelers.cn/models/State_Cloud/DeepSeek-V3-w8a8)DeepSeek-R1-bf16-hfd-w8a8：https://modelers.cn/models/State_Cloud/DeepSeek-R1-bf16-hfd-w8a8 [了解详情](https://modelers.cn/models/State_Cloud/DeepSeek-R1-bf16-hfd-w8a8)

## 结语

随着深度学习模型变得越来越庞大和复杂，高效地将其知识迁移至小型、轻量化的模型，已经成为AI技术走向实际生产的关键路径。msModelSlim支持多种模型压缩算法（包括量化压缩、稀疏压缩等），为开发者提供更加灵活、高效的模型压缩量化方案。在保障精度的同时，以更低的资源消耗实现更快的推理速度，助力企业快速部署上线，为AI技术的普及和落地提供了强有力的支持。

点赞 6

本页内容

什么是大模型量化 [了解详情](https://www.hiascend.com/#id-1)

MindStudio模型压缩工具介绍 [了解详情](https://www.hiascend.com/#id-2)

结语 [了解详情](https://www.hiascend.com/#id-3)
