---
title: MLA
description: "DeepSeek V2提出Multi-Head Latent Attention，通过对hiddenstates进行down-projection处理，压缩hiddensize，减少KVCache显存的占用。通过up-projection恢复KV，进行PA计算。通过算力换显存，来提升吞吐。"
url: https://www.hiascend.com/document/detail/zh/canncommercial/latest/API/ascendtb/ascendtb_01_0207.html
sourcePath: /source/zh/canncommercial/900/API/ascendtb/ascendtb_01_0207.html
indexId: 32bcfd0bdb224c61e1f2b31bf96a051b023779d180fe4044e8fee76ca5368d2d64
---
# MLA

#### 功能说明

DeepSeek V2提出Multi-Head Latent Attention，通过对hiddenstates进行down-projection处理，压缩hiddensize，减少KVCache显存的占用。通过up-projection恢复KV，进行PA计算。通过算力换显存，来提升吞吐。


#### 开启方式

keyCache的维度[num_blocks, block_size, kv_head_num, head_size_k]与valueCache的维度[num_blocks, block_size, kv_head_num, head_size_v]中head_size_k与head_size_v不相等。


#### 约束说明

不支持 Atlas 推理系列产品 。
