flash-attention接口替换
收藏回复举报
flash-attention接口替换
t('forum.solved') 已解决
新人帖
发表于2025-11-13 21:34:40
0 查看

在昇腾910B3上部署模型,推理阶段需要用到flash_attn库的 flash_attn_with_kvcache()接口。在"PyTorch 训练模型迁移调优指南"上没有找到该接口的适配内容,是否还不支持?

flash_attn_with_kvcache(
                q=q,
                k_cache=k_cache,
                v_cache=v_cache,
                k=k,
                v=v,
                rotary_cos=rotary_cos,
                rotary_sin=rotary_sin,
                cache_seqlens=cache_seqlens,
                softmax_scale=self.softmax_scale,
                causal=True,
                rotary_interleaved=True
            )

系统环境:

torch                      2.8.0            pypi_0            pypi
torch-npu                  2.8.0            pypi_0            pypi

true

我要发帖子