如何使用 torch_npu.npu_flash_attention_qlens
收藏回复举报
如何使用 torch_npu.npu_flash_attention_qlens
t('forum.solved') 已解决
新人帖
发表于2025-09-15 13:36:00
0 查看

我在尝试使用 torch_npu._npu_flash_attention_qlens,但对它的几个输入参数感到困惑,自己使用的时候总是出错RuntimeError: SelfAttentionOperation setup failed!

想了解下输入输出得满足什么条件。

测试环境:910, torch-npu 2.5.1

torch_npu._npu_flash_attention_qlens(
    query=query,
    key_cache=self.key_cache,
    value_cache=self.value_cache,
    block_table=block_tables,
    mask=compress_mask,
    seq_len=self.query_lens_tensor_cpu,
    context_lens=self.seq_lens_tensor_cpu,
    num_kv_heads=self.num_kv_heads,
    num_heads=self.num_heads,
    scale_value=self.scale,
    out=output)

本帖最后由 匿名用户2025/09/15 15:14:08 编辑

我要发帖子