华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
我在尝试使用 torch_npu._npu_flash_attention_qlens,但对它的几个输入参数感到困惑,自己使用的时候总是出错RuntimeError: SelfAttentionOperation setup failed!
torch_npu._npu_flash_attention_qlens
想了解下输入输出得满足什么条件。
测试环境:910, torch-npu 2.5.1
torch_npu._npu_flash_attention_qlens( query=query, key_cache=self.key_cache, value_cache=self.value_cache, block_table=block_tables, mask=compress_mask, seq_len=self.query_lens_tensor_cpu, context_lens=self.seq_lens_tensor_cpu, num_kv_heads=self.num_kv_heads, num_heads=self.num_heads, scale_value=self.scale, out=output)
本帖最后由 匿名用户 于 2025/09/15 15:14:08 编辑
我要发帖子
我在尝试使用
torch_npu._npu_flash_attention_qlens,但对它的几个输入参数感到困惑,自己使用的时候总是出错RuntimeError: SelfAttentionOperation setup failed!想了解下输入输出得满足什么条件。
测试环境:910, torch-npu 2.5.1
torch_npu._npu_flash_attention_qlens( query=query, key_cache=self.key_cache, value_cache=self.value_cache, block_table=block_tables, mask=compress_mask, seq_len=self.query_lens_tensor_cpu, context_lens=self.seq_lens_tensor_cpu, num_kv_heads=self.num_kv_heads, num_heads=self.num_heads, scale_value=self.scale, out=output)