目前在D卡上部署模型的时候遇到了需要使用flash-attention的算子,具体算子是flash_attn_varlen_func,请问目前在NPU上是否有对应的实现?
我的具体使用方法如下:
attn_output = flash_attn_varlen_func(
query_states,
key_states,
value_states,
cu_len,
cu_len,
max_seqlen,
max_seqlen,
causal=self.causal,
window_size=self.window_size,
)
目前在D卡上部署模型的时候遇到了需要使用flash-attention的算子,具体算子是flash_attn_varlen_func,请问目前在NPU上是否有对应的实现?
我的具体使用方法如下:
attn_output = flash_attn_varlen_func(
query_states,
key_states,
value_states,
cu_len,
cu_len,
max_seqlen,
max_seqlen,
causal=self.causal,
window_size=self.window_size,
)