测试场景
使用mindspore搭建的网络,使用到了ms.ops.masked_select算子,生成的air模型转换为om模型之后在Atlas 300I pro上推理测试。
测试中分别使用分别使用同步和异步推理,推理两个模型,区别仅在于有无masked_select步骤,即网络输出的结果分别为masked_select之前和之后的数据。
测试情况
无masked_select算子时,使用同步推理,AI Core占用率为30%左右,AI CPU为0;使用异步推理AI Core可以提高到接近100%。
加入masked_select算子之后,使用同步推理,AI Core占用率为11%左右,AI CPU占用提高到60%左右;使用异步推理情况基本不变。
问题
请问masked_select算子的使用有哪里需要注意的点吗,有什么办法提高加入masked_select时的运算效率吗?
另外想问一下mindspore和torch_npu中的masked_select运算效率是否接近?
测试场景
使用mindspore搭建的网络,使用到了ms.ops.masked_select算子,生成的air模型转换为om模型之后在Atlas 300I pro上推理测试。
测试中分别使用分别使用同步和异步推理,推理两个模型,区别仅在于有无masked_select步骤,即网络输出的结果分别为masked_select之前和之后的数据。
测试情况
无masked_select算子时,使用同步推理,AI Core占用率为30%左右,AI CPU为0;使用异步推理AI Core可以提高到接近100%。
加入masked_select算子之后,使用同步推理,AI Core占用率为11%左右,AI CPU占用提高到60%左右;使用异步推理情况基本不变。
问题
请问masked_select算子的使用有哪里需要注意的点吗,有什么办法提高加入masked_select时的运算效率吗?
另外想问一下mindspore和torch_npu中的masked_select运算效率是否接近?