华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
我基于开源仓的教程自定义了2个算子,一个AI CPU算子,一个AI Core算子,请问有没有办法高效的调用着2个算子,即只启动一次acl stream,将AI Core和AI CPU当作一个kernel,在这个kernel中依次执行AI Core算子,AI CPU算子,并且在2个算子执行的过程中,AI CPU算子直接在GM中获取AI Core运算的结果,不需要执行任何的内存复制,直接计算出AI CPU算子的结果,并将该结果传回Host?
我要发帖子
我基于开源仓的教程自定义了2个算子,一个AI CPU算子,一个AI Core算子,请问有没有办法高效的调用着2个算子,即只启动一次acl stream,将AI Core和AI CPU当作一个kernel,在这个kernel中依次执行AI Core算子,AI CPU算子,并且在2个算子执行的过程中,AI CPU算子直接在GM中获取AI Core运算的结果,不需要执行任何的内存复制,直接计算出AI CPU算子的结果,并将该结果传回Host?