问题
多流代码
当我在自定义算子中创建了两个stream,并拉起两个kernel函数时,这两个kernel函数是真正意义上的并行,抑或是并发或者串行执行?如果stream间可以并发,我该如何用代码实现呢,是否有相关的例子。

kernel task type声明
注意到在Atlas A2 训练系列产品/Atlas 800I A2 推理产品 中,我们需要在kernel function中手动声明KERNEL_TASK_TYPE,对于KERNEL_TYPE_MIX_AIC_1_0这种启动1:0的cube与vector core是否存在什么意义?
msprof
当我们同时调用两个kernel时,通过msprof收集数据却仅能获取到cube core/vector core的数据,而不能同时得到相关的性能数据,这是否存在某些使用细节的错误呢?

问题
多流代码
当我在自定义算子中创建了两个stream,并拉起两个kernel函数时,这两个kernel函数是真正意义上的并行,抑或是并发或者串行执行?如果stream间可以并发,我该如何用代码实现呢,是否有相关的例子。
kernel task type声明
注意到在Atlas A2 训练系列产品/Atlas 800I A2 推理产品 中,我们需要在kernel function中手动声明KERNEL_TASK_TYPE,对于KERNEL_TYPE_MIX_AIC_1_0这种启动1:0的cube与vector core是否存在什么意义?
msprof
当我们同时调用两个kernel时,通过msprof收集数据却仅能获取到cube core/vector core的数据,而不能同时得到相关的性能数据,这是否存在某些使用细节的错误呢?