请教一个问题。
实现了一个先在vetcorCore计算后,然后搬入cubeCore进行矩阵乘的计算过程。在vetcorCore和cubeCore并行计算时,ND2Nz的优先级似乎小于vector的dataCopy,耗时变长。
如下图所示,MTE2的两个ND2Nz指令搬运的数据量相同的情况下,执行第一个ND2Nz同时有到vectorCore的dataCopy,耗时变长;执行第二个ND2Nz指令时没有到vectorCore的dataCopy,耗时正常。
我的期望是执行第一个ND2Nz时,耗时和执行第二个ND2Nz指令的时间相同,或者说ND2Nz和dataCopy能够交替执行。那么这个问题的原因是什么,要怎么解决?

请教一个问题。
实现了一个先在vetcorCore计算后,然后搬入cubeCore进行矩阵乘的计算过程。在vetcorCore和cubeCore并行计算时,ND2Nz的优先级似乎小于vector的dataCopy,耗时变长。
如下图所示,MTE2的两个ND2Nz指令搬运的数据量相同的情况下,执行第一个ND2Nz同时有到vectorCore的dataCopy,耗时变长;执行第二个ND2Nz指令时没有到vectorCore的dataCopy,耗时正常。
我的期望是执行第一个ND2Nz时,耗时和执行第二个ND2Nz指令的时间相同,或者说ND2Nz和dataCopy能够交替执行。那么这个问题的原因是什么,要怎么解决?