VectorCore和Cube并行计算时,ND2Nz指令的耗时变长
收藏回复举报
VectorCore和Cube并行计算时,ND2Nz指令的耗时变长
t('forum.solved') 已解决
发表于2024-11-19 18:16:06
0 查看

请教一个问题。

实现了一个先在vetcorCore计算后,然后搬入cubeCore进行矩阵乘的计算过程。在vetcorCore和cubeCore并行计算时,ND2Nz的优先级似乎小于vector的dataCopy,耗时变长。

如下图所示,MTE2的两个ND2Nz指令搬运的数据量相同的情况下,执行第一个ND2Nz同时有到vectorCore的dataCopy,耗时变长;执行第二个ND2Nz指令时没有到vectorCore的dataCopy,耗时正常。

我的期望是执行第一个ND2Nz时,耗时和执行第二个ND2Nz指令的时间相同,或者说ND2Nz和dataCopy能够交替执行。那么这个问题的原因是什么,要怎么解决?

cke_118.png

我要发帖子