背景:通过ascend c构造一个mte2 从 gm_to_l1场景,并且通过msprof进行profling。发现在搬移代码后增加操作指令(如while循环),计算得到的带宽会超过理论带宽
数据如下:

每个核处理搬移的数据都是12800*128*128 FP16的大小,core_num表示用的核数,while:0表示整个算子只有搬移代码;while:50表示在搬移代码后,增加了一个while 50的循环代码, 循环内容为变量累加1.
根据以上方式,发现在while:50的情况下,带宽会超过理论带宽1.2T
背景:通过ascend c构造一个mte2 从 gm_to_l1场景,并且通过msprof进行profling。发现在搬移代码后增加操作指令(如while循环),计算得到的带宽会超过理论带宽
数据如下:
每个核处理搬移的数据都是12800*128*128 FP16的大小,core_num表示用的核数,while:0表示整个算子只有搬移代码;while:50表示在搬移代码后,增加了一个while 50的循环代码, 循环内容为变量累加1.
根据以上方式,发现在while:50的情况下,带宽会超过理论带宽1.2T