开发者
下载
[object Object][object Object]

远程读操作:将远端NPU的数据读取到本地内存。数据通过UB Tile作为中间暂存缓冲区进行传输。

当GlobalTensor超出UB Tile容量时,TGET将自动执行二维滑动——沿行(DIM_3)和列(DIM_4)分块以适配Tile,并遍历所有外层维度(DIM_0、DIM_1、DIM_2)。

[object Object]

对有效区域内每个元素 [object Object]

dsti,jlocal=srci,jremote\mathrm{dst}^{\mathrm{local}}_{i,j} = \mathrm{src}^{\mathrm{remote}}_{i,j}

数据流:[object Object][object Object][object Object]

[object Object]

同步形式:

[object Object]

降级时会为GM→UB→GM数据路径引入UB暂存Tile;C++内建接口需要显式传入 [object Object](或 [object Object] / [object Object])操作数。

[object Object]

声明于 [object Object]

[object Object]
[object Object]
[object Object]

使用两个暂存Tile,将相邻块的TGET与TSTORE重叠执行,隐藏DMA传输延迟。

[object Object]
[object Object]
  • 类型约束
    • [object Object] 必须等于 [object Object]
    • [object Object] 必须等于 [object Object]
    • [object Object] 必须等于 [object Object]
  • 内存约束
    • [object Object] 必须指向远端地址(源NPU)。
    • [object Object] 必须指向本地地址(当前NPU)。
    • [object Object] / [object Object] / [object Object] 必须预先在统一缓冲区中分配。
  • 有效区域
    • 传输大小由 [object Object] 的形状决定(自动分块以适配Tile)。
  • 乒乓约束
    • [object Object][object Object] 必须具有相同的类型和维度。
    • 必须位于不重叠的UB偏移处。
[object Object][object Object]
[object Object]
[object Object]
[object Object]