远程读操作:将远端NPU的数据读取到本地内存。数据通过UB Tile作为中间暂存缓冲区进行传输。
当GlobalTensor超出UB Tile容量时,TGET将自动执行二维滑动——沿行(DIM_3)和列(DIM_4)分块以适配Tile,并遍历所有外层维度(DIM_0、DIM_1、DIM_2)。
对有效区域内每个元素 [object Object]:
数据流:[object Object] → [object Object] → [object Object]
同步形式:
[object Object]
降级时会为GM→UB→GM数据路径引入UB暂存Tile;C++内建接口需要显式传入 [object Object](或 [object Object] / [object Object])操作数。
声明于 [object Object]
[object Object]
使用两个暂存Tile,将相邻块的TGET与TSTORE重叠执行,隐藏DMA传输延迟。
[object Object]
- 类型约束:
[object Object]必须等于[object Object]。[object Object]必须等于[object Object]。[object Object]必须等于[object Object]。
- 内存约束:
[object Object]必须指向远端地址(源NPU)。[object Object]必须指向本地地址(当前NPU)。[object Object]/[object Object]/[object Object]必须预先在统一缓冲区中分配。
- 有效区域:
- 传输大小由
[object Object]的形状决定(自动分块以适配Tile)。
- 传输大小由
- 乒乓约束:
[object Object]和[object Object]必须具有相同的类型和维度。- 必须位于不重叠的UB偏移处。
[object Object]
[object Object]