在 SetBlockDim 中提示“针对 Vector/Cube 融合计算的算子,启动时,按照 AIV 和 AIC 组合启动”。假设AI 处理器上有40个 Vector 核和20个 Cube 核,设置block_dim为20。这使得一个组合中包含2个 Vector 核和1个 Cube 核。
我观察到开源仓库中的算子似乎并不感知组合中的资源情况。我的疑问如下:
- 对于每个 block,实际执行时是如何利用两个 Vector Core 的算力的?在性能优化方面有什么要求?
- 能够利用两个 Vector Core 的 UB 空间吗,还是只有一份?
- 对于调度程序而言,如何获知
block_dim =20为组合启动,而不是仅启用了一半的 Vector Core?
在 SetBlockDim 中提示“针对 Vector/Cube 融合计算的算子,启动时,按照 AIV 和 AIC 组合启动”。假设AI 处理器上有40个 Vector 核和20个 Cube 核,设置
block_dim为20。这使得一个组合中包含2个 Vector 核和1个 Cube 核。我观察到开源仓库中的算子似乎并不感知组合中的资源情况。我的疑问如下:
block_dim =20为组合启动,而不是仅启用了一半的 Vector Core?