我用 msprof 查看算子的计算内存热力图时,发现 L2 cache 命中率很低,L2 write 只有 0.54%,L2 Read 只有 12%,教程里有一篇 L2 cache 切分的教程,但是没有完全理解。请问开发者在写算子的时候能感受到 L2 cache 的存在吗,我理解 L2 cache 是 HBM 和 unified buffer 中间的一块内存,他是位于AI core 外部吗?想问一下有没有一个完整的案例可以参考?如果要根据 L2 cache 切分数据的话如何查看 L2 cache 的容量,可以用 API 查看 L2 cache 的大小吗?


我用 msprof 查看算子的计算内存热力图时,发现 L2 cache 命中率很低,L2 write 只有 0.54%,L2 Read 只有 12%,教程里有一篇 L2 cache 切分的教程,但是没有完全理解。请问开发者在写算子的时候能感受到 L2 cache 的存在吗,我理解 L2 cache 是 HBM 和 unified buffer 中间的一块内存,他是位于AI core 外部吗?想问一下有没有一个完整的案例可以参考?如果要根据 L2 cache 切分数据的话如何查看 L2 cache 的容量,可以用 API 查看 L2 cache 的大小吗?