内存访问
尽量一次搬运较大的数据块
GM地址尽量512B对齐
高效的使用搬运API
非对齐场景减少无效数据的搬运
非连续搬运场景减少搬运次数
避免同地址访问
设置合理的L2 CacheMode
算子与高阶API共享临时Buffer
纯搬运类算子VECIN和VECOUT建议复用
通过缩减Tensor ShapeInfo维度,优化栈空间
避免Unified Buffer的bank冲突
L2 Cache切分
父主题:
SIMD算子性能优化