矩阵计算
通过BT Buffer实现高效的bias计算
通过FP Buffer存放量化参数实现高效随路量化
通过L0C Buffer数据暂存实现高效的矩阵乘结果累加
较小矩阵长驻L1 Buffer,仅分次搬运较大矩阵
Matmul使能AtomicAdd选项
父主题:
SIMD算子性能优化