头尾开销优化
设置合适的核数和算子Kernel类型
限制TilingData结构大小
避免TPipe在对象内创建和初始化
核函数内删除Workspace相关冗余操作
设置DCI编译选项来减少算子尾开销
父主题:
SIMD算子性能优化