ReduceSum高阶api:ReduceSum-CANN社区版9.1.0-beta.1-昇腾社区 (hiascend.com)
芯片型号:A2/A3
背景:使用ReduceSum高阶api,
将shape为[m,k]的Tensor求和为shape为[m,1]的Tensor,数据类型是fp32。当前源操作数空间给的buffer大小是m*Align(k)*sizeof(fp32), Align(*),表示32字节对齐,目的操作数空间给的buffer大小是m*Align(1)*sizeof(fp32)。但是使用内存检查工具mssanitizer时发现有内存写越界,想咨询一下是否是对目的操作数空间有要求,中间结果会复用目的操作数?目的操作数的空间只给m*1*sizeof(fp32)并32字节对齐是有问题的?
ReduceSum高阶api:ReduceSum-CANN社区版9.1.0-beta.1-昇腾社区 (hiascend.com)
芯片型号:A2/A3
背景:使用ReduceSum高阶api,
将shape为[m,k]的Tensor求和为shape为[m,1]的Tensor,数据类型是fp32。当前源操作数空间给的buffer大小是m*Align(k)*sizeof(fp32), Align(*),表示32字节对齐,目的操作数空间给的buffer大小是m*Align(1)*sizeof(fp32)。但是使用内存检查工具mssanitizer时发现有内存写越界,想咨询一下是否是对目的操作数空间有要求,中间结果会复用目的操作数?目的操作数的空间只给m*1*sizeof(fp32)并32字节对齐是有问题的?