1 系统环境
硬件环境(Ascend/GPU/CPU): Ascend/GPU/CPU
MindSpore版本: 不限版本
执行模式(PyNative/ Graph): 不限模式
Python版本: Python=3.7/3.8/3.9
操作系统平台: 不限
2 报错信息
2.1 问题描述
在使用 Mindspore 训练网络时,发现网络推理的时间过长。
2.2 报错信息
profiler 后发现大部分的时间都花在了 全连接层的 Matmul 矩阵乘法上,应该如何优化?
2.3 脚本代码
可根据描述自行构造
3 根因分析
******此处由用户补充详细的定位过程******
Matmul这样计算量比较密集的算子建议在执行前先cast为float16精度类型,计算结束后再cast回float32精度类型,这样可以加快计算速度。
4 解决方案
******此处由用户填写******
包含文字方案和最终脚本代码
支持上传附件
1 系统环境
硬件环境(Ascend/GPU/CPU): Ascend/GPU/CPU
MindSpore版本: 不限版本
执行模式(PyNative/ Graph): 不限模式
Python版本: Python=3.7/3.8/3.9
操作系统平台: 不限
2 报错信息
2.1 问题描述
在使用 Mindspore 训练网络时,发现网络推理的时间过长。
2.2 报错信息
profiler 后发现大部分的时间都花在了 全连接层的 Matmul 矩阵乘法上,应该如何优化?
2.3 脚本代码
可根据描述自行构造
3 根因分析
******此处由用户补充详细的定位过程******
Matmul这样计算量比较密集的算子建议在执行前先cast为float16精度类型,计算结束后再cast回float32精度类型,这样可以加快计算速度。
4 解决方案
******此处由用户填写******
包含文字方案和最终脚本代码
支持上传附件