网络采用自定义结构,torch框架迁移,内部包含自定义AICPU算子。
机器910a,CANN7.0.RC1
训练中
小数据集,单一场景下(如同一段数据,100帧左右),可以正常过拟合
大数据集,多场景下(如多段数据,7000帧),无法正常拟合,表现为:loss无法下降或者先下降后上升
对比同样的结构和训练策略,在GPU机器上能够正常拟合
不知道是什么原因,因为能够过拟合所以个人认为可以排除自定义算子的问题以及网络结构问题,但是不清楚是否昇腾机器有什么其它限制,或者训练时的特性和GPU不同,因此训练策略需要重新配置?
网络采用自定义结构,torch框架迁移,内部包含自定义AICPU算子。
机器910a,CANN7.0.RC1
训练中
小数据集,单一场景下(如同一段数据,100帧左右),可以正常过拟合
大数据集,多场景下(如多段数据,7000帧),无法正常拟合,表现为:loss无法下降或者先下降后上升
对比同样的结构和训练策略,在GPU机器上能够正常拟合
不知道是什么原因,因为能够过拟合所以个人认为可以排除自定义算子的问题以及网络结构问题,但是不清楚是否昇腾机器有什么其它限制,或者训练时的特性和GPU不同,因此训练策略需要重新配置?