华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
return x + self.cv2(self.cv1(x)) 修改为如下 return torch_npu.npu_add_custom(x.npu(), self.cv2(self.cv1(x)).npu()).cpu()
但是花的时间多了一点,具体应该是出在哪一步使得调用时间增加了呢,要怎么去逐步筛查调用的时间损耗?要如何优化?
我要发帖子
但是花的时间多了一点,具体应该是出在哪一步使得调用时间增加了呢,要怎么去逐步筛查调用的时间损耗?要如何优化?