我使用torch_npu.profiler.profile获得了trace_view.json,在代码中添加了torch_npu.npu.mstx.range_start确定算子所属模块。
我现在做了两组实验,一组是图模式训练,一组是eager模式训练,我发现某个decoder模块的算子图模式训练包含了91个,而eager模式算子包含了105个,
然后我打印所有算子的dur时间,图模式的91个算子共用了4.68ms,而eager模式的105个算子共用了3.27ms,
而这个decode模块的运行时间图模式是15ms,eager是45ms,可能是因为wait的时间图模式比eager要短
以上的实验是否有问题?
还有我想问下通常情况下图模式是否应该比eager模式要快,为什么反而慢一些
我使用torch_npu.profiler.profile获得了trace_view.json,在代码中添加了torch_npu.npu.mstx.range_start确定算子所属模块。
我现在做了两组实验,一组是图模式训练,一组是eager模式训练,我发现某个decoder模块的算子图模式训练包含了91个,而eager模式算子包含了105个,
然后我打印所有算子的dur时间,图模式的91个算子共用了4.68ms,而eager模式的105个算子共用了3.27ms,
而这个decode模块的运行时间图模式是15ms,eager是45ms,可能是因为wait的时间图模式比eager要短
以上的实验是否有问题?
还有我想问下通常情况下图模式是否应该比eager模式要快,为什么反而慢一些