使用CANN的Ascend-DMI工具进行性能剖析时,如何准确解读AI Core的“流水线停顿”指标?
收藏回复举报
使用CANN的Ascend-DMI工具进行性能剖析时,如何准确解读AI Core的“流水线停顿”指标?
发表于2025-12-10 00:41:38
0 查看

我们在使用Ascend-DMI(Ascend Debug and Monitoring Interface)对昇腾310P上的自定义算子进行性能剖析时,在AI Core的性能计数器中看到较高的“流水线停顿”(Pipeline Stall)比例,但难以定位具体原因。

具体表现为:

  1. Vector Pipe和Cube Pipe的Stall Cycles占比超过30%

  2. 但Memory Read/Write带宽并未饱和,计算指令的发射率也正常

我们的疑问是:

  1. AI Core流水线停顿通常由哪些因素导致?如何区分是“数据依赖停顿”、“资源冲突停顿”还是“控制流停顿”?

  2. Ascend-DMI中有哪些关键计数器组合可以帮助精确定位停顿类型?(例如,Stall Wait Dep 和 Stall Resource 的具体含义是什么?)

  3. 针对不同的停顿类型,在算子代码层面有哪些具体的优化手段?

本帖最后由 匿名用户2025/12/19 15:06:00 编辑

我要发帖子