---
title: NPU模组异常掉电&上电超时故障处理-官方技术文章-昇腾社区
description: 在中心训练硬件系统的日常运维过程中&#xff0c;NPU模组作为核心计算单元&#xff0c;其稳定运行直接影响整体训练任务的连续性与系统可靠性。在实际现网环境中&#xff0c;偶发出现NPU模组异常掉电或上电超时等问题&#xff0c;可能导致设备掉卡、业务中断等严重后果。本文基于典型故障案例&#xff0c;系统梳理NPU模组异常掉电与上电超时的排查流程与处理方案&#xff0c;旨在为硬件维护人员提
keywords: NPU,模组异常掉电,上电超时故障,处理,官方技术文章,昇腾社区,背景概述,问题现象描述
url: https://www.hiascend.com/developer/techArticles/20260603-8
section: (其他)
---

# NPU模组异常掉电&上电超时故障处理-官方技术文章-昇腾社区

URL: https://www.hiascend.com/developer/techArticles/20260603-8
描述: 在中心训练硬件系统的日常运维过程中&#xff0c;NPU模组作为核心计算单元&#xff0c;其稳定运行直接影响整体训练任务的连续性与系统可靠性。在实际现网环境中&#xff0c;偶发出现NPU模组异常掉电或上电超时等问题&#xff0c;可能导致设备掉卡、业务中断等严重后果。本文基于典型故障案例&#xff0c;系统梳理NPU模组异常掉电与上电超时的排查流程与处理方案&#xff0c;旨在为硬件维护人员提
关键词: NPU,模组异常掉电,上电超时故障,处理,官方技术文章,昇腾社区,背景概述,问题现象描述

官方技术文章 [了解详情](https://www.hiascend.com/zh/developer/techArticles)

NPU模组异常掉电&上电超时故障处理

NPU模组异常掉电&上电超时故障处理

硬件异常处理

发表于: 2026/06/03

21

0

## 背景概述

在中心训练硬件系统的日常运维过程中，NPU模组作为核心计算单元，其稳定运行直接影响整体训练任务的连续性与系统可靠性。在实际现网环境中，偶发出现NPU模组异常掉电或上电超时等问题，可能导致设备掉卡、业务中断等严重后果。本文基于典型故障案例，系统梳理NPU模组异常掉电与上电超时的排查流程与处理方案，旨在为硬件维护人员提供清晰、可操作的技术指导，提升故障定位效率与处理准确性。

## 问题现象描述

### 硬件配置

Atlas 900 A2 PoDc

### 故障现象

问题一：NPU模组3异常掉电

BMC上报告警：

The Ascend  AI Module3 power V_DRMOS failure results abnormal power-off.

对应模组出现非预期断电，导致设备连接中断。

问题二：NPU模组5上电超时

BMC上报告警：

The Ascend  Base board power V_12V0_HAM5 failure results host power-on timed out.

模组在上电过程中未能完成初始化，触发超时告警。

问题三：复合型故障（含电源与模组问题）

BMC上报相同上电超时告警：

The Ascend  Base board power V_12V0_HAM5 failure results host power-on timed out

PSU2通信超时：iBMC cannot communicate with PSU 2

NPU Board5与NPU Board6互报严重告警，连接丢失：

NPU Board6 NPU has major alarm. NPU connection has been lost.

NPU Board5 NPU has major alarm. NPU connection has been lost.

## 原因分析

### 1.检查BMC事件日志

优先查看BMC日志路径 dump_info\LogDump\remote_log，确认是否存在相关电源砖（PSU）告警。

若存在PSU告警（如PSU2通信超时），则表明电源模块故障，可能引发对应NPU模组供电异常。

若无PSU告警，则问题聚焦于NPU模组或其载板供电电路。

### 2.区分异常掉电类型

若为NPU过温保护导致的掉电（如日志中出现 The Device OS was shut down due to NPU Board4 NPU overheating），需结合带内日志与业务负载分析温控策略。

若为非温控原因的异常掉电，优先尝试AC下电再上电恢复。

### 3.判断故障层级

AC下电恢复成功：可能为瞬时过流保护，需结合带内日志与业务操作进一步分析根因（建议联系技术支持）。

AC下电未恢复，或故障转为上电超时：表明模组或载板存在硬件故障，需进一步定位。

### 4.PSU供电逻辑说明

PSU1：供电NPU7-8

PSU2：供电NPU5-6

PSU3：供电NPU3-4

PSU4：供电NPU1-2

问题三中PSU2通信超时，直接导致NPU5与NPU6供电异常，引发上电超时与掉卡。

### 重启操作说明

AC下电：将整节点服务器从机柜中完全断电，拔出电源线后重新插入，实现彻底断电重启。适用于多数硬件级故障恢复。

DC下电：通过iBMC管理界面执行强制下电与上电操作，适用于无需物理断电的快速重启场景。

## 解决措施

针对NPU模组上电超时或异常掉电问题，建议按以下流程处理：

### 1. 优先排查电源输入

检查对应PSU是否上报告警。若存在PSU通信异常或供电故障，应优先更换故障电源模块。

### 2. 根据告警电压定位故障范围

若告警涉及 V_12V0_HAM5 或 V_DRMOS：

该类电压同时影响模组与载板，需进行交叉定位测试。

操作建议：

交换相邻NPU模组位置，执行AC下电重启。

若故障随模组迁移 → 判定为模组故障，更换模组。

若故障固定于原位置 → 判定为载板故障，更换载板。

若告警涉及其他电压（如V_DVDD09_AIC_DVFS等）：

般为模组内部供电异常，且AC下电无法恢复时，可直接判定为模组故障，建议更换模组。

### 3. 故障处理注意事项

更换前务必保存关键日志：包括OS日志、device日志、一键收集日志等，便于后续分析。

拆装过程中注意避免与载板、硬盘背板等周边器件发生碰撞，防止二次损伤。

### 总结

NPU模组异常掉电与上电超时问题，通常由电源输入异常、模组或载板供电电路故障引起。通过“先查PSU、再判电压、后交叉定位”的三步排查法，可高效定位故障根源。建议维护人员在处理过程中保持日志完整性，遵循标准操作流程，确保故障处理安全、准确、可追溯。

点赞 0

本页内容

背景概述 [了解详情](https://www.hiascend.com/#id-1)

[了解详情](https://www.hiascend.com/#id-2)

问题现象描述 [了解详情](https://www.hiascend.com/#id-3)

原因分析 [了解详情](https://www.hiascend.com/#id-4)

解决措施 [了解详情](https://www.hiascend.com/#id-5)
