---
title: 昇腾开发技术文章-应用案例-技术视频-昇腾社区
description: 提供昇腾相关技术文章、应用案例、文档速递和技术视频，方便用户快速学习成长。
keywords: 昇腾开发技术文章,应用案例,技术视频,昇腾社区,官方技术文章,FAQ,Function Call,ID
url: https://www.hiascend.com/developer/techArticles
section: (其他)
---

# 昇腾开发技术文章-应用案例-技术视频-昇腾社区

URL: https://www.hiascend.com/developer/techArticles
描述: 提供昇腾相关技术文章、应用案例、文档速递和技术视频，方便用户快速学习成长。
关键词: 昇腾开发技术文章,应用案例,技术视频,昇腾社区,官方技术文章,FAQ,Function Call,ID

## 官方技术文章

服务器运维监控平台参考实践 [了解详情](https://www.hiascend.com/zh/developer/techArticles/20251217-1?envFlag=1)

NPU虚拟化软切分参考实践 [了解详情](https://www.hiascend.com/zh/developer/techArticles/20260310-1?envFlag=1)

企业级类Claw一体机参考实践 [了解详情](https://www.hiascend.com/zh/developer/techArticles/20260630-5?envFlag=1)

执行 npu-smi 命令返回 -8005 错误码的排查与解决 [了解详情](https://www.hiascend.com/zh/developer/techArticles/20260603-7?envFlag=1)

技术领域

全部

故障案例

实战经验

FAQ

技术视频

综合排序

最新

最热

vLLM流式Function Call工具调用内容缺失问题排查与解决

vLLM流式Function Call工具调用内容缺失问题排查与解决

vLLM

在基于 vLLM 框架部署大模型推理服务时，Function Call是扩展模型能力的关键特性。在使用流式 Function Call 功能时，会出现响应提前结束、工具调用参数或 ID 解析不完整的情况，导致下游 Agent 无法正确执行后续工具调用。

2026/08/03

49

1

Atlas 800I A2 物理机场景下算力切分导致业务拉起失败

算力切分技术文章

Atlas 800I A2 推理服务器支持 NPU 算力切分（vNPU）功能，将单张物理 NPU 的算力划分为多个虚拟功能（VF），以适配容器或虚拟机等虚拟化场景，从而提升资源利用率并降低部署成本。

2026/07/27

92

2

Atlas 200T A2 Box16 多机推理部署中 MindIE 启动失败

MindIE技术文章

Atlas 200T A2 Box16 在进行多机分布式推理部署时，MindIE 作为核心推理引擎，依赖于准确的节点拓扑信息来建立 HCCL 通信域。在实际开发过程中，若多机环境下的 `ranktable` 配置文件配置不当，导致 Batchscheduler 组件在初始化 HCCL 通信域时失败，进而引发 MindIE 服务启动异常。

2026/07/27

49

2

双机容器场景下 HCCL_Test 执行报错 "No such file or directory"

技术文章HCCL

在使用 HCCL_Test 工具进行双机多卡通信性能测试时，遇到执行命令后进程长时间卡住，并伴随 ` No such file or directory` 报错的现象。

2026/07/27

65

1

LongBench-v2 数据集在 MiniMax-M2.5 模型精度测试中的超长输入问题

算子异常

LongBench-v2 数据集在 MiniMax-M2.5 模型精度测试中的超长输入问题

2026/07/27

8

0

Atlas 300I Duo 上 Qwen3-32B 推理中断问题排查与解决

模型推理

在 Atlas 300I Duo 推理卡上部署 Qwen3-32B-w8a8s-310 模型进行推理时，遇到了推理中断的问题。本文记录了该问题的现象、排查过程、根因分析及解决方案，供遇到类似问题的开发者参考。

2026/07/27

25

0

驱动异常问题定位与解决

昇腾部署

在基于 Atlas 800 (Model 3000) 的推理环境中，容器化推理服务启动时出现异常，导致服务无法正常拉起。本文记录了该问题的完整排查过程与解决方案，旨在帮助开发者快速定位类似问题。

2026/07/24

15

0

Atlas 900 A2 PoD 环境中虚拟内存与单进程多卡特性互斥

技术文章模型训练

在 Atlas 900 A2 PoD 的中心训练硬件平台上，常利用 PyTorch 的虚拟内存特性优化显存使用，或通过单进程多卡特性简化多卡并行逻辑。然而，在特定软件版本组合下，这两种特性存在兼容性限制。若未正确识别该限制，推理作业在首次拉起时即可能因底层内存管理冲突导致启动失败。

2026/07/24

15

0

FSDP2 与反向重计算协同使用时的显存优化实践

性能调优

在大规模深度学习模型训练中，显存资源是制约模型规模扩展的关键瓶颈。Fully Sharded Data Parallel（FSDP）作为一种高效的分布式训练策略，通过将模型参数分片存储于多张 GPU 上，显著降低了单卡显存占用，支持超大模型的训练。然而，在结合反向重计算（Checkpointing）技术以进一步节省显存时，部分场景下仍可能出现显存占用异常升高的问题。本文聚焦于 FSDP 与反向重计算协同使用时的显存管理问题，分析其根本原因并提出有效解决方案。

2026/07/24

10

0

DeepSeek 双机部署 HCCL 通信组创建失败排查与解决

技术文章HCCL

在集群部署DeepSeek等大模型时，`Create the hccl communication group failed` 错误多由跨机HCCL通信配置不当引发。根因常为ranktable文件中IP、端口或Rank映射错误，导致节点间无法建立可靠通信通道。

2026/07/24

84

1

共 348 条

5条/页

10条/页

15条/页

1

2

3

4

5

6

7

35

前往
