异构计算架构CANN(Compute Architecture for Neural Networks)是昇腾针对AI场景推出的异构计算架构,向上支持多种AI框架,包括MindSpore、PyTorch、TensorFlow等,向下服务AI处理器与编程,发挥承上启下的关键作用,是提升昇腾AI处理器计算效率的关键平台。同时针对多样化应用场景,提供多层次编程接口,支持用户快速构建基于昇腾平台的AI应用和业务。
基于Ascend C算子编程语言进行算子开发,相关API请参见Ascend C算子开发接口。
基于TBE、AI CPU接口开发TBE和AI CPU自定义算子,相关API请参见TBE&AI CPU算子开发接口。
使用毕昇编译器将算子代码编译成二进制可执行文件和动态库等形式的指导。
基于MLIR构建的,面向昇腾亲和算子编译时使用的中间表示
基于GE提供的接口构图,相关API请参见GE图引擎接口。
基于DataFlow C++和PythonAPI构图(FlowGraph),相关API请参见DataFlow构图接口。
基于昇腾AI处理器的高性能集合通信库,提供单机多卡以及多机多卡间的数据并行、模型并行集合通信方案,并支持通信算子的自定义开发,相关API请参见HCCL集合通信库接口。
本文档提供单边通信库的开发指南,用于指导开发者如何使用单边通信库接口实现集群间的数据传输,构建大模型推理分离式框架,相关API请参见HIXL单边通信库接口。
介绍Ascend Transformer Boost加速库的使用方法,提升Transformer模型的训练和推理开发效率,相关API请参见ATB加速库接口。
介绍信号处理领域相关的高性能算子的使用方法,相关API请参见SiP加速库接口。
使用LLM DataDist接口对大模型的推理进行分离部署,从而提高大模型推理的吞吐性能,相关API请参见LLM DataDist接口。
提供系统配置、运行时管理、单算子执行、模型执行、媒体数据预处理等功能的C&C++和Python API。
ISP提供的各种图像调优算法API。
Ascend C提供的基础API、高阶API等。
提供TBE&AI CPU算子开发需要使用的相关API。
通过GE图引擎接口构造直接在昇腾平台上运行的图。
通过DataFlow C++和Python API构建、修改、编译和执行计算图,同时提供UDF接口,支持用户通过FuncProcessPoint和GraphProcessPoint编写自定义处理函数。
提供通信算子接口与通信域管理接口,用于实现分布式能力,另外HCCL还提供了通信算子开发接口,供开发者自定义通信算子。
单边通信库提供C++与Python两种语言的接口,面向集群场景提供简单、可靠、高效的点对点数据传输能力。
提供丰富的深度优化、硬件亲和的高性能算子。
使用ATB加速库需要的相关接口,包括公共类定义如Operation类、单算子类和图算子类等。
使用SiP加速库需要的相关接口,包括信号处理领域相关的高性能算子等。
LLM DataDist接口提供了集群KV数据管理能力,以支持全量图和增量图分离部署。
AOE自动调优工具提供调优API用于自动调优,提供查询知识库API用于查询之前生成的知识库文件,获取tiling。
算子开发和图开发时依赖的基础数据结构和接口说明。
CANN开放代码中依赖的接口,包括错误上报接口、日志接口,本文旨在便于您了解这部分接口在CANN开放代码中的作用。
提供PyTorch训练场景开发工具、大模型推理开发工具、算子开发工具快速入门指导。
算子开发工具集(msKPP、msOpGen、msOpST、msSanitizer、msDebug和msProf等)的使用指导。
编译算子生成算子二进制文件。
模型转换工具,将网络模型转换为昇腾AI处理器支持的.om格式离线模型。
自动调优工具,充分利用硬件资源,提升网络的性能。
将PyTorch训练脚本一键式迁移至昇腾NPU。
精度比对,辅助定位模型精度问题。
训练、推理各运行阶段的性能数据采集和分析。
测试HCCL集合通信的功能正确性以及性能。
模型压缩工具包,提供量化、张量分解等多种模型压缩特性。
模型训练和推理过程中的内存问题定位。