CANN软件版本配套表
[object Object]CANN与Ascend HDK版本兼容
[object Object]CANN 9.1.0包含Toolkit包、算子包(ops)、加速库(NNAL)3个组合包,CANN组合包与子包的配套关系如下。其中6个子包支持独立升级,用户可根据需求灵活安装。
[object Object]CANN ops包已与Toolkit解耦,支持独立升级,用户可根据使用需求灵活安装。
新增支持[object Object]Ascend 950DT[object Object]产品,在训练和Decode推理场景下,提供更高带宽能力。
基于Atlas A2 系列产品、Atlas A3 系列产品和[object Object]Ascend 950 系列产品[object Object],新增核心算子SMLA、mHC等,支持DeepSeekV4、Qwen3.6、Kimi-K2.6、GLM5.2等多个开源模型适配。
基于[object Object]Ascend 950 系列产品[object Object],SHMEM首发支持AICore直驱MTE/UDMA/RDMA,开启UB和RoCE通信,并配套提供编程接口。
基于[object Object]Ascend 950 系列产品[object Object],CATLASS新增支持Tile组件,提供丰富的MxFP8/MxFP4量化模板及样例库。
- CPU性能调优:
- CANN适配不同昇腾硬件产品,新增OS兼容性支持:
- Atlas 350 加速卡适配Tlinux 3.3、Tlinux 4.4、Anolis OS 8.9。
- Atlas 950 SuperPoD、Atlas 850/850E 适配 openEuler 24.03 lts sp4。
- CANN支持Python 3.14.*版本,支持CANN在高版本Python下运行。
- 提供query_pkg_version.sh软件版本信息查询脚本,一键查询各组件的版本信息。
[object Object]Ascend 950PR/Ascend 950DT[object Object]适配与场景支持:
性能优化:
- [object Object]Ascend 950PR/Ascend 950DT[object Object]新增适配以下算子:[object Object]
- 新增适配以下算子:[object Object]
- GridSampler2DGrad算子()。[object Object]
- UpsampleNearestExact2d/3d算子()。[object Object]
- UpsampleNearestExactGrad算子()。[object Object]
- UpsampleTrilinear3d算子()。[object Object]
- CIoU算子()。[object Object]
- BlendFaceBgPartTwo算子()。[object Object]
- SpatialTransformer算子()。[object Object]
- adjust_saturation算子()。[object Object]
- scaleandtranslate算子()。[object Object]
- BoundingBoxEncode算子()。[object Object]
- NMSWithMask算子()。[object Object]
- ExtractGlimpseV2、UpsampleBicubic2d算子()。[object Object]
- UpsampleNearestExact1d及系列反向算子( )。[object Object]
- 算子新增特性支持:[object Object]
- 新增适配以下算子:[object Object]
- 性能优化:[object Object]
- 新增特性:[object Object]
- 性能优化:[object Object]
- 卷积算子功能性能优化,优化多模态网络性能,内存占用不劣化():[object Object]
- dX支持超大W输入场景对W切分。[object Object]
- dW支持确定性场景下开启性能优化特性。[object Object]
- dX支持stride=kernel和fmap=kernel场景转MM,优化性能。[object Object]
- [object Object]Ascend 950PR/Ascend 950DT[object Object]新场景支持:[object Object]
- nn仓工程优化:[object Object]
- Atlas A2系列产品和Atlas A3系列产品的Cube类算子能力增强,优化网络性能并减少部分场景的内存占用:[object Object]
注意力(Attention/MLA)类
- 新增SparseFlashMla(稀疏FlashMLA)算子,并支持稀疏注意力KV合并,提升长序列稀疏注意力场景的计算与访存效率(、)。
- 新增LightningIndexerV2算子()。
- 新增aclnnBlockSparseAttentionV2接口,适配FP8量化的BlockSparseAttention算子;BlockSparseAttention在A5上支持FP8场景性能改进与BSND输入排布,[object Object]Ascend 950PR/Ascend 950DT[object Object]正向/推理的量化与非量化kernel支持LSE输出,并新增BlockSparseAttentionGrad反向算子(、、、、)。
- FusedInferAttentionScore支持LSE输出,AttentionUpdate在A2/A3支持sp128(、)。
- ScatterPaKvCache/GatherPaKvCache新增cache首轴非连续tensor支持,MlaProlog支持KVCache非连续输入(、)。
- RecurrentGatedDeltaRule支持state前两轴非连续,SMLAG新增torch适配及新特性支持(、)。
MoE类
- MoeInitRoutingV3非量化场景支持DropPad,UnpermuteWithRoutingMap新增N规格non-topk支持(、)。
- MegaMoe新增A2/A3 Tiling、静态tensor及syncfunc功能,并补充A2/A3 kernel(、)。
GMM(GroupedMatmul)量化类
- GroupedMatmulFinalizeRouting在A5上新增W8A8场景的确定性支持()。
- GroupedMatmulSwigluQuantV2新增WeightNz MxA8W4数据流及MXFP4权重NZ格式支持(、、)。
- GMM和GMMAdd GlistType规格增强(、)。
MC2(通信-计算融合)类
- 新增AllToAllMatmulV2算子()。
- AllGatherMatmulV2、AllToAllVGroupedMatmul/GroupedMatmulAllToAllV增加comm_mode通信引擎参数,支持选择通信引擎(、)。
- MatmulReduceScatterV2适配AICPU通信()。
Mhc类 针对Atlas A2系列产品和Atlas A3系列产品新增支持以下算子:
- Ascend 950PR支持CCU场景的allGatherV/reduceScatterV算子( )。
- Ascend 950PR支持GE图模式&aclGraph模式下的通信算子入图( )。
- Ascend 950PR支持N秒快恢能力,提升集合通信运行可靠性( )。
- Ascend 950PR支持taskexception&profiling等维测能力,提升问题定位易用性( )。
- Ascend 950PR上,HcclChannelAcquire接口支持AIV直驱RoCE和URMA能力,支撑通算融合算子的自定义开发()。
- Atlas A2/A3系列产品上,单卡多进程能力新增支持MC2场景()。
- Atlas A2/A3系列产品上,aclGraph场景下资源管理优化,支撑通信资源增量刷新( )。
- Atlas A2/A3系列产品上,跨超节点场景性能优化,ReduceScatter/AllGather算子支持跨超pipeline算法( )。
- Atlas A2/A3系列产品上新增支持双机背靠背RoCE直连机型通信( )。
- Atlas 350 加速卡支持跨PCIE SW进行通信( ),AllReduce、ReduceScatter、AllGather、Reduce、Scatter、Alltoall、Alltoallv、Send、Recv等算子支持通信。
- HIXL 底层通信接口开放:构建 Client-Server 模式单边通信能力,全面提升建链规格与建链性能。针对批量小 Buffer 传输场景深度优化,有效降低片上内存占用与通信资源开销()。
- HIXL 网络传输协议扩展:单边通信新增 UBC、UBoE、Host RoCE 协议支持,完整覆盖 D2D、D2rH、rH2D、H2H 全场景数据传输(),不同产品形态的协议支持清单可查阅社区。
- HIXL 智能链路管理升级:实现通信资源自动获取及智能路由选择(),支持按需建链(),简化使用流程,提升易用性。
- HIXL 编程 API 能力增强:扩展异步链路管理()、传输状态批量查询()两类接口,丰富异步编程范式,提升上层业务开发效率。
- 支持Ascend 950DT形态图引擎能力恢复。
- ge.autoMultistreamParallelMode新增MainStream和LoadBalance选项,基于最小路径覆盖算法将静态Shape模型的计算节点自动划分至最少逻辑流,实现多流并行加速。
- 新增PortableOp算子类型,面向离线推理场景提供自定义算子的序列化与反序列化能力。
- ATC和aclgrph接口支持集群配置文件路径设置,用于生成含有HCCL通信任务的离线OM模型,满足多卡离线推理场景下的通信域配置需求。
在Ascend 950PR/Ascend 950DT上接入核心算子 批量落地GELU、LayerNorm、MatmulEinSum、RmsNormQuant、SwiGluQuant(ACLNN V2)、Linear反量化,以及支持AllGather/AllReduce/ReduceScatter等通信算子( 、 、 、 、 、 、)。
Attention/KV Cache推理增强
torch_atb 独立编译与 ABI 体系
- 在[object Object]Ascend 950PR/Ascend 950DT[object Object]上新增适配以下算子:
支持Ascend 950DT的AclGraph场景stream规格扩充,解决大模型资源不足等问题()。
- 维测能力:
- 编译工程
- 基础API
- SIMT编程
- SIMD样例:
- 新增最佳实践样例:matmul+gelu融合、datacopy优化、bank冲突优化、group_matmul量化组矩阵乘、simt&simd高性能编程( 、 、、 、)。
- 新增[object Object]Ascend 950PR/Ascend 950DT[object Object]新特性样例及兼容性样例整改:loopmode数据搬运、interleave矢量计算、datacopy_gm2l1、loadmx(Load2DMX)、mmad_mx、data_copy_pad等( 、 、)。
- 新增RegBase基础样例:基础算术、数据类型转换、归约、比较、索引等样例( 、 、)。
- 新增SIMD VF print样例和dump样例()。
- 新增Tensor API入门及最佳实践样例:Matmul入门、数据搬入搬出、搬出随路量化、MX FP4最佳实践()。
- SIMT样例:
基础Vector&Cube指令:
通信类指令:
CostModel仿真:
CPU-SIM:随NPU同步新增CPU仿真指令。
include/driver目录头文件已迁移到pkg_inc/driver目录,include/driver目录将在2027年06月30日下线,请尽快切换至pkg_inc/driver目录。
自[object Object]Ascend 950 系列产品[object Object]开始,aclblas和aclop接口不推荐使用,后续版本将逐步废弃,建议迁移至对应的aclnn算子接口。
- 不兼容变更:控制类算子Identity、IdentityN、Rank、Shape和ShapeN从ops-nn迁移至ops-math。这些算子从
[object Object]和[object Object]目录迁移到[object Object]和[object Object]目录,用户需更新相关头文件引用(、)。
transformer库以下接口在CANN 9.0.0中被标记为废弃,将在2027年3月30日之后的版本删除
- aclnnGroupedMatMulAllReduce接口废弃,替换为:aclnnMatmulAllReduce。
- aclnnGroupedMatmul/aclnnGroupedMatmulV2/aclnnGroupedMatmulV3/aclnnGroupedMatmulV4接口废弃,替换为:aclnnGroupedMatmulV5。
- aclnnFusedInferAttentionScore/aclnnFusedInferAttentionScoreV2/aclnnFusedInferAttentionScoreV3接口废弃,替换为:aclnnFusedInferAttentionScoreV4。
- aclnnIncreFlashAttention/aclnnIncreFlashAttentionV2/aclnnIncreFlashAttentionV3接口废弃,替换为:aclnnIncreFlashAttentionV4。
- aclnnPromptFlashAttention/aclnnPromptFlashAttentionV2接口废弃,替换为:aclnnPromptFlashAttentionV3。
- aclnnMlaProlog/aclnnMlaPrologV2WeightNz接口废弃,替换为:aclnnMlaPrologV3WeightNz。
- aclnnMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnMatmulAllReduce和aclnnAddRmsNorm。
- aclnnQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnQuantMatmulAllReduceV2和aclnnAddRmsNorm。
- aclnnWeightQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnWeightQuantMatmulAllReduce和aclnnAddRmsNorm。
- aclnnInplaceQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnQuantMatmulAllReduceV2和aclnnAddRmsNorm。
- aclnnInplaceMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnMatmulAllReduce和aclnnAddRmsNorm。
- aclnnInplaceWeightQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnWeightQuantMatmulAllReduce和aclnnAddRmsNorm。
模型压缩工具以下特性在CANN 9.0.0标记为废弃,在当前版本已经删除。
- 非均匀量化。
- 自动混合精度。
- 近似校准。
- int4量化感知训练。
- amct_mindspore所有特性。
问题现象:算子aclnnMatmulCompressDequant的输入参数deqScale的值为inf/-inf时,其精度详情中显示有inf或nan 【引入版本】CANN 8.5.0 【缺陷影响】测试特殊构造用例触发,非新算子引入,且实际量化场景下不会有deqScale为-inf和inf场景,当前版本影响可控 【规避方案】实际量化场景下不会有deqScale为-inf和inf场景
以下问题在9.1.0版本修复:
- 修复了QuantBatchMatmulV3算子在Atlas推理系列产品上,编译时指定AUTO_SYNC=false导致算子读写冲突的问题。
- 针对Atlas A2系列产品和Atlas A3系列产品,修复了MatmulReduceScatterV2算子在M小于512场景下,flag位清零过快导致其他卡检测不到,最终超时的问题。
- 修复了Atlas A2系列产品的大EP场景下,D节点注入片上内存多bit故障,无法进入快速恢复流程的问题。
- 修复了4k卡训练任务在500+step后,随机step位置概率性出现的通信超时问题。
- 修复了PD分离场景,decode频繁任务中断重启导致的refill积压问题。
- 修复了开源仓用户自定义算子和内置算子IR原型重名不生效的问题。
- 修复了aclnnAddmv算子压测偶现coredump的问题。
- 修复了万卡任务拉起时异常报错的问题。
- 修复了aclgraph场景特定shape下,MatMulV3性能比MatMulV2差的问题。
- 修复了fused_quant_mat_mul场景存在的精度问题。
- 修复了BatchMatmulV2在特定bias场景下存在的精度问题。
- 修复了FAG算子短序列GQA、NoMask场景存在的精度问题。
- 优化“入门教程”章节:
- 更新Ascend C学习路径。
- 新增异构系统和编程模型概括性描述。
- “编程指南”中SIMD编程模型章节进行优化调整,按照基于语言扩展层C API编程、基于Tensor的C++编程、基于Tpipe和TQue编程的维度进行分类。
- “编程指南”新增高级编程 > SuperKernel、高级编程 > SIMT协作组章节。
- 对《Ascend C API》进行了大规模重构,变更点如下:
- 对数据搬运API和矩阵计算API等进行了目录结构调整:相关性强的API放置在临近位置,比如将矩阵计算相关的搬运接口放置在矩阵计算目录下。
- 按照场景进行API的目录结构组织:比如矩阵计算分为矩阵计算的搬入、Mmad计算、矩阵计算的搬出。
- 针对一类API增加必要的背景知识、概念原理介绍、通用的约束、关键特性等说明。
- 针对每一个API补充约束说明、参数特殊值相关说明。
- 新增API附录,附录中包含API流水类型汇总、理论性能汇总、接口边界值汇总等。
- 新增Tensor API参考文档。Tensor API接口为试验接口,在后续版本中可能会调整或改进,不保证后续兼容性。请开发者在使用过程中关注后续版本更新。
- 新增矩阵计算概述和计算分形介绍的文档()。
- 优化矢量计算API文档,补充指令约束等()。
- 增加SIMD与SIMT混合编程性能优化概述()。
- 搭建VitePress文档站点,提供AscendC资料预览功能()。
- 新增“编程模型与概念 > CCU编程模型与概念”章节。
- 新增“通信算子开发 > CCU算子开发”章节。
- 通信算子开发API新增以下接口。
- 控制面接口 > CCU Kernel生命周期与内存Token管理。
- 数据面接口 > CCU接口。
新增以下章节:
- 自定义Pass开发 > 使用自定义Pass修改Graph > 基于Pattern匹配实现Pass(Python)。
- 编程指南 > SuperKernel融合范围标定。
- 自定义算子入图 > 自定义算子入图。
- 接口参考 > Python语言接口 > pyatc接口:新增Python场景的atc命令行工具。
- 图基础数据结构和接口 > options参数名说明 > ge.tiling_schedule_optimize:修改该参数级别,由原来global session级修改为all所有级别。
- 将历史版本中“算子库 > AI框架算子支持清单”章节独立出来,在当前版本新增《AI框架算子支持清单》手册。
- 新增“算子库 > 算子接口(torch_extension)”章节。
- “算子接口(aclnn)”新增RAS类接口章节。
- ops-cv库新增算子多平台迁移指南文档,指导开发者将算子从Atlas A2 系列产品迁移至Ascend 950PR/Ascend 950DT。
相关参考 > 通信算子支持度清单:新增“Ascend 950PR/Ascend 950 DT”支持度清单。
- 新增测试框架指南,补充testframework编译运行依赖使用说明()。
- 补充cxx_abi版本判断方法说明()。
- 更新文档链接至CANN 9.1和PyTorch 26.0.0()。
- 修正ATB_BUILD_DEPENDENCY_PATH及ABI判断说明,覆盖README/FAQ/测试框架指南()。
参数说明--framework:补充说明Caffe框架在当前形态已不再演进,转模型不保证可用性的说明。
新增“基于LLM的量化”章节。