开发者
下载
[object Object][object Object]

[object Object]

CANN软件版本配套表

[object Object][object Object]

CANN与Ascend HDK版本兼容

[object Object][object Object][object Object]

CANN 9.1.0包含Toolkit包、算子包(ops)、加速库(NNAL)3个组合包,CANN组合包与子包的配套关系如下。其中6个子包支持独立升级,用户可根据需求灵活安装。

[object Object][object Object]

CANN ops包已与Toolkit解耦,支持独立升级,用户可根据使用需求灵活安装。

[object Object]undefined
[object Object][object Object]undefined

子包独立升级的具体操作请参考

[object Object]
  • 新增支持[object Object]Ascend 950DT[object Object]产品,在训练和Decode推理场景下,提供更高带宽能力。

  • 基于Atlas A2 系列产品、Atlas A3 系列产品和[object Object]Ascend 950 系列产品[object Object],新增核心算子SMLA、mHC等,支持DeepSeekV4、Qwen3.6、Kimi-K2.6、GLM5.2等多个开源模型适配。

  • 算子开发场景资料上线,提供入门、进阶、深度创新多路径参考资料。

  • 基于[object Object]Ascend 950 系列产品[object Object],SHMEM首发支持AICore直驱MTE/UDMA/RDMA,开启UB和RoCE通信,并配套提供编程接口。

  • 基于[object Object]Ascend 950 系列产品[object Object],CATLASS新增支持Tile组件,提供丰富的MxFP8/MxFP4量化模板及样例库。

  • 算子精度标准开源,通过混合容差指标实现浮点计算类算子的精度判定。

[object Object][object Object]
  • CPU性能调优:
    • Toolkit新增mindstudio-boost子包,面向HostBound业务场景,支持对关键线程自动化绑核与资源隔离,实现性能调优()。
  • CANN适配不同昇腾硬件产品,新增OS兼容性支持:
    • Atlas 350 加速卡适配Tlinux 3.3、Tlinux 4.4、Anolis OS 8.9。
    • Atlas 950 SuperPoD、Atlas 850/850E 适配 openEuler 24.03 lts sp4。
  • CANN支持Python 3.14.*版本,支持CANN在高版本Python下运行。
  • 提供query_pkg_version.sh软件版本信息查询脚本,一键查询各组件的版本信息。
[object Object][object Object]
  • [object Object]Ascend 950PR/Ascend 950DT[object Object]适配与场景支持:

    • 新增适配以下算子
      • Diag()。
      • Asin()。
      • PadV2()。
      • Cross()。
      • AngleV2()。
      • CdistGrad()。
      • ReduceLogSum()。
      • Complex()。
      • AmpUpdateScale()。
      • ReduceNansum()。
      • Polar()。
      • Atan2()。
      • LogAddExp()。
    • 算子新增特性支持
      • BitwiseOr/BitwiseXor支持整型数据类型()。
      • AddN算子支持aclnn接口调用( )。
      • cholesky算子支持大尾轴场景输入()。
      • ReduceSum算子支持bool输入()。
  • 性能优化:

    • Sort算子小轴场景排序性能优化()。
    • 随机数算子生成性能优化()。
    • TopkV2算子性能优化,提升int64索引场景计算效率()。
    • TopK算子长序列场景显存、性能优化()。
    • AICPU算子性能优化,覆盖ClipByValueV2()、ConcatV2()、CumSum()。
[object Object]
  • [object Object]Ascend 950PR/Ascend 950DT[object Object]新增适配以下算子:[object Object]
    • 新增适配以下算子:[object Object]
      • GridSampler2DGrad算子()。[object Object]
      • UpsampleNearestExact2d/3d算子()。[object Object]
      • UpsampleNearestExactGrad算子()。[object Object]
      • UpsampleTrilinear3d算子()。[object Object]
      • CIoU算子()。[object Object]
      • BlendFaceBgPartTwo算子()。[object Object]
      • SpatialTransformer算子()。[object Object]
      • adjust_saturation算子()。[object Object]
      • scaleandtranslate算子()。[object Object]
      • BoundingBoxEncode算子()。[object Object]
      • NMSWithMask算子()。[object Object]
      • ExtractGlimpseV2、UpsampleBicubic2d算子()。[object Object]
      • UpsampleNearestExact1d及系列反向算子( )。[object Object]
    • 算子新增特性支持:[object Object]
      • AIPP新增CSC色域转换能力,支持YUV420SP/U8、RGB888/U8、BGR888/U8、XRGB8888/U8等多种格式之间的色域转换(),并新增动态AIPP通路支持())。[object Object]
      • GridSample2D算子新增BF16数据类型支持( )。[object Object]
  • 性能优化:[object Object]
    • ResizeNearestNeighborV2算子NCHW格式性能优化()。[object Object]
    • GridSamplerGrad算子性能优化()。[object Object]
[object Object]
  • 新增特性:[object Object]
    • 支持float8/float6/float4数据类型及资料()。[object Object]
    • reduce模板支持混合精度()。[object Object]
    • 新增非连续输入算子静态支持()。[object Object]
    • 日志接口DFX能力增强,支持日志输出标准化()。[object Object]
  • 性能优化:[object Object]
    • broadcast非连续tensor性能优化()。[object Object]
    • 优化build.sh增量编译性能,复用CMake缓存避免重复配置()。[object Object]
[object Object]
  • 卷积算子功能性能优化,优化多模态网络性能,内存占用不劣化():[object Object]
    • dX支持超大W输入场景对W切分。[object Object]
    • dW支持确定性场景下开启性能优化特性。[object Object]
    • dX支持stride=kernel和fmap=kernel场景转MM,优化性能。[object Object]
  • [object Object]Ascend 950PR/Ascend 950DT[object Object]新场景支持:[object Object]
    • 引入ops-tensor,基于分层结构优化Cube类算子,减少偏移量计算和代码重复率()。[object Object]
    • 完善低bit类算子,支持精度补偿,优化整网精度RmsNormDynamicMxQuant(),DynamicBlockMxQuant(),DualLevelQuantBatchMatmul()。[object Object]
    • HardswishBackwardV2()、SyncBatchNormGatherStatsWithCounts()。
  • nn仓工程优化:[object Object]
    • [object Object]Ascend 950PR/Ascend 950DT[object Object]支持静态库()。[object Object]
    • kernel配置脚本优化()。
  • Atlas A2系列产品和Atlas A3系列产品的Cube类算子能力增强,优化网络性能并减少部分场景的内存占用:[object Object]
    • aclnnMatmulWeightNz性能优化()()。[object Object]
    • aclnnTransposeBatchMatmul放开B*K < 65536的限制()。[object Object]
    • aclnnBatchMatmul FP32数据类型下大Batch小MKN场景性能优化()()。[object Object]
    • Cube类算子支持配置out_dtype()()()。[object Object]
    • Cube类算子内存占用优化()()。[object Object]
[object Object]

注意力(Attention/MLA)类

  • 新增SparseFlashMla(稀疏FlashMLA)算子,并支持稀疏注意力KV合并,提升长序列稀疏注意力场景的计算与访存效率()。
  • 新增LightningIndexerV2算子()。
  • 新增aclnnBlockSparseAttentionV2接口,适配FP8量化的BlockSparseAttention算子;BlockSparseAttention在A5上支持FP8场景性能改进与BSND输入排布,[object Object]Ascend 950PR/Ascend 950DT[object Object]正向/推理的量化与非量化kernel支持LSE输出,并新增BlockSparseAttentionGrad反向算子()。
  • FusedInferAttentionScore支持LSE输出,AttentionUpdate在A2/A3支持sp128()。
  • ScatterPaKvCache/GatherPaKvCache新增cache首轴非连续tensor支持,MlaProlog支持KVCache非连续输入()。
  • RecurrentGatedDeltaRule支持state前两轴非连续,SMLAG新增torch适配及新特性支持()。

MoE类

  • MoeInitRoutingV3非量化场景支持DropPad,UnpermuteWithRoutingMap新增N规格non-topk支持()。
  • MegaMoe新增A2/A3 Tiling、静态tensor及syncfunc功能,并补充A2/A3 kernel()。

GMM(GroupedMatmul)量化类

  • GroupedMatmulFinalizeRouting在A5上新增W8A8场景的确定性支持()。
  • GroupedMatmulSwigluQuantV2新增WeightNz MxA8W4数据流及MXFP4权重NZ格式支持()。
  • GMM和GMMAdd GlistType规格增强()。

MC2(通信-计算融合)类

  • 新增AllToAllMatmulV2算子()。
  • AllGatherMatmulV2、AllToAllVGroupedMatmul/GroupedMatmulAllToAllV增加comm_mode通信引擎参数,支持选择通信引擎()。
  • MatmulReduceScatterV2适配AICPU通信()。

Mhc类 针对Atlas A2系列产品和Atlas A3系列产品新增支持以下算子:

  • MhcPost算子()。
  • MhcPostBackward算子()。
  • MhcPreSinkhorn算子()。
  • MhcPreSinkhornBackward算子()。
[object Object][object Object]
  • Ascend 950PR支持CCU场景的allGatherV/reduceScatterV算子( )。
  • Ascend 950PR支持GE图模式&aclGraph模式下的通信算子入图( )。
  • Ascend 950PR支持N秒快恢能力,提升集合通信运行可靠性( )。
  • Ascend 950PR支持taskexception&profiling等维测能力,提升问题定位易用性( )。
  • Ascend 950PR上,HcclChannelAcquire接口支持AIV直驱RoCE和URMA能力,支撑通算融合算子的自定义开发()。
  • Atlas A2/A3系列产品上,单卡多进程能力新增支持MC2场景()。
  • Atlas A2/A3系列产品上,aclGraph场景下资源管理优化,支撑通信资源增量刷新( )。
  • Atlas A2/A3系列产品上,跨超节点场景性能优化,ReduceScatter/AllGather算子支持跨超pipeline算法( )。
  • Atlas A2/A3系列产品上新增支持双机背靠背RoCE直连机型通信( )。
  • Atlas 350 加速卡支持跨PCIE SW进行通信( ),AllReduce、ReduceScatter、AllGather、Reduce、Scatter、Alltoall、Alltoallv、Send、Recv等算子支持通信。
[object Object]
  • HIXL 底层通信接口开放:构建 Client-Server 模式单边通信能力,全面提升建链规格与建链性能。针对批量小 Buffer 传输场景深度优化,有效降低片上内存占用与通信资源开销()。
  • HIXL 网络传输协议扩展:单边通信新增 UBC、UBoE、Host RoCE 协议支持,完整覆盖 D2D、D2rH、rH2D、H2H 全场景数据传输(),不同产品形态的协议支持清单可查阅社区。
  • HIXL 智能链路管理升级:实现通信资源自动获取及智能路由选择(),支持按需建链(),简化使用流程,提升易用性。
  • HIXL 编程 API 能力增强:扩展异步链路管理()、传输状态批量查询()两类接口,丰富异步编程范式,提升上层业务开发效率。
[object Object]
  • 支持Ascend 950DT形态图引擎能力恢复。
  • ge.autoMultistreamParallelMode新增MainStream和LoadBalance选项,基于最小路径覆盖算法将静态Shape模型的计算节点自动划分至最少逻辑流,实现多流并行加速。
  • 新增PortableOp算子类型,面向离线推理场景提供自定义算子的序列化与反序列化能力。
  • ATC和aclgrph接口支持集群配置文件路径设置,用于生成含有HCCL通信任务的离线OM模型,满足多卡离线推理场景下的通信域配置需求。
[object Object][object Object]
  • 在Ascend 950PR/Ascend 950DT上接入核心算子 批量落地GELU、LayerNorm、MatmulEinSum、RmsNormQuant、SwiGluQuant(ACLNN V2)、Linear反量化,以及支持AllGather/AllReduce/ReduceScatter等通信算子()。

  • Attention/KV Cache推理增强

    • Paged Attention在[object Object]Ascend 950 系列产品[object Object]上升级FusedInferAttention V5()。
    • Paged Attention / Flash Attention新增NORM_COMPRESS掩码)。
    • MLA decode支持SWA滑动窗口。
    • ReshapeAndCache在[object Object]Ascend 950 系列产品[object Object]上支持单入单出()。
  • torch_atb 独立编译与 ABI 体系

    • torch_atb从主库解耦独立编译,默认出包ABI切换cxx_abi_1( )。
    • wheel命名规范、安装脚本自动检测/安装torch,安装部署链路打通()。
[object Object]
  • 在[object Object]Ascend 950PR/Ascend 950DT[object Object]上新增适配以下算子:
    • FFT 1D C2C算子()。
    • FFT 1D C2R算子()。
    • FFT 1D R2C算子()。
    • Hadamard算子()。
[object Object]

支持Ascend 950DT的AclGraph场景stream规格扩充,解决大模型资源不足等问题()。

[object Object][object Object]
  • 维测能力:
    • Ascend C框架基础API支持NPU Check(),增强算子运行时校验能力。
    • SIMD VF内支持printf和reg dump打印(),提供调试打印和寄存器数据dump能力。
    • [object Object]Ascend 950PR/Ascend 950DT[object Object]支持L1 Tensor数据的DumpTensor(),扩展L1层数据调试支持。
    • 新增optype_collector工具,支持检查optype重名()。
  • 编译工程
    • 编译工程CMakeModule支持CMAKE_<LANG>编译选项()。
  • 基础API
    • 支持设置ctrl寄存器的饱和溢出管理()。
  • SIMT编程
    • 新增ld/st接口()和AddrSpace类接口(),丰富SIMT内存访问编程能力。
[object Object]
  • SIMD样例:
    • 新增最佳实践样例:matmul+gelu融合、datacopy优化、bank冲突优化、group_matmul量化组矩阵乘、simt&simd高性能编程()。
    • 新增[object Object]Ascend 950PR/Ascend 950DT[object Object]新特性样例及兼容性样例整改:loopmode数据搬运、interleave矢量计算、datacopy_gm2l1、loadmx(Load2DMX)、mmad_mx、data_copy_pad等()。
    • 新增RegBase基础样例:基础算术、数据类型转换、归约、比较、索引等样例()。
    • 新增SIMD VF print样例和dump样例()。
    • 新增Tensor API入门及最佳实践样例:Matmul入门、数据搬入搬出、搬出随路量化、MX FP4最佳实践()。
  • SIMT样例:
    • 新增SIMT优化特性样例:DCache访问优化样例()、基于transpose的仿存合并和bank冲突样例()、最佳实践样例:通过类型对齐提升搬运效率()。
    • 新增SIMT功能特性样例:pytorch注册自定义算子()、编译相关样例(动态、静态、分离编译等)()、profiling样例()、内存屏障特性样例()、Warp类特性样例()、simulator样例()、kernel log样例()。
[object Object]
  • 基础Vector&Cube指令:

    • 支持Vector类指令的高精度版本(, )。
    • 新增transdata场景支持()。
    • TSTORE、TLOAD支持卷积3D()。
    • 新增MGATHER/MSCATTER指令()。
    • Reduce类指令支持返回值及对应索引()。
    • TQUANT支持MXFP8/MXFP4量化()。
    • 合轴类指令支持类型增强,TMOV/TEXTRACT/TINSERT支持Vec到Vec()。
  • 通信类指令:

    • 新增[object Object]Ascend 950 系列产品[object Object]的CCU异步通信类指令TGATHER、TBROADCAST、TSCATTER、TREDUCE()。
    • 支持全核同步指令SYNCALL()。
    • 新增异步prefetch指令()。
    • TPUT_ASYNC、TGET_ASYNC增加A5基于URMA的异步通信能力()。
  • CostModel仿真:

    • 在Atlas A2 系列产品和Atlas A3 系列产品上新增算子级Costmodel,支持输出算子性能、Pipeline时间、泳道图等信息()。
    • 接入CCE Mock方案,支持A2A3已有指令性能预测()。
  • CPU-SIM:随NPU同步新增CPU仿真指令。

[object Object][object Object]

include/driver目录头文件已迁移到pkg_inc/driver目录,include/driver目录将在2027年06月30日下线,请尽快切换至pkg_inc/driver目录。

[object Object]

自[object Object]Ascend 950 系列产品[object Object]开始,aclblas和aclop接口不推荐使用,后续版本将逐步废弃,建议迁移至对应的aclnn算子接口。

[object Object]
  • 不兼容变更:控制类算子Identity、IdentityN、Rank、Shape和ShapeN从ops-nn迁移至ops-math。这些算子从[object Object][object Object]目录迁移到[object Object][object Object]目录,用户需更新相关头文件引用()。

transformer库以下接口在CANN 9.0.0中被标记为废弃,将在2027年3月30日之后的版本删除

  • aclnnGroupedMatMulAllReduce接口废弃,替换为:aclnnMatmulAllReduce。
  • aclnnGroupedMatmul/aclnnGroupedMatmulV2/aclnnGroupedMatmulV3/aclnnGroupedMatmulV4接口废弃,替换为:aclnnGroupedMatmulV5。
  • aclnnFusedInferAttentionScore/aclnnFusedInferAttentionScoreV2/aclnnFusedInferAttentionScoreV3接口废弃,替换为:aclnnFusedInferAttentionScoreV4。
  • aclnnIncreFlashAttention/aclnnIncreFlashAttentionV2/aclnnIncreFlashAttentionV3接口废弃,替换为:aclnnIncreFlashAttentionV4。
  • aclnnPromptFlashAttention/aclnnPromptFlashAttentionV2接口废弃,替换为:aclnnPromptFlashAttentionV3。
  • aclnnMlaProlog/aclnnMlaPrologV2WeightNz接口废弃,替换为:aclnnMlaPrologV3WeightNz。
  • aclnnMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnMatmulAllReduce和aclnnAddRmsNorm。
  • aclnnQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnQuantMatmulAllReduceV2和aclnnAddRmsNorm。
  • aclnnWeightQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnWeightQuantMatmulAllReduce和aclnnAddRmsNorm。
  • aclnnInplaceQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnQuantMatmulAllReduceV2和aclnnAddRmsNorm。
  • aclnnInplaceMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnMatmulAllReduce和aclnnAddRmsNorm。
  • aclnnInplaceWeightQuantMatmulAllReduceAddRmsNorm接口废弃,替换为:aclnnWeightQuantMatmulAllReduce和aclnnAddRmsNorm。
[object Object]

模型压缩工具以下特性在CANN 9.0.0标记为废弃,在当前版本已经删除。

  • 非均匀量化。
  • 自动混合精度。
  • 近似校准。
  • int4量化感知训练。
  • amct_mindspore所有特性。
[object Object]

问题现象:算子aclnnMatmulCompressDequant的输入参数deqScale的值为inf/-inf时,其精度详情中显示有inf或nan 【引入版本】CANN 8.5.0 【缺陷影响】测试特殊构造用例触发,非新算子引入,且实际量化场景下不会有deqScale为-inf和inf场景,当前版本影响可控 【规避方案】实际量化场景下不会有deqScale为-inf和inf场景

[object Object]

以下问题在9.1.0版本修复:

  • 修复了QuantBatchMatmulV3算子在Atlas推理系列产品上,编译时指定AUTO_SYNC=false导致算子读写冲突的问题。
  • 针对Atlas A2系列产品和Atlas A3系列产品,修复了MatmulReduceScatterV2算子在M小于512场景下,flag位清零过快导致其他卡检测不到,最终超时的问题。
  • 修复了Atlas A2系列产品的大EP场景下,D节点注入片上内存多bit故障,无法进入快速恢复流程的问题。
  • 修复了4k卡训练任务在500+step后,随机step位置概率性出现的通信超时问题。
  • 修复了PD分离场景,decode频繁任务中断重启导致的refill积压问题。
  • 修复了开源仓用户自定义算子和内置算子IR原型重名不生效的问题。
  • 修复了aclnnAddmv算子压测偶现coredump的问题。
  • 修复了万卡任务拉起时异常报错的问题。
  • 修复了aclgraph场景特定shape下,MatMulV3性能比MatMulV2差的问题。
  • 修复了fused_quant_mat_mul场景存在的精度问题。
  • 修复了BatchMatmulV2在特定bias场景下存在的精度问题。
  • 修复了FAG算子短序列GQA、NoMask场景存在的精度问题。
[object Object][object Object][object Object]
  • 优化“入门教程”章节:
    • 更新Ascend C学习路径。
    • 新增异构系统和编程模型概括性描述。
  • “编程指南”中SIMD编程模型章节进行优化调整,按照基于语言扩展层C API编程、基于Tensor的C++编程、基于Tpipe和TQue编程的维度进行分类。
  • “编程指南”新增高级编程 > SuperKernel、高级编程 > SIMT协作组章节。
  • 对《Ascend C API》进行了大规模重构,变更点如下:
    • 对数据搬运API和矩阵计算API等进行了目录结构调整:相关性强的API放置在临近位置,比如将矩阵计算相关的搬运接口放置在矩阵计算目录下。
    • 按照场景进行API的目录结构组织:比如矩阵计算分为矩阵计算的搬入、Mmad计算、矩阵计算的搬出。
    • 针对一类API增加必要的背景知识、概念原理介绍、通用的约束、关键特性等说明。
    • 针对每一个API补充约束说明、参数特殊值相关说明。
    • 新增API附录,附录中包含API流水类型汇总、理论性能汇总、接口边界值汇总等。
  • 新增Tensor API参考文档。Tensor API接口为试验接口,在后续版本中可能会调整或改进,不保证后续兼容性。请开发者在使用过程中关注后续版本更新。
  • 新增矩阵计算概述和计算分形介绍的文档()。
  • 优化矢量计算API文档,补充指令约束等()。
  • 增加SIMD与SIMT混合编程性能优化概述()。
  • 搭建VitePress文档站点,提供AscendC资料预览功能()。
[object Object]
  • 新增“编程模型与概念 > CCU编程模型与概念”章节。
  • 新增“通信算子开发 > CCU算子开发”章节。
  • 通信算子开发API新增以下接口。
    • 控制面接口 > CCU Kernel生命周期与内存Token管理。
    • 数据面接口 > CCU接口。
[object Object]

新增以下章节:

  • 自定义Pass开发 > 使用自定义Pass修改Graph > 基于Pattern匹配实现Pass(Python)。
  • 编程指南 > SuperKernel融合范围标定。
  • 自定义算子入图 > 自定义算子入图。
[object Object][object Object]
  • 接口参考 > Python语言接口 > pyatc接口:新增Python场景的atc命令行工具。
  • 图基础数据结构和接口 > options参数名说明 > ge.tiling_schedule_optimize:修改该参数级别,由原来global session级修改为all所有级别。
[object Object]
  • 将历史版本中“算子库 > AI框架算子支持清单”章节独立出来,在当前版本新增《AI框架算子支持清单》手册。
  • 新增“算子库 > 算子接口(torch_extension)”章节。
  • “算子接口(aclnn)”新增RAS类接口章节。
  • ops-cv库新增算子多平台迁移指南文档,指导开发者将算子从Atlas A2 系列产品迁移至Ascend 950PR/Ascend 950DT。
[object Object][object Object]

相关参考 > 通信算子支持度清单:新增“Ascend 950PR/Ascend 950 DT”支持度清单。

[object Object][object Object]
  • 新增测试框架指南,补充testframework编译运行依赖使用说明()。
  • 补充cxx_abi版本判断方法说明()。
  • 更新文档链接至CANN 9.1和PyTorch 26.0.0()。
  • 修正ATB_BUILD_DEPENDENCY_PATH及ABI判断说明,覆盖README/FAQ/测试框架指南()。
[object Object][object Object]

参数说明--framework:补充说明Caffe框架在当前形态已不再演进,转模型不保证可用性的说明。

[object Object]

新增“基于LLM的量化”章节。

[object Object]

版本开源及第三方软件漏洞修复情况详见