aclnnGroupedMatMulAllReduce

该接口后续版本会废弃，请不要使用该接口。

产品支持情况

产品	是否支持
[object Object]Atlas A3 训练系列产品/Atlas A3 推理系列产品[object Object]	×
[object Object]Atlas A2 训练系列产品/Atlas 800I A2 推理产品/A200I A2 Box 异构组件[object Object]	√
[object Object]Atlas 200I/500 A2 推理产品[object Object]	×
[object Object]Atlas 推理系列产品 [object Object]	×
[object Object]Atlas 训练系列产品[object Object]	×

功能说明

算子功能：在grouped_matmul的基础上实现多卡并行AllReduce功能，实现分组矩阵乘计算，每组矩阵乘的维度大小可以不同。根据x、weight、y的Tensor数量支持如下4种场景：
- x、weight、y的Tensor数量等于组数，即每组的数据对应的Tensor是独立的。
- x的Tensor数量为1，weight/y的Tensor数量等于组数，此时需要通过可选参数group_list说明x在行上的分组情况，如group_list[0]=10说明x的前10行参与第一组矩阵乘计算。
- x、weight的Tensor数量等于组数，y的Tensor数量为1，此时每组矩阵乘的结果放在同一个Tensor中连续存放。
- x、y的Tensor数量为1，weight数量等于组数，属于前两种情况的组合。
计算公式：

非量化场景：
$y_i=x_i\times weight_i + bias_i$

函数原型

每个算子分为undefined，必须先调用“aclnnGroupedMatMulAllReduceGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小，再调用“aclnnGroupedMatMulAllReduce”接口执行计算。

aclnnStatus aclnnGroupedMatMulAllReduceGetWorkspaceSize(const aclTensorList* x, const aclTensorList* weight, const aclTensorList* bias, const aclIntArray* groupListOptional, int64_t splitItem, const char* group, const char* reduceOp, int64_t commTurn, int64_t streamMode, const aclTensorList* y, uint64_t* workspaceSize, aclOpExecutor** executor)
aclnnStatus aclnnGroupedMatMulAllReduce(void* workspace, uint64_t workspaceSize, aclOpExecutor* executor, aclrtStream stream)

aclnnGroupedMatMulAllReduceGetWorkspaceSize

参数说明：
- x（aclTensorList*，计算输入）：必选参数，Device侧的aclTensorList，公式中的输入x，数据类型支持FLOAT16、BFLOAT16，undefined支持ND，支持的最大长度为64个。
- weight（aclTensorList*，计算输入）：必选参数，Device侧的aclTensorList，公式中的weight，数据类型支持FLOAT16、BFLOAT16，undefined支持ND，支持的最大长度为64个。
- bias（aclTensorList*，计算输入）可选参数，Device侧的aclTensorList，公式中的bias，数据类型支持FLOAT16、FLOAT32，undefined支持ND，支持的最大长度为64个。
- groupListOptional（aclIntArray*，计算输入）：可选参数，Host侧的aclIntArray类型，代表输入和输出M方向的matmul大小分布，数据类型支持INT64，undefined支持ND，支持的最大长度为64个。
- splitItemOptional（int64_t，计算输入）：可选属性，代表输入和输出是否要做tensor切分，0代表输入和输出都不用切分；1代表输入需要切分，输出不需要切分；2代表输入不需要切分，输出需要切分；3代表输入和输出都需要切分，默认值为0。
- group（char*，计算输入）：Host侧标识列组的字符串。通信域名称。数据类型支持：string。通过Hccl提供的接口获取：extern HcclResult HcclGetCommName(HcclComm comm, char* commName); commName即为group。
- reduceOp（char*，计算输入）：reduce操作类型。数据类型支持String。当前版本仅支持输入"sum"。
- commTurn（int64_t，计算输入）：Host侧的整型，通信数据切分数，即总数据量/单次通信量。数据类型支持INT64。当前版本仅支持输入0。
- streamMode（int64_t，计算输入）：Host侧的整型，acl流模式的枚举，当前只支持值1，数据类型支持INT64。
- y（aclTensorList*，计算输出）：Device侧的aclTensorList，公式中的输出y，数据类型支持FLOAT16、BFLOAT16，undefined支持ND，支持的最大长度为64个。
- workspaceSize（uint64_t*，出参）：返回需要在Device侧申请的workspace大小。
- executor（aclOpExecutor**，出参）：返回op执行器，包含了算子计算流程。
返回值：

aclnnStatus：返回状态码，具体参见undefined。

[object Object]

aclnnGroupedMatMulAllReduce

参数说明：
- workspace（void*，入参）：在Device侧申请的workspace内存地址。
- workspaceSize（uint64_t，入参）：在Device侧申请的workspace大小，由第一段接口aclnnGroupedMatMulAllReduceGetWorkspaceSize获取。
- executor（aclOpExecutor*，入参）：op执行器，包含了算子计算流程。
- stream（aclrtStream，入参）：指定执行任务的Stream。
返回值：

返回aclnnStatus状态码，具体参见undefined。

约束说明

x、weight、bias三个输入支持多种数据类型，此算子支持的数据类型组合为 “x-FLOAT16、weight-FLOAT16、bias-FLOAT16”，“x-BFLOAT16、weight-BFLOAT16、bias-FLOAT32”。
当splitItemOptional为0时，x支持输入维度为2维-6维，y支持输入维度为2维-6维；当splitItemOptional为1/2/3时，x支持输入维度为2维，y支持输入维度为2维；splitItemOptional为0/1/2/3时，weight支持输入维度为2维。
支持2、4、8卡。
x和weight中每一组tensor的最后一维大小都应小于65536。 $x_i$ 的最后一维指当属性transpose_x为false时 $x_i$ 的K轴或当transpose_x为true时 $x_i$ 的M轴。 $weight_i$ 的最后一维指当属性transpose_weight为false时 $weight_i$ 的N轴或当transpose_weight为true时 $weight_i$ 的K轴。
x和weight中每一组tensor的每一维大小在32字节对齐后都应小于int32的最大值2147483647。

调用示例

示例代码如下，仅供参考，具体编译和执行过程请参考undefined。

[object Object]