aclnnGroupedMatmulAdd

产品支持情况

产品	是否支持
[object Object]Atlas A3 训练系列产品/Atlas A3 推理系列产品[object Object]	√
[object Object]Atlas A2 训练系列产品/Atlas 800I A2 推理产品/A200I A2 Box 异构组件[object Object]	√
[object Object]Atlas 200I/500 A2 推理产品[object Object]	×
[object Object]Atlas 推理系列产品 [object Object]	×
[object Object]Atlas 训练系列产品[object Object]	×

功能说明

算子功能：实现分组矩阵乘计算，每组矩阵乘的维度大小可以不同。基本功能为矩阵乘，如 $y_i[m_i,n_i]=x_i[m_i,k_i] \times weight_i[k_i,n_i]+y_i[m_i,n_i], i=1...g$ ，其中g为分组个数， $m_i/k_i/n_i$ 为对应shape。输入输出数据类型均为aclTensor，K轴分组。
- k轴分组： $k_i$ 各不相同，但 $m_i/n_i$ 每组相同。
计算公式：
$y_i=x_i\times weight_i + y_i$

函数原型

每个算子分为undefined，必须先调用“aclnnGroupedMatmulAddGetWorkspaceSize”接口获取入参并根据计算流程计算所需workspace大小，再调用“aclnnGroupedMatmulAdd”接口执行计算。

aclnnStatus aclnnGroupedMatmulAddGetWorkspaceSize(const aclTensor *x, const aclTensor *weight, const aclTensor *groupList, aclTensor *yRef, bool transposeX, bool transposeWeight, int64_t groupType, uint64_t *workspaceSize, aclOpExecutor **executor)
aclnnStatus aclnnGroupedMatmulAdd(void *workspace, uint64_t workspaceSize, aclOpExecutor *executor, aclrtStream stream)

aclnnGroupedMatmulAddGetWorkspaceSize

参数说明：
- x（aclTensor*，计算输入）：表示输入，Device侧的aclTensor类型，公式中的输入x，x必须转置，undefined支持ND，支持undefined，不支持空Tensor，数据类型支持FLOAT16、BFLOAT16。
- weight（aclTensor*，计算输入）：表示权重，Device侧的aclTensor类型，公式中的weight，weight不支持转置，undefined支持ND，支持undefined，不支持空Tensor，数据类型支持FLOAT16、BFLOAT16。
- groupList（aclTensor*，计算输入）：表示输入K轴方向的matmul大小分布的cumsum结果（累积和），必须为非负单调非递减数列，Device侧的aclTensor类型，数据类型支持INT64，undefined支持ND。
- y（aclTensor*，计算输入）：表示原地累加的输出矩阵，Device侧的aclTensor类型，公式中的y，undefined支持ND，数据类型支持FLOAT32。
- yRef（aclTensor*，计算输出）：表示原地累加的输出矩阵，Device侧的aclTensorList，公式中的输出y，undefined支持ND，数据类型支持FLOAT32。
- transposeX（bool，计算输入）：表示x矩阵是否转置，Host侧的布尔值，当前仅支持True。
- transposeWeight（bool，计算输入）：表示weight矩阵是否转置，Host侧的布尔值，当前仅支持False。
- groupType(int64_t，计算输入)：表示分组类型，Host侧的整型，当前仅支持2（K轴分组）。
- workspaceSize（uint64_t*，出参）：返回需要在Device侧申请的workspace大小。
- executor（aclOpExecutor**，出参）：返回op执行器，包含了算子计算流程。
返回值：

返回aclnnStatus状态码，具体参见undefined。

aclnnGroupedMatmulAdd

参数说明：
- workspace（void*，入参）：在Device侧申请的workspace内存地址。
- workspaceSize（uint64_t，入参）：在Device侧申请的workspace大小，由第一段接口aclnnGroupedMatmulAddGetWorkspaceSize获取。
- executor（aclOpExecutor*，入参）：op执行器，包含了算子计算流程。
- stream（aclrtStream，入参）：指定执行任务的Stream。
返回值：

返回aclnnStatus状态码，具体参见undefined。

[object Object]

约束说明

x和weight中每一组tensor的每一维大小在32字节对齐后都应小于int32的最大值2147483647。
支持的输入类型为：
- x为FLOAT16、weight为FLOAT16、y为FLOAT32。
- x为BFLOAT16、weight为BFLOAT16、y为FLOAT32。

调用示例

aclnn单算子调用方式

通过aclnn单算子调用示例代码如下，仅供参考，具体编译和执行过程请参考undefined。

[object Object]