Skip to content

DataCopy(L1ToGM连续数据搬运)

产品支持情况

  • Ascend 950PR/Ascend 950DT:不支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持
  • Kirin X90:支持
  • Kirin 9030:支持

功能说明

头文件路径为:"basic_api/kernel_operator_data_copy_intf.h"

该接口能够将矩阵从L1 Buffer连续搬运至Global Memory,数据搬运时格式和内容保持不变。

函数原型

C++
template <typename T>
__aicore__ inline void DataCopy(const GlobalTensor<T>& dst, const LocalTensor<T>& src, const uint32_t count)

参数说明

表1 模板参数说明

参数名描述
T源操作数或者目的操作数的数据类型。支持的数据类型请参考数据类型

表2 参数说明

参数名称输入/输出含义
dst输出目的操作数,类型为GlobalTensor,存储位置为Global Memory,地址需要1字节对齐。
src输入源操作数,类型为LocalTensor,存储位置为L1 Buffer,地址需要32字节对齐。
count输入参与搬运的元素个数。
注:count * sizeof(T)需要32字节对齐,若未对齐,搬运量会向下取整到32字节对齐。

以half数据类型为例,源操作数的shape为1 * 128。当count = 128时,图1将源操作数中128个元素连续搬运至目的操作数。

图1 连续搬运示意图

数据类型

源矩阵和目的矩阵支持的数据类型保持一致。

针对Atlas A3 训练系列产品/Atlas A3 推理系列产品,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。

Atlas A2 训练系列产品/Atlas A2 推理系列产品,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。

针对Kirin X90,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。

Kirin 9030,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。

返回值说明

约束说明

  • 位于L1 Buffer的源地址必须32字节对齐,位于Global Memory的目的地址必须1字节对齐。
  • 调用连续搬运接口时,count * sizeof(T)需要32字节对齐,若未对齐,则搬运量会向下取整到32字节对齐。
  • 针对如下产品型号:
    Atlas A3 训练系列产品/Atlas A3 推理系列产品
    Atlas A2 训练系列产品/Atlas A2 推理系列产品
    在跨卡通信算子开发场景,DataCopy类接口支持跨卡数据搬运,仅支持HCCS物理链路,不支持其他通路;开发者开发过程中,需要关注涉及卡间通信的物理通路,可通过npu-smi info -t topo命令查询HCCS物理链路。

调用示例

L1到GM连续数据搬运的样例请参考L1到GM搬运样例

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区