DataCopy(GM与UB连续数据搬运)
产品支持情况
- Ascend 950PR/Ascend 950DT:支持
- Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
- Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
- Atlas 200I/500 A2 推理产品:支持
- Atlas 推理系列产品AI Core:支持
- Atlas 推理系列产品Vector Core:支持
- Atlas 训练系列产品:支持
- Kirin X90:支持
- Kirin 9030:支持
功能说明
头文件路径为:"basic_api/kernel_operator_data_copy_intf.h"。
支持Global Memory与Unified Buffer之间的连续数据搬运,数据在传输过程中保持原始格式和内容不变。
具体支持的数据通路为(以逻辑位置TPosition表示):
- Global Memory -> Unified Buffer
- GM -> VECIN
- Unified Buffer -> Global Memory
- VECOUT -> GM
- CO2 -> GM(仅Atlas 推理系列产品AI Core支持)
函数原型
Global Memory -> Unified Buffer
C++template <typename T> __aicore__ inline void DataCopy(const LocalTensor<T>& dst, const GlobalTensor<T>& src, const uint32_t count)Unified Buffer -> Global Memory
C++template <typename T> __aicore__ inline void DataCopy(const GlobalTensor<T>& dst, const LocalTensor<T>& src, const uint32_t count)
参数说明
表1 模板参数说明
| 参数名 | 描述 |
|---|---|
| T | 操作数的数据类型。支持的数据类型请参考数据类型。 |
表2 参数说明
| 参数名 | 输入/输出 | 描述 |
|---|---|---|
| dst | 输出 | 目的操作数。 •类型为LocalTensor时,存储位置为Unified Buffer,目的地址需要32字节对齐。 •类型为GlobalTensor时,存储位置为Global Memory,目的地址需要按照对应数据类型所占字节数对齐。 |
| src | 输入 | 源操作数。 •类型为GlobalTensor时,存储位置为Global Memory,源地址需要按照对应数据类型所占字节数对齐。 •类型为LocalTensor时,存储位置为Unified Buffer,源地址需要32字节对齐。 |
| count | 输入 | 参与搬运的元素个数。 注:count * sizeof(T)需要32字节对齐,若未对齐,搬运量会向下取整到32字节对齐。 |
以half数据类型为例,源操作数的shape为1 * 128。当count = 128时,图1将源操作数中128个元素连续搬运至目的操作数。
图1 连续搬运示意图
数据类型
源操作数和目的操作数支持的数据类型保持一致,Global Memory -> Unified Buffer和Unified Buffer -> Global Memory两个数据通路对同一产品支持的数据类型相同,具体如下:
- Ascend 950PR/Ascend 950DT,支持的数据类型为:b8、b16、b32、b64。
- Atlas A3 训练系列产品/Atlas A3 推理系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Atlas A2 训练系列产品/Atlas A2 推理系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Atlas 200I/500 A2 推理产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Atlas 推理系列产品AI Core,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Atlas 推理系列产品Vector Core,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Atlas 训练系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Kirin X90,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
- Kirin 9030,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
返回值说明
无
约束说明
位于Global Memory的地址必须按照对应数据类型所占字节数对齐,位于Unified Buffer的地址必须32字节对齐。
调用连续搬运接口时,count * sizeof(T)需要32字节对齐,若未对齐,则搬运量会向下取整到32字节对齐。
如果需要执行多个DataCopy指令,且DataCopy的目的地址存在重叠,需要通过调用PipeBarrier(ISASI)来插入同步指令,保证多个DataCopy指令的串行化,防止出现异常数据。如下图左侧示意图,执行两个DataCopy指令,搬运的目的Global Memory地址存在重叠,两条搬运指令之间需要通过调用
PipeBarrier<PIPE_MTE3>()添加MTE3搬出流水的同步;如下图右侧示意图所示,搬运的目的地址Unified Buffer存在重叠,两条搬运指令之间需要调用PipeBarrier<PIPE_MTE2>()添加MTE2搬入流水的同步。
针对如下产品型号:
- Atlas A2 训练系列产品/Atlas A2 推理系列产品
- Atlas A3 训练系列产品/Atlas A3 推理系列产品
在跨卡通信算子开发场景,DataCopy类接口支持跨卡数据搬运,仅支持HCCS物理链路,不支持其他通路;开发者开发过程中,需要关注涉及卡间通信的物理通路,可通过
npu-smi info -t topo命令查询HCCS物理链路。
调用示例
Global Memory -> Unified Buffer
C++// srcLocal为half类型的LocalTensor,srcGlobal为half类型的GlobalTensor。 // 使用传入count参数的搬运接口,完成连续搬运。 AscendC::DataCopy(srcLocal, srcGlobal, 512);结果示例:
Text输入数据srcGlobal:[1 2 3 ... 512] 输出数据srcLocal:[1 2 3 ... 512]Unified Buffer -> Global Memory
C++// dstLocal为half类型的LocalTensor,dstGlobal为half类型的GlobalTensor。 // 使用传入count参数的搬运接口,完成连续搬运。 AscendC::DataCopy(dstGlobal, dstLocal, 512);结果示例:
Text输入数据dstLocal:[1 2 3 ... 512] 输出数据dstGlobal:[1 2 3 ... 512]