Skip to content

DataCopy(GM与UB连续数据搬运)

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
  • Atlas 200I/500 A2 推理产品:支持
  • Atlas 推理系列产品AI Core:支持
  • Atlas 推理系列产品Vector Core:支持
  • Atlas 训练系列产品:支持
  • Kirin X90:支持
  • Kirin 9030:支持

功能说明

头文件路径为:"basic_api/kernel_operator_data_copy_intf.h"

支持Global Memory与Unified Buffer之间的连续数据搬运,数据在传输过程中保持原始格式和内容不变。

具体支持的数据通路为(以逻辑位置TPosition表示):

  • Global Memory -> Unified Buffer
    • GM -> VECIN
  • Unified Buffer -> Global Memory
    • VECOUT -> GM
    • CO2 -> GM(仅Atlas 推理系列产品AI Core支持)

函数原型

  • Global Memory -> Unified Buffer

    C++
    template <typename T>
    __aicore__ inline void DataCopy(const LocalTensor<T>& dst, const GlobalTensor<T>& src, const uint32_t count)
    
  • Unified Buffer -> Global Memory

    C++
    template <typename T>
    __aicore__ inline void DataCopy(const GlobalTensor<T>& dst, const LocalTensor<T>& src, const uint32_t count)
    

参数说明

表1 模板参数说明

参数名描述
T操作数的数据类型。支持的数据类型请参考数据类型

表2 参数说明

参数名输入/输出描述
dst输出目的操作数。
•类型为LocalTensor时,存储位置为Unified Buffer,目的地址需要32字节对齐。
•类型为GlobalTensor时,存储位置为Global Memory,目的地址需要按照对应数据类型所占字节数对齐。
src输入源操作数。
•类型为GlobalTensor时,存储位置为Global Memory,源地址需要按照对应数据类型所占字节数对齐。
•类型为LocalTensor时,存储位置为Unified Buffer,源地址需要32字节对齐。
count输入参与搬运的元素个数。
注:count * sizeof(T)需要32字节对齐,若未对齐,搬运量会向下取整到32字节对齐。

以half数据类型为例,源操作数的shape为1 * 128。当count = 128时,图1将源操作数中128个元素连续搬运至目的操作数。

图1 连续搬运示意图

数据类型

源操作数和目的操作数支持的数据类型保持一致,Global Memory -> Unified Buffer和Unified Buffer -> Global Memory两个数据通路对同一产品支持的数据类型相同,具体如下:

  • Ascend 950PR/Ascend 950DT,支持的数据类型为:b8、b16、b32、b64。
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Atlas 200I/500 A2 推理产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、bfloat16_t、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Atlas 推理系列产品AI Core,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Atlas 推理系列产品Vector Core,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Atlas 训练系列产品,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Kirin X90,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。
  • Kirin 9030,支持的数据类型为:int8_t、uint8_t、int16_t、uint16_t、half、int32_t、uint32_t、float、int64_t、uint64_t、double。

返回值说明

约束说明

  • 位于Global Memory的地址必须按照对应数据类型所占字节数对齐,位于Unified Buffer的地址必须32字节对齐。

  • 调用连续搬运接口时,count * sizeof(T)需要32字节对齐,若未对齐,则搬运量会向下取整到32字节对齐。

  • 如果需要执行多个DataCopy指令,且DataCopy的目的地址存在重叠,需要通过调用PipeBarrier(ISASI)来插入同步指令,保证多个DataCopy指令的串行化,防止出现异常数据。如下图左侧示意图,执行两个DataCopy指令,搬运的目的Global Memory地址存在重叠,两条搬运指令之间需要通过调用PipeBarrier<PIPE_MTE3>()添加MTE3搬出流水的同步;如下图右侧示意图所示,搬运的目的地址Unified Buffer存在重叠,两条搬运指令之间需要调用PipeBarrier<PIPE_MTE2>()添加MTE2搬入流水的同步。

  • 针对如下产品型号:

    • Atlas A2 训练系列产品/Atlas A2 推理系列产品
    • Atlas A3 训练系列产品/Atlas A3 推理系列产品

    在跨卡通信算子开发场景,DataCopy类接口支持跨卡数据搬运,仅支持HCCS物理链路,不支持其他通路;开发者开发过程中,需要关注涉及卡间通信的物理通路,可通过npu-smi info -t topo命令查询HCCS物理链路。

调用示例

  • Global Memory -> Unified Buffer

    C++
    // srcLocal为half类型的LocalTensor,srcGlobal为half类型的GlobalTensor。
    // 使用传入count参数的搬运接口,完成连续搬运。
    AscendC::DataCopy(srcLocal, srcGlobal, 512);
    

    结果示例:

    Text
    输入数据srcGlobal:[1 2 3 ... 512]
    输出数据srcLocal:[1 2 3 ... 512]
    
  • Unified Buffer -> Global Memory

    C++
    // dstLocal为half类型的LocalTensor,dstGlobal为half类型的GlobalTensor。
    // 使用传入count参数的搬运接口,完成连续搬运。
    AscendC::DataCopy(dstGlobal, dstLocal, 512);
    

    结果示例:

    Text
    输入数据dstLocal:[1 2 3 ... 512]
    输出数据dstGlobal:[1 2 3 ... 512]
    

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区