Skip to content

Copy(L1 Buffer到L0ScaleB Buffer数据搬运)

说明

本接口为试验接口,在后续版本中可能会调整或改进,不保证后续兼容性。请开发者在使用过程中关注后续版本更新。

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持

功能说明

头文件路径为:tensor_api/tensor.h

Tensor API通过Copy接口统一执行不同通路数据搬运。该接口用于将L1 Buffer中的右矩阵缩放数据搬运到L0ScaleB Buffer。右矩阵缩放数据在L0ScaleB Buffer上的首地址由右矩阵在L0B Buffer的首地址的1/16推导出来。

该通路的数据类型固定为fp8_e8m0_t。左矩阵和右矩阵的缩放数据的分形排布和缩放计算关系可参考下图,其中右矩阵缩放数据是NN的数据格式:

图1 左矩阵和右矩阵缩放数据缩放示意图

左矩阵和右矩阵缩放数据缩放示意图

函数原型

  • 执行L1 Buffer到L0ScaleB Buffer的数据搬运。

    C++
    template <typename AtomType, typename DstTensor, typename SrcTensor>
    __aicore__ inline void Copy(const CopyAtom<AtomType>& atomCopy, const DstTensor& dst, const SrcTensor& src)
    
  • 构造默认搬运原子对象。

    C++
    template <typename CopyOperationType>
    __aicore__ inline constexpr auto MakeCopy(const CopyOperationType& copyOperation)
    
  • 构造指定Trait的搬运原子对象。

    C++
    template <typename CopyOperationType, typename CopyTraitType>
    __aicore__ inline constexpr auto MakeCopy(
        const CopyOperationType& copyOperation, const CopyTraitType& copyTrait)
    

参数说明

表1 Copy接口参数说明

参数名输入/输出描述
atomCopy输入搬运原子对象。L1 Buffer到L0ScaleB Buffer通路可通过MakeCopy(CopyL12L0ScaleB{})MakeCopy(CopyL12L0ScaleB{}, CopyL12L0ScaleBTraitDefault{})构造。
dst输出目的张量,存储位置为Location::L0ScaleB,数据格式为NN
src输入源张量,存储位置为Location::L1,数据格式为NN

表2 MakeCopy接口参数说明

参数名输入/输出描述
copyOperation输入搬运操作对象。L1 Buffer到L0ScaleB Buffer通路使用CopyL12L0ScaleB{}
copyTrait输入搬运Trait对象,用于指定搬运特性。L1 Buffer到L0ScaleB Buffer默认Trait使用CopyL12L0ScaleBTraitDefault{}

数据类型

数据类型仅支持fp8_e8m0_t

源张量和目的张量的基础数据类型需要保持一致。

返回值说明

Copy无返回值。MakeCopy返回CopyAtom对象。

约束说明

  • 源张量和目的张量数据格式为NN,使用MakeFrameLayout<NNLayoutPtn, _2>(...)构造。
  • 源地址和目的地址需要满足32Byte对齐要求。

调用示例

C++
#include "tensor_api/tensor.h"

using namespace AscendC::Te;

__aicore__ inline void CopyL1ToL0ScaleBExample()
{
    constexpr uint32_t k = 32;
    constexpr uint32_t n = 16;
    constexpr uint32_t scaleK = k / 16;

    __cbuf__ fp8_e8m0_t l1Buf[scaleK * n];
    __cb__ fp8_e5m2_t l0BBuf[k * n];

    auto l1Tensor = MakeTensor(MakeMemPtr(l1Buf), MakeFrameLayout<NNLayoutPtn, _2>(scaleK, n));

    // ScaleB地址由右矩阵的L0B Buffer地址按1/16地址编码换算得到。
    auto l0ScaleBPtr = MakeMemPtr<Location::L0ScaleB, fp8_e8m0_t>(reinterpret_cast<uint64_t>(l0BBuf) / 16);
    auto l0ScaleBTensor = MakeTensor(l0ScaleBPtr, MakeFrameLayout<NNLayoutPtn, _2>(scaleK, n));

    auto copyAtom = MakeCopy(CopyL12L0ScaleB{}, CopyL12L0ScaleBTraitDefault{});
    Copy(copyAtom, l0ScaleBTensor, l1Tensor);
}

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区