asc_copy_gm2l1_dn2nz

产品支持情况

产品	是否支持
Ascend 950PR/Ascend 950DT	√

功能说明

将矩阵数据从Global Memory搬运到L1 Buffer，在此过程中执行DN->NZ/NCHW->NC1HWC0/NCHW->C1HWNC0操作。若D未对齐C0的大小，将会在L1 Buffer的最内层维度填充0值。GM中的数据以DN类型存储；L1中的数据以NZ形式存储。

DN->NZ的搬运形式如下图：

函数原型

常规搬运

C++

__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ int8_t* dst, __gm__ int8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ uint8_t* dst, __gm__ uint8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ hifloat8_t* dst, __gm__ hifloat8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ fp8_e5m2_t* dst, __gm__ fp8_e5m2_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ fp8_e4m3fn_t* dst, __gm__ fp8_e4m3fn_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ int16_t* dst, __gm__ int16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ uint16_t* dst, __gm__ uint16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value,  uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ half* dst, __gm__ half* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ bfloat16_t* dst, __gm__ bfloat16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ int32_t* dst, __gm__ int32_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ uint32_t* dst, __gm__ uint32_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz(__cbuf__ float* dst, __gm__ float* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)

同步搬运

C++

__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ int8_t* dst, __gm__ int8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ uint8_t* dst, __gm__ uint8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ hifloat8_t* dst, __gm__ hifloat8_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ fp8_e5m2_t* dst, __gm__ fp8_e5m2_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ fp8_e4m3fn_t* dst, __gm__ fp8_e4m3fn_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ int16_t* dst, __gm__ int16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ uint16_t* dst, __gm__ uint16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value,  uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ half* dst, __gm__ half* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ bfloat16_t* dst, __gm__ bfloat16_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ int32_t* dst, __gm__ int32_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ uint32_t* dst, __gm__ uint32_t* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)
__aicore__ inline void asc_copy_gm2l1_dn2nz_sync(__cbuf__ float* dst, __gm__ float* src, uint64_t loop1_src_stride, uint8_t l2_cache_ctl, uint16_t n_value, uint32_t d_value, uint64_t loop4_src_stride, bool smallc0_en)

参数说明

参数名	输入/输出	描述
dst	输出	目的操作数（矢量）的起始地址。
src	输入	源操作数（矢量）的起始地址。
loop1_src_stride	输入	搬运过程中最内层循环相邻迭代源操作数的数据块间的间隔，单位为字节。
l2_cache_ctl	输入	配置数据在L2 Cache中的管理策略。取值说明如下： • 0：DISABLE模式，适用于仅需访问一次的数据。 • 1：NORMAL模式，适用于重用模式未知或不极端的数据。 • 2：LAST模式，适用于高频重复访问的数据。 • 4：PERSISTENT模式，适用于需要长期驻留在缓存中的数据。
n_value	输入	源操作数中DN排布中的N值。
d_value	输入	源操作数中DN排布中的D值。
loop4_src_stride	输入	搬运过程中最外层循环相邻迭代源操作数的数据块间的间隔，单位为字节。
smallc0_en	输入	SmallC0模式开关： • true：C0_SIZE会被pad至32个字节。 • false：C0_SIZE会被pad为4个channel。

返回值说明

无

流水类型

PIPE_MTE2

约束说明

注意当且仅当D <= 4时，smallc0_en才可以被启用，否则它会失效。

调用示例

C++

//搬 运 关 于 最 内 层 循 环 的 步 长 为4个 字 节
constexpr uint64_t loop1_src_stride = 4;
//L2 Cache采 用NORMAL模 式
constexpr uint8_t l2_cache_ctl = 1;
//N值 为3
constexpr uint16_t n_value = 3;
//D值 为3
constexpr uint32_t d_value = 3;
//搬 运 关 于 最 外 层 循 环 的 步 长 为4个 字 节
constexpr uint64_t loop4_src_stride = 2;
//每 一 个C0数 据 块 都 会 被pad至32个 字 节
constexpr bool smallc0_en = true;
__gm__ half src[256];
__cbuf__ half dst[256];
asc_copy_gm2l1_dn2nz(dst, src, loop1_src_stride, l2_cache_ctl, n_value, d_value, loop4_src_stride, smallc0_en);

2.3.1.3. LocalTensor和GlobalTensor定 义

2.3.1.3.1. LocalTensor

2.3.1.3.2. GlobalTensor

2.3.1.4. Tensor API基 础 数 据 结 构

2.3.1.4.1. Layout数 据 结 构

2.3.1.4.2. Tensor数 据 结 构

2.3.1.4.3. 工 具 函 数

2.3.1.5. 辅 助 数 据 结 构

2.3.1.5.1. Coordinate

2.3.1.5.2. Layout

2.3.1.5.3. TensorTrait

2.3.1.5.6. TensorDesc

2.3.2.1. 概 览

2.3.3.1. 概 述

2.3.3.2. 矩 阵 计 算 分 形 介 绍

2.3.3.3. 矩 阵 计 算 的 搬 入

2.3.3.3.4. 矩 阵 数 据 搬 入 至L0-Buffer

2.3.3.3.5. 矩 阵 数 据 搬 入 至L1-Buffer

2.3.3.3.6. 辅 助 配 置 接 口

2.3.3.4. Mmad计 算

2.3.3.4.5. 关 键 特 性 说 明

2.3.3.4.6. 寄 存 器 配 置 说 明

2.3.3.5. 矩 阵 计 算 的 搬 出

2.3.3.5.10. L1到GM数 据 搬 运

2.3.3.5.11. 关 键 特 性 说 明

2.3.3.5.12. 寄 存 器 配 置 说 明

2.3.4.1. 概 述

2.3.4.2. 矩 阵 计 算 分 形 介 绍

2.3.4.3. 矩 阵 计 算 的 搬 入

2.3.4.3.3. 矩 阵 数 据 搬 入 至L1 Buffer

2.3.4.3.4. 矩 阵 数 据 搬 入 至L0 Buffer)

2.3.4.4. Mmad计 算

2.3.4.4.2. 关 键 特 性 说 明

2.3.4.4.3. 寄 存 器 配 置 说 明

2.3.4.5. 矩 阵 计 算 的 搬 出

2.3.4.5.4. 关 键 特 性 说 明

2.3.5.2. SIMD计 算 说 明

2.3.5.2.4. 掩 码

2.3.5.3. 数 据 搬 运

2.3.5.3.1. GM与UB数 据 搬 运

2.3.5.3.2. UB与UB数 据 搬 运

2.3.5.4. 基 础 算 术

2.3.5.5. 逻 辑 计 算

2.3.5.6. 复 合 计 算

2.3.5.7. 比 较 与 选 择

2.3.5.8. 类 型 转 换

2.3.5.8.1. 寄 存 器 配 置 说 明

2.3.5.9. 归 约 计 算

2.3.5.9.8. 寄 存 器 辅 助 接 口

2.3.5.10. 数 据 排 布 转 换

2.3.5.11. 数 据 填 充

2.3.5.12. 排 序 组 合（ISASI）

2.3.5.13. 离 散 与 聚 合

2.3.5.14. 掩 码 操 作

2.3.5.15. 数 据 重 排（ISASI）

2.3.6.1. 寄 存 器 数 据 类 型

2.3.6.3. Reg数 据 搬 运

2.3.6.4. MaskReg计 算

2.3.6.5. 基 础 算 术

2.3.6.6. 逻 辑 计 算

2.3.6.7. 复 合 计 算

2.3.6.8. 比 较 与 选 择

2.3.6.9. 类 型 转 换

2.3.6.10. 归 约 计 算

2.3.6.11. 数 据 填 充

2.3.6.12. 离 散 与 聚 合

2.3.6.13. 数 据 重 排

2.3.6.14. 数 据 压 缩

2.3.6.15. 直 方 图 计 算

2.3.6.16. 索 引 操 作

2.3.6.17. 同 步 控 制

2.3.6.18. 系 统 变 量 访 问

2.3.6.19. 数 据 类 型

2.3.8.1. Pipe和Que框 架

2.3.8.1.1. TPipe

2.3.8.1.3. TBufPool

2.3.8.1.4. 自 定 义TBufPool

2.3.8.1.5. TQue

2.3.8.1.6. TSCM

2.3.8.1.7. TQueBind

2.3.1.3. LocalTensor和GlobalTensor定义

2.3.1.4. Tensor API基础数据结构

2.3.1.4.1. Layout数据结构

2.3.1.4.2. Tensor数据结构

2.3.1.4.3. 工具函数

2.3.1.5. 辅助数据结构

2.3.2.1. 概览

2.3.3.1. 概述

2.3.3.2. 矩阵计算分形介绍

2.3.3.3. 矩阵计算的搬入

2.3.3.3.4. 矩阵数据搬入至L0-Buffer

2.3.3.3.5. 矩阵数据搬入至L1-Buffer

2.3.3.3.6. 辅助配置接口

2.3.3.4. Mmad计算

2.3.3.4.5. 关键特性说明

2.3.3.4.6. 寄存器配置说明

2.3.3.5. 矩阵计算的搬出

2.3.3.5.10. L1到GM数据搬运

2.3.3.5.11. 关键特性说明

2.3.3.5.12. 寄存器配置说明

2.3.4.1. 概述

2.3.4.2. 矩阵计算分形介绍

2.3.4.3. 矩阵计算的搬入

2.3.4.3.3. 矩阵数据搬入至L1 Buffer

2.3.4.3.4. 矩阵数据搬入至L0 Buffer)

2.3.4.4. Mmad计算

2.3.4.4.2. 关键特性说明

2.3.4.4.3. 寄存器配置说明

2.3.4.5. 矩阵计算的搬出

2.3.4.5.4. 关键特性说明

2.3.5.2. SIMD计算说明

2.3.5.2.4. 掩码

2.3.5.3. 数据搬运

2.3.5.3.1. GM与UB数据搬运

2.3.5.3.2. UB与UB数据搬运

2.3.5.4. 基础算术

2.3.5.5. 逻辑计算

2.3.5.6. 复合计算

2.3.5.7. 比较与选择

2.3.5.8. 类型转换

2.3.5.8.1. 寄存器配置说明

2.3.5.9. 归约计算

2.3.5.9.8. 寄存器辅助接口

2.3.5.10. 数据排布转换

2.3.5.11. 数据填充

2.3.5.12. 排序组合（ISASI）

2.3.5.13. 离散与聚合

2.3.5.14. 掩码操作

2.3.5.15. 数据重排（ISASI）

2.3.6.1. 寄存器数据类型

2.3.6.3. Reg数据搬运

2.3.6.4. MaskReg计算

2.3.6.5. 基础算术

2.3.6.6. 逻辑计算

2.3.6.7. 复合计算

2.3.6.8. 比较与选择

2.3.6.9. 类型转换

2.3.6.10. 归约计算

2.3.6.11. 数据填充

2.3.6.12. 离散与聚合

2.3.6.13. 数据重排

2.3.6.14. 数据压缩

2.3.6.15. 直方图计算

2.3.6.16. 索引操作

2.3.6.17. 同步控制

2.3.6.18. 系统变量访问

2.3.6.19. 数据类型

2.3.8.1. Pipe和Que框架

2.3.8.1.4. 自定义TBufPool

2.3.8.2. 临时空间管理

2.3.8.3. 内存管理

2.3.9.2. 核内同步

2.3.9.3. 核间同步

2.3.9.4. 任务间同步

2.3.12.1. 上板打印

2.3.12.2. 异常检测

2.3.12.3. CPU孪生调试

2.3.12.4. 性能统计

2.3.13.1. 执行模式

2.3.13.2. 系统初始化