asc_copy_l12l0b_sparse
产 品 支 持 情 况
| 产 品 | 是 否 支 持 |
|---|---|
| √ | |
| √ |
功 能 说 明
用 于 搬 运 存 放 在L1 Buffer里 的512B大 小 的 稠 密 权 重 矩 阵 到L0B Buffer里,同 时 读 取128B大 小 的 索 引 矩 阵 用 于 稠 密 矩 阵 的 稀 疏 化。
索 引 矩 阵 在 一 个int8_t的 地 址 中 的 排 布 是 逆 序 排 布 的,例 如:索 引 矩 阵1 2 0 1 0 2 1 0,在 地 址 中 的 排 布 为1 0 2 1 0 1 2 0,其 中1 0 2 1(对 应 索 引 矩 阵 前 四 位1 2 0 1)拼 成 一 个int8_t数 据,0 1 2 0(对 应 索 引 矩 阵 后 四 位0 2 1 0)拼 成 一 个int8_t数 据。
函 数 原 型
高 维 切 分 搬 运
C++__aicore__ inline void asc_copy_l12l0b_sparse(__cb__ int8_t* dst, __cbuf__ int8_t* src, __cbuf__ int8_t* index, uint16_t start_index, uint8_t repeat)同 步 搬 运
C++__aicore__ inline void asc_copy_l12l0b_sparse_sync(__cb__ int8_t* dst, __cbuf__ int8_t* src, __cbuf__ int8_t* index, uint16_t start_index, uint8_t repeat)
参 数 说 明
表1参 数 说 明
| 参 数 名 | 输 入/输 出 | 描 述 |
|---|---|---|
| dst | 输 出 | 目 的 操 作 数 在L0B Buffer的 起 始 地 址。 |
| src | 输 入 | 源 操 作 数 在L1 Buffer的 起 始 地 址。 |
| index | 输 入 | 索 引 矩 阵 在L1 Buffer的 起 始 地 址。 |
| start_index | 输 入 | 分 形 矩 阵ID,说 明 搬 运 起 始 位 置 为 源 操 作 数 中 第 几 个 分 形(0为 源 操 作 数 中 第1个 分 形 矩 阵)。取 值 范 围:[0, 65535]。单 位:512B。 |
| repeat | 输 入 | 迭 代 次 数,每 个 迭 代 可 以 处 理512B数 据。取 值 范 围:[1, 255]。 |
返 回 值 说 明
无
流 水 类 型
PIPE_MTE1
约 束 说 明
- 操 作 数 地 址 重 叠 约 束 请 参 考通 用 地 址 重 叠 约 束。
- dst、src的 起 始 地 址 需 要32字 节 对 齐。
- repeat为0表 示 不 执 行。
- start_index不 能 小 于0。
- 不 支 持 转 置 功 能。
调 用 示 例
C++
__cb__ int8_t dst[256];
__cbuf__ int8_t src[256];
__cbuf__ int8_t index[64];
uint16_t start_index = 1;
uint8_t repeat = 8;
asc_copy_l12l0b_sparse(dst, src, index, start_index, repeat);