Skip to content

asc_squeeze_and_storeunalign_finalize

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持

功能说明

reg计算数据搬运接口,适用于从矢量数据寄存器中筛选出有效元素后按照连续非32B对齐的起始地址连续搬出到UB的尾块场景。

搬运原理如下: 记目的操作数的起始地址为dst_start,结束地址为dst_end,尾块元素个数为unalign_count = (dst_end - dst_end / 32 * 32) / sizeof(T)。则搬运的数据会分为两部分,分别是:

  • 32B对齐的主块部分UB[dst_start, dst_end - unalign_count * sizeof(T)]。
  • 非32B对齐的尾块部分UB[dst_end - unalign_count * sizeof(T), dst_end]。

asc_squeeze_and_storeunalign接口执行时,会将主块搬出至UB,尾块暂存至非对齐寄存器[0, unalign_count]。本接口执行时,会将尾块从非对齐寄存器搬出至UB。因此需要先调用asc_squeeze_and_storeunalign,再调用本接口。

函数原型

C++
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ int8_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ uint8_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ fp4x2_e2m1_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ fp4x2_e1m2_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ int4b_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ fp8_e8m0_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ fp8_e5m2_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ fp8_e4m3fn_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ int16_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ uint16_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ half* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ bfloat16_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ int32_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ uint32_t* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ float* dst, vector_store_unalign src)
__simd_callee__ inline void asc_squeeze_and_storeunalign_finalize(__ubuf__ int64_t* dst, vector_store_unalign src)

参数说明

表1 参数说明

参数名输入/输出描述
dst输出目的操作数(矢量)的起始地址。
src输入非对齐寄存器,用于保存非对齐数据,长度32B。

非对齐寄存器和地址寄存器的详细说明请参见reg数据类型定义

返回值说明

流水类型

PIPE_V

约束说明

  • 该接口中的dst不需要32B对齐,需要和asc_squeeze_and_storeunalign配置的目的操作数地址及非对齐寄存器保持一致。
  • 需要保证目的操作数的地址写入非对齐寄存器中的数据后不越过UB可用容量上限,否则触发写越界异常。

调用示例

C++
__simd_vf__ inline void vf_squeeze_and_storeunalign(__ubuf__ half* dst_addr, __ubuf__ half* src_addr, uint32_t one_repeat_size, uint16_t repeat_time)
{
    vector_half dst;
    vector_half src;
    vector_store_unalign ureg;
    vector_bool mask = asc_create_mask_b16(PAT_M4);
    asc_squeeze_and_storeunalign_init();
    for (uint16_t i = 0; i < repeat_time; ++i) {
        asc_loadalign_postupdate(src, src_addr, one_repeat_size);
        asc_squeeze_and_storeunalign(dst_addr, dst, ureg, src, mask);
    }
    asc_squeeze_and_storeunalign_finalize(dst_addr, ureg);
}

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区