Skip to content

asc_update_addr_reg

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持

功能说明

头文件路径为:"c_api/reg_compute/compute/reg_addr_reg.h"

更新地址寄存器(addr_reg),用于迭代寻址。支持1~4维偏移量设置,位宽支持b8、b16、b32三种模式:

  • b8模式:每次迭代地址偏移量以1字节为单位,适用于int8_t、uint8_t等类型的操作。
  • b16模式:每次迭代地址偏移量以2字节为单位,适用于half、int16_t等类型的操作。
  • b32模式:每次迭代地址偏移量以4字节为单位,适用于float、int32_t等类型的操作。

每次迭代时的地址偏移量计算公式为:offset = index0×stride0 + index1×stride1 + index2×stride2 + index3×stride3,其中index_i为各维度的循环迭代变量,stride_i为各维度的步长。例如在4维场景(N, C, H, W)中,offset0对应W维(最内层),offset1对应H×W,offset2对应C×H×W,offset3对应N×C×H×W。addr_reg更新后配合asc_loadalign/asc_storealign等接口使用,在循环中按设定的偏移量自动递增Unified Buffer(UB)地址。

说明

旧接口 asc_create_iter_reg_* 已废弃,请使用 asc_update_addr_reg_* 替代。旧接口返回类型 iter_reg 也已更名为 addr_reg

函数原型

  • 1维偏移

    C++
    __simd_callee__ inline addr_reg asc_update_addr_reg_b8(uint32_t offset)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b16(uint32_t offset)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b32(uint32_t offset)
    
  • 2维偏移

    C++
    __simd_callee__ inline addr_reg asc_update_addr_reg_b8(uint32_t offset0, uint32_t offset1)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b16(uint32_t offset0, uint32_t offset1)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b32(uint32_t offset0, uint32_t offset1)
    
  • 3维偏移

    C++
    __simd_callee__ inline addr_reg asc_update_addr_reg_b8(uint32_t offset0, uint32_t offset1, uint32_t offset2)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b16(uint32_t offset0, uint32_t offset1, uint32_t offset2)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b32(uint32_t offset0, uint32_t offset1, uint32_t offset2)
    
  • 4维偏移

    C++
    __simd_callee__ inline addr_reg asc_update_addr_reg_b8(uint32_t offset0, uint32_t offset1, uint32_t offset2, uint32_t offset3)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b16(uint32_t offset0, uint32_t offset1, uint32_t offset2, uint32_t offset3)
    __simd_callee__ inline addr_reg asc_update_addr_reg_b32(uint32_t offset0, uint32_t offset1, uint32_t offset2, uint32_t offset3)
    

参数说明

表1 参数说明

参数名输入/输出描述
offset输入第1维的偏移量(最内层),单位为元素个数。
数据类型为uint32_t。
例如b32模式下offset=64表示64个float元素(一个VL即256B)。
offset0输入第1维的偏移量(最内层,如W维),单位为元素个数。
数据类型为uint32_t。
offset1输入第2维的偏移量(如H×W维的总步长),单位为元素个数。
数据类型为uint32_t。
offset2输入第3维的偏移量(如C×H×W维的总步长),单位为元素个数。
数据类型为uint32_t。
offset3输入第4维的偏移量(最外层,如N×C×H×W维的总步长),单位为元素个数。
数据类型为uint32_t。

返回值说明

返回值为addr_reg,地址寄存器。

约束说明

  • 请勿在循环内使用if/else。
  • addr_reg必须在最内层循环体内赋值使用。
  • 不同步长的操作数,建议使用多个addr_reg,避免地址被覆盖。
  • addr_reg的数量上限为8,超过8个可能会导致性能劣化。编译器会自动复用生命周期已经结束的addr_reg寄存器。
  • 由于硬件(HardwareLoop)限制,addr_reg最多支持4层循环。

调用示例

C++
__simd_vf__ inline void update_addr_reg_vf(__ubuf__ half* dst_addr, __ubuf__ half* src_addr, uint16_t one_repeat_size, uint16_t repeat_time)
{
    vector_half data;
    vector_bool mask = asc_create_mask_b16(PAT_ALL);
    addr_reg offset;
    for (uint16_t i = 0; i < repeat_time; ++i) {
        offset = asc_update_addr_reg_b16(one_repeat_size);
        asc_loadalign(data, src_addr, offset);
        asc_storealign(dst_addr, data, offset, mask);
    }
}

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区