ShiftRights
产品支持情况
- Ascend 950PR/Ascend 950DT:支持
- Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
- Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
- Atlas 200I/500 A2 推理产品:不支持
- Atlas 推理系列产品 AI Core:不支持
- Atlas 推理系列产品 Vector Core:不支持
- Atlas 训练系列产品:不支持
功能说明
头文件路径为:"basic_api/reg_compute/kernel_reg_compute_vec_binary_scalar_intf.h"。
ShiftRights指令根据mask对源操作数srcReg,按照scalarValue进行右移操作,将结果写入目的操作数dstReg。根据源操作数的数据类型,右移操作分为以下两种情况:
数据类型为无符号类型:执行逻辑右移。
逻辑右移会将二进制数整体向右移动指定的位数,每移动1位,最低位被丢弃,最高位用0填充。例如,二进制数1010101010101010(uint16_t类型)逻辑右移1位后,结果为0101010101010101。
数据类型为有符号类型:执行算术右移。
算术右移会将二进制数整体向右移动指定的位数,每移动1位,最低位被丢弃,最高位复制符号位。例如,二进制数1010101010101010(int16_t类型)算术右移1位后,结果为1101010101010101;算术右移3位后,结果为1111010101010101。
函数原型
C++
template <typename T = DefaultType, typename U, MaskMergeMode mode = MaskMergeMode::ZEROING, typename S>
__simd_callee__ inline void ShiftRights(S& dstReg, S& srcReg, U scalarValue, MaskReg& mask)
参数说明
表1 模板参数说明
| 参数名 | 描述 |
|---|---|
| T | 矢量目的操作数和源操作数的数据类型。 |
| U | 标量源操作数的数据类型。 |
| mode | MaskMergeMode枚举类型。选择MERGING模式或ZEROING模式。 • ZEROING模式下,mask未筛选的元素在dstReg中置零。 • MERGING模式当前不支持。 |
| S | 矢量目的操作数和源操作数的RegTensor类型,例如RegTensor<uint16_t>,由编译器自动推导,用户不需要填写。 |
表2 参数说明
| 参数名 | 输入/输出 | 描述 |
|---|---|---|
| dstReg | 输出 | 目的操作数。 类型为RegTensor。 |
| srcReg | 输入 | 源操作数。 类型为RegTensor。 数据类型需要与目的操作数保持一致。 |
| scalarValue | 输入 | 源操作数。 类型为一个标量。 不支持设置为负数,负数行为未定义。 |
| mask | 输入 | 源操作数元素操作的有效指示,详细说明请参考MaskReg。 |
返回值说明
无
数据类型
表3 数据类型支持情况
| dstReg | srcReg | scalarValue |
|---|---|---|
| int8_t | int8_t | int16_t |
| uint8_t | uint8_t | int16_t |
| int16_t | int16_t | int16_t |
| uint16_t | uint16_t | int16_t |
| int32_t | int32_t | int16_t |
| uint32_t | uint32_t | int16_t |
| int64_t | int64_t | int16_t |
| uint64_t | uint64_t | int16_t |
约束说明
- 对于逻辑位移(无符号数据类型),如果位移量(scalarValue)大于数据类型位宽,则输出为0。
- 对于算术位移(有符号数据类型),如果srcReg小于0,位移量大于数据类型位宽,则输出-1;如果srcReg大于0,位移量大于数据类型位宽,则输出0。
- scalarValue不支持设置为负数,负数行为未定义。
调用示例
C++
template<typename T, typename U>
__simd_vf__ inline void ShiftRightsVF(__ubuf__ T* dstAddr, __ubuf__ T* srcAddr, U scalarValue, uint32_t count, uint32_t oneRepeatSize, uint16_t repeatTimes)
{
AscendC::Reg::RegTensor<T> srcReg;
AscendC::Reg::RegTensor<T> dstReg;
AscendC::Reg::MaskReg mask;
for (uint16_t i = 0; i < repeatTimes; i++) {
AscendC::Reg::LoadAlign(srcReg, srcAddr + i * oneRepeatSize);
mask = AscendC::Reg::UpdateMask<T>(count);
AscendC::Reg::ShiftRights(dstReg, srcReg, scalarValue, mask);
AscendC::Reg::StoreAlign(dstAddr + i * oneRepeatSize, dstReg, mask);
}
}