Sqrt
产品支持情况
- Ascend 950PR/Ascend 950DT:支持
- Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
- Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
- Atlas 200I/500 A2 推理产品:不支持
- Atlas 推理系列产品AI Core:不支持
- Atlas 推理系列产品Vector Core:不支持
- Atlas 训练系列产品:不支持
功能说明
头文件路径:"basic_api/reg_compute/kernel_reg_compute_vec_unary_intf.h"。
该接口根据mask,对源操作数srcReg逐元素做平方根运算,将结果写入目的操作数dstReg。计算公式如下:
函数原型
C++
template <typename T = DefaultType, auto mode = MaskMergeMode::ZEROING, typename U>
__simd_callee__ inline void Sqrt(U& dstReg, U& srcReg, MaskReg& mask)
参数说明
表 1 模板参数说明
| 参数名 | 描述 |
|---|---|
| T | 操作数数据类型。支持的数据类型请参考数据类型。 |
| mode | 可配置为MaskMergeMode枚举类型的枚举或SqrtSpecificMode的结构体指针。 • MaskMergeMode,选择MERGING模式或ZEROING模式。 • ZEROING模式下,mask未筛选的元素在dstReg中置零。 • MERGING模式当前不支持。 • SqrtSpecificMode,定义如下: Text • precisionMode:用于配置精度模式。当precisionMode为true时,使能更高精度的Sqrt计算,使用快速求逆算法得出结果。该算法目前只针对float数据类型生效。 • algo:用于配置Subnormal模式,具体参考关键特性说明。 • SqrtAlgo::INTRINSIC、SqrtAlgo::PRECISION_1ULP_FTZ_TRUE,使用单指令计算得出结果,最大精度误差为1ulp。 • SqrtAlgo::FAST_INVERSE、SqrtAlgo::PRECISION_0ULP_FTZ_FALSE,使用快速求逆算法得出结果。目前,该算法仅支持float数据类型,并在该模式下支持Subnormal数据计算。 • SqrtAlgo::PRECISION_1ULP_FTZ_FALSE,最大精度误差为1ulp。 |
| U | 源操作数和目的操作数的RegTensor类型,例如RegTensor<half>,由编译器自动推导,用户不需要填写。 |
表 2 参数说明
| 参数名 | 输入/输出 | 描述 |
|---|---|---|
| dstReg | 输出 | 目的操作数。 类型为RegTensor。 |
| srcReg | 输入 | 源操作数。 类型为RegTensor。 |
| mask | 输入 | 源操作数元素操作的有效指示,详细说明请参考MaskReg。 |
数据类型
目的操作数与源操作数的数据类型需要保持一致。支持的数据类型为:half、float。
返回值说明
无
约束说明
- 输入为负数时结果为nan。
- 输入为-0时结果为-0。
关键特性说明
最大精度误差:
- SqrtAlgo::INTRINSIC、SqrtAlgo::PRECISION_1ULP_FTZ_TRUE,最大精度误差为1ulp。
- SqrtAlgo::PRECISION_1ULP_FTZ_FALSE,最大精度误差为1ulp。
- SqrtAlgo::FAST_INVERSE、SqrtAlgo::PRECISION_0ULP_FTZ_FALSE,最大精度误差为0ulp。
配置Subnormal模式:
FTZ(Flush To Zero):一种浮点运算模式,当结果为Subnormal时,将其直接清零(近似为0),而非保留其精确的微小数值。
只有将algo设置为SqrtAlgo::FAST_INVERSE、SqrtAlgo::PRECISION_0ULP_FTZ_FALSE、SqrtAlgo::PRECISION_1ULP_FTZ_FALSE时,Sqrt接口才会保留并正确输出Subnormal结果;其他模式下Subnormal均被FTZ。
一般场景推荐使用性能更好的SqrtAlgo::INTRINSIC、SqrtAlgo::PRECISION_1ULP_FTZ_TRUE;需要精确Subnormal输出的场景(如特定数据精度要求的算法、避免除零错误)使用SqrtAlgo::FAST_INVERSE、SqrtAlgo::PRECISION_0ULP_FTZ_FALSE、PRECISION_1ULP_FTZ_FALSE。
表 3 Sqrt Subnormal示例
| 输出 | 输入 | algo |
|---|---|---|
| 1.0471472598529991e-19(0x1FF7 402B) | 1.0965174496326337e-38(0x0077 6672) | SqrtAlgo::FAST_INVERSE、SqrtAlgo::PRECISION_0ULP_FTZ_FALSE |
| 1.0471473244764844e-19(0x1FF7 402C) | 1.0965174496326337e-38(0x0077 6672) | SqrtAlgo::PRECISION_1ULP_FTZ_FALSE |
调用示例
C++
template<typename T>
__simd_vf__ inline void SqrtVF(__ubuf__ T* dstAddr, __ubuf__ T* srcAddr, uint32_t count, uint16_t oneRepeatSize, uint16_t repeatTimes)
{
AscendC::Reg::RegTensor<T> srcReg;
AscendC::Reg::RegTensor<T> dstReg;
AscendC::Reg::MaskReg mask;
// 高精度模式
// static constexpr AscendC::Reg::SqrtSpecificMode mode = {MaskMergeMode::ZEROING, true};
// Subnormal模式
// static constexpr AscendC::Reg::SqrtSpecificMode mode = {MaskMergeMode::ZEROING, true, SqrtAlgo::PRECISION_0ULP_FTZ_FALSE};
for (uint16_t i = 0; i < repeatTimes; i++) {
mask = AscendC::Reg::UpdateMask<T>(count);
AscendC::Reg::LoadAlign(srcReg, srcAddr + i * oneRepeatSize);
AscendC::Reg::Sqrt(dstReg, srcReg, mask);
// 高精度模式/Subnormal模式
// AscendC::Reg::Sqrt<T, &mode>(dstReg, srcReg, mask);
AscendC::Reg::StoreAlign(dstAddr + i * oneRepeatSize, dstReg, mask);
}
}