Skip to content

Log

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持

功能说明

头文件路径:"basic_api/reg_compute/kernel_reg_compute_vec_unary_intf.h"

该接口根据mask逐元素对源操作数求自然对数(以e为底),将结果写入目的操作数。该接口与Ln接口功能等价,接口命名遵循C/C++标准库中log()表示自然对数的约定。计算公式如下:

函数原型

C++
template <typename T = DefaultType, auto mode = MaskMergeMode::ZEROING, typename U>
__simd_callee__ inline void Log(U& dstReg, U& srcReg, MaskReg& mask)

参数说明

表 1 模板参数说明

参数名描述
T操作数数据类型。支持的数据类型请参考数据类型
mode可配置为MaskMergeMode枚举类型或LogSpecificMode的结构体指针。
• 配置MaskMergeMode,选择MERGING模式或ZEROING模式。
  • ZEROING模式下,mask未筛选的元素在dstReg中置零。
  • MERGING模式当前不支持。
• 配置LogSpecificMode,定义如下:
Text
enum class LogAlgo {
    INTRINSIC = 0,
    PRECISION_1ULP_FTZ_TRUE,
    PRECISION_1ULP_FTZ_FALSE,
};
struct LogSpecificMode {
    MaskMergeMode mrgMode = MaskMergeMode::ZEROING,
    LogAlgo algo = LogAlgo::INTRINSIC;
};
• mrgMode:选择MERGING模式或ZEROING模式。
• algo:用于配置Subnormal模式。
  • LogAlgo::INTRINSIC、LogAlgo::PRECISION_1ULP_FTZ_TRUE,使用单指令计算得出结果,最大精度误差为1ulp。目前,该算法支持half、float数据类型。
  • LogAlgo::PRECISION_1ULP_FTZ_FALSE,支持Subnormal数据计算,最大精度误差为1ulp。目前,该算法支持half、float数据类型。
U源操作数和目的操作数的RegTensor类型,例如RegTensor<half>,由编译器自动推导,用户不需要填写。

表2 参数说明

参数名输入/输出描述
dstReg输出目的操作数。
类型为RegTensor
srcReg输入源操作数。
类型为RegTensor
mask输入源操作数元素操作的有效指示,详细说明请参考MaskReg

数据类型

目的操作数与源操作数的数据类型需要保持一致。支持的数据类型为:half、float。

返回值说明

约束说明

关键特性说明

最大精度误差

  • LogAlgo::INTRINSIC、LogAlgo::PRECISION_1ULP_FTZ_TRUE,最大精度误差为1ulp。
  • LogAlgo::PRECISION_1ULP_FTZ_FALSE,最大精度误差为1ulp。

配置Subnormal模式
FTZ(Flush To Zero):一种浮点运算模式,当结果为Subnormal时,将其直接清零(近似为0),而非保留其精确的微小数值。
只有将algo设置为LogAlgo::PRECISION_1ULP_FTZ_FALSE时,Log接口才会保留并正确输出Subnormal结果;其他模式下Subnormal均被FTZ。
一般场景推荐使用性能更好的LogAlgo::INTRINSIC、LogAlgo::PRECISION_1ULP_FTZ_TRUE;需要精确Subnormal输出的场景(如特定数据精度要求的算法、避免除零错误)使用LogAlgo::PRECISION_1ULP_FTZ_FALSE。

调用示例

C++
template<typename T>
__simd_vf__ inline void LogVF(__ubuf__ T* dstAddr, __ubuf__ T* srcAddr, uint32_t count, uint16_t oneRepeatSize, uint16_t repeatTimes)
{
    AscendC::Reg::RegTensor<T> srcReg;
    AscendC::Reg::RegTensor<T> dstReg;
    AscendC::Reg::MaskReg mask;
    // Subnormal模式
    // static constexpr AscendC::Reg::LogSpecificMode mode = {MaskMergeMode::ZEROING, LogAlgo::PRECISION_1ULP_FTZ_FALSE};
    for (uint16_t i = 0; i < repeatTimes; i++) {
        mask = AscendC::Reg::UpdateMask<T>(count);
        AscendC::Reg::LoadAlign(srcReg, srcAddr + i * oneRepeatSize);
        AscendC::Reg::Log(dstReg, srcReg, mask);
        // Subnormal模式
        // AscendC::Reg::Log<DTYPE, &mode>(dstReg, srcReg, mask);
        AscendC::Reg::StoreAlign(dstAddr + i * oneRepeatSize, dstReg, mask);
    }
}

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区