Skip to content

asc_set_ub2gm_loop_size

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:不支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:不支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:不支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:不支持

功能说明

头文件路径为:"c_api/vector_datamove/vector_datamove.h"

本接口用于设置asc_copy_ub2gm_align使用循环搬运模式时的两层循环迭代次数。loop1_size用于设置内层循环loop1的迭代次数,loop2_size用于设置外层循环loop2的迭代次数。

使用循环搬运模式时,还需通过asc_set_ub2gm_loop1_strideasc_set_ub2gm_loop2_stride分别设置内层循环和外层循环中,相邻两次迭代源操作数数据块起始地址之间的偏移量,以及目的操作数数据块起始地址之间的偏移量。

以源操作数搬运场景为例,如下图所示。

源操作数搬运场景示例

本接口仅在AIV上执行有效,在AIC上调用为空操作。

函数原型

C
__aicore__ inline void asc_set_ub2gm_loop_size(uint32_t loop1_size,
                                               uint32_t loop2_size)

参数说明

表1 参数说明

参数名输入/输出描述
loop1_size输入内层循环loop1的迭代次数。取值范围为[0, ]。
loop2_size输入外层循环loop2的迭代次数。取值范围为[0, ]。

返回值说明

流水类型

PIPE_S

约束说明

  • 本接口仅在AIV上生效,非AIV调用直接返回。
  • 调用asc_copy_ub2gm_align前,必须通过本接口、asc_set_ub2gm_loop1_strideasc_set_ub2gm_loop2_stride完成循环次数及两层循环步长的配置。
  • 循环次数配置会持续生效,直至重新配置。若后续搬运任务使用不同的循环次数,应在调用asc_copy_ub2gm_align前调用本接口重新配置。
  • loop1_sizeloop2_size设置为0时,对应循环不执行,后续的asc_copy_ub2gm_align调用不搬运数据。
  • 完成当前循环搬运任务后,需再次调用本接口将loop1_sizeloop2_size均设置为1,复位循环配置,否则可能影响下一次搬运。

调用示例

将以下代码保存为example.asc后,执行对应的编译运行命令。

以Ascend 950PR/Ascend 950DT产品(对应NPU架构为dav-3510)为例,编译运行命令如下:

Bash
bisheng example.asc -o main --npu-arch=dav-3510 && ./main
C++
#include <cstdint>
#include <iostream>
#include <vector>
#include "c_api/asc_simd.h"
#include "acl/acl.h"

namespace {

constexpr uint32_t INPUT_BYTES = 256;
constexpr uint32_t OUTPUT_BYTES = 128;

__global__ __vector__ void asc_set_ub2gm_loop_size_kernel(__gm__ uint8_t* output, __gm__ uint8_t* input)
{
    asc_init();
    __ubuf__ uint8_t local[INPUT_BYTES];
    asc_copy_gm2ub_align(local, input, INPUT_BYTES);
    asc_sync_notify(PIPE_MTE2, PIPE_MTE3, EVENT_ID0);
    asc_sync_wait(PIPE_MTE2, PIPE_MTE3, EVENT_ID0);
    asc_set_ub2gm_loop_size(2, 2);
    asc_set_ub2gm_loop1_stride(64, 32);
    asc_set_ub2gm_loop2_stride(128, 64);
    asc_copy_ub2gm_align(output, local, 1, 32, asc_store_l2_cache_mode::NORMAL_FIRST_VICTIM, 32, 32);
    asc_set_ub2gm_loop_size(1, 1);
    asc_sync_notify(PIPE_MTE3, PIPE_S, EVENT_ID0);
    asc_sync_wait(PIPE_MTE3, PIPE_S, EVENT_ID0);
}

void print_data(const char* name, const std::vector<uint8_t>& data)
{
    std::cout << name << ":";
    const uint32_t count = data.size() < 32 ? data.size() : 32;
    for (uint32_t i = 0; i < count; ++i) std::cout << ' ' << +data[i];
    if (data.size() > count) std::cout << " ...";
    std::cout << std::endl;
}
} // namespace

int main()
{
    std::vector<uint8_t> input(INPUT_BYTES), output(OUTPUT_BYTES, 0), golden(OUTPUT_BYTES, 0);
    for (uint32_t i = 0; i < INPUT_BYTES; ++i) input[i] = static_cast<uint8_t>(i + 1);
    for (uint32_t block = 0; block < 4; ++block) {
        const uint32_t source = (block / 2) * 128 + (block % 2) * 64;
        for (uint32_t i = 0; i < 32; ++i) golden[block * 32 + i] = input[source + i];
    }
    aclInit(nullptr);
    aclrtSetDevice(0);
    uint8_t *input_device = nullptr, *output_device = nullptr;
    aclrtMalloc(reinterpret_cast<void**>(&input_device), INPUT_BYTES, ACL_MEM_MALLOC_HUGE_FIRST);
    aclrtMalloc(reinterpret_cast<void**>(&output_device), OUTPUT_BYTES, ACL_MEM_MALLOC_HUGE_FIRST);
    aclrtMemcpy(input_device, INPUT_BYTES, input.data(), INPUT_BYTES, ACL_MEMCPY_HOST_TO_DEVICE);
    aclrtMemcpy(output_device, OUTPUT_BYTES, output.data(), OUTPUT_BYTES, ACL_MEMCPY_HOST_TO_DEVICE);
    asc_set_ub2gm_loop_size_kernel<<<1, 0>>>(output_device, input_device);
    aclrtSynchronizeDevice();
    aclrtMemcpy(output.data(), OUTPUT_BYTES, output_device, OUTPUT_BYTES, ACL_MEMCPY_DEVICE_TO_HOST);
    print_data("Input", input);
    print_data("Output", output);
    print_data("Golden", golden);
    const bool passed = output == golden;
    std::cout << (passed ? "[Success] asc_set_ub2gm_loop_size passed." : "[Failed] asc_set_ub2gm_loop_size failed.") << std::endl;
    aclrtFree(input_device);
    aclrtFree(output_device);
    aclrtResetDevice(0);
    aclFinalize();
    return passed ? 0 : 1;
}

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区