Skip to content

优化建议总览表

表1 性能优化建议总览表

分类

分类描述

优化建议

Tiling策略

提供Tiling相关的优化建议,便于开发者选择合适的Tiling切分策略。

核间负载均衡

头尾开销优化

提供降低算子头尾开销(算子执行计算前后产生的时延)的优化建议。

设置合适的核数和算子核函数(Kernel)型

限制TilingData结构大小

避免TPipe在对象内创建和初始化

核函数(Kernel)内删除Workspace相关冗余操作

设置DCI编译选项来减少算子尾开销

流水编排

通过任务并行化、异步调度等方法,提升硬件资源利用率,实现更高的吞吐率。

开启DoubleBuffer

启用Iterate或IterateAll异步接口避免AIC/AIV同步依赖

内存访问

通过控制搬运的数据块大小和GM地址等来实现搬运效率的最大化;通过Buffer的共享与复用、数据压缩精简、使用专用存储空间、访存调度优化等方法来减少内存占用,提升计算效率。

尽量一次搬运较大的数据块

GM地址尽量512B对齐

高效的使用搬运API

避免同地址访问

设置合理的L2 CacheMode

算子与高阶API共享临时Buffer

纯搬运类算子VECIN和VECOUT建议复用

通过缩减Tensor ShapeInfo维度,优化栈空间

避免Unified Buffer(UB)的bank冲突

L2 Cache切分

矢量计算

矢量计算相关优化建议。

通过UB融合实现连续vector计算

Vector算子灵活运用Counter模式

基于全局掩码复用的计算性能优化

选择低延迟指令,优化归约操作性能

矩阵计算

矩阵计算相关优化建议。

通过BT Buffer实现高效的bias计算

通过FP Buffer存放量化参数实现高效随路量化

通过L0C Buffer数据暂存实现高效的矩阵乘结果累加

较小矩阵长驻L1 Buffer,仅分次搬运较大矩阵

Matmul开启AtomicAdd选项

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区