Skip to content

矩阵计算的搬入总体说明

矩阵计算的搬入接口主要实现Global Memory到L1 Buffer和L1 Buffer到L0A Buffer/L0B Buffer/L0ScaleA Buffer/L0ScaleB Buffer/BiasTable Buffer/Fixpipe Buffer的数据高效传输。

针对Ascend 950PR/Ascend 950DT:

表1 数据通路和存储层级

源位置源地址对齐要求目的位置目的地址对齐要求格式转换典型应用场景
Global Memory1字节L1 Buffer32字节ND2ND、ND2NZ、ND2ZN、DN2NZ、DN2ZN、NZ2NZ、ZN2ZN从全局内存加载左矩阵、右矩阵等数据到L1 Buffer。
Global Memory1字节L1 Buffer32字节ScaleND2ZZ、ScaleDN2ZZ、ZZ2ZZ、ScaleND2NN、ScaleDN2NN、NN2NN从全局内存加载左矩阵缩放系数和右矩阵缩放系数到L1 Buffer。
L1 Buffer32字节L0A Buffer512字节NZ2NZ、ZN2NZ从L1 Buffer加载左矩阵数据到L0A Buffer。
L1 Buffer32字节L0B Buffer512字节ZN2ZN、NZ2ZN从L1 Buffer加载右矩阵数据到L0B Buffer。
L1 Buffer32字节L0ScaleA Buffer32字节ZZ2ZZ从L1 Buffer加载左矩阵缩放系数到L0ScaleA Buffer。
L1 Buffer32字节L0ScaleB Buffer32字节NN2NN从L1 Buffer加载右矩阵缩放系数到L0ScaleB Buffer。
L1 Buffer32字节BiasTable Buffer64字节ND2ND从L1 Buffer加载Bias数据到BiasTable Buffer。
L1 Buffer32字节Fixpipe Buffer128字节ND2ND从L1 Buffer加载量化数据到Fixpipe Buffer。

免责声明:本站内容由 asc-devkit 仓 master 分支自动编译生成,属于持续开发版本,可能存在缺陷,仅供预览与参考。如需稳定及商用资料,请查阅官方 昇腾社区