CANN/asc-devkit GMToL1连续数据搬运
2026/7/29 10:03:55 网站建设 项目流程

GMToL1连续数据搬运(DataCopy)

【免费下载链接】asc-devkit本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言,原生支持C和C++标准规范,主要由类库和语言扩展层构成,提供多层级API,满足多维场景算子开发诉求。项目地址: https://gitcode.com/cann/asc-devkit

产品支持情况

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品AI Core:支持
  • Atlas 推理系列产品Vector Core:不支持
  • Atlas 训练系列产品:支持
  • Kirin X90:支持
  • Kirin 9030:支持

功能说明

头文件路径为:basic_api/kernel_operator_data_copy_intf.h。

该接口能够将矩阵从Global Memory连续搬运至L1 Buffer(TPosition为A1/B1),数据搬运时格式和内容保持不变。

函数原型

template <typename T> __aicore__ inline void DataCopy(const LocalTensor<T>& dst, const GlobalTensor<T>& src, const uint32_t count)

参数说明

表1模板参数说明

参数名描述
T源操作数或者目的操作数的数据类型。支持的数据类型请参考数据类型。

表2参数说明

参数名称输入/输出含义
dst输出目的操作数,类型为LocalTensor,存储位置为L1 Buffer(TPosition为A1/B1),目的地址需要32字节对齐。
src输入源操作数,类型为GlobalTensor,存储位置为Global Memory,源地址需要1字节对齐。
count输入参与搬运的元素个数。
注:count * sizeof(T)需要32字节对齐,若未对齐,搬运量会向下取整到32字节对齐。

以half数据类型为例,源操作数的shape为1 * 128。当count = 128时,图1将源操作数中128个元素连续搬运至目的操作数。

图1连续搬运示意图

数据类型

源矩阵和目的矩阵支持的数据类型保持一致。

针对Ascend 950PR/Ascend 950DT,支持数据类型为:b8、b16、b32、b64。

针对Atlas A3 训练系列产品/Atlas A3 推理系列产品,支持数据类型为:b8、b16、b32、b64。

针对Atlas A2 训练系列产品/Atlas A2 推理系列产品,支持数据类型为:b8、b16、b32、b64。

针对Atlas 推理系列产品AI Core,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、int32_t、uint32_t、int64_t、uint64_t、half、float、double。

针对Atlas 训练系列产品,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、int32_t、uint32_t、int64_t、uint64_t、half、float、double。

针对Kirin X90,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、int32_t、uint32_t、int64_t、uint64_t、half、float、double。

针对Kirin 9030,支持数据类型为:int8_t、uint8_t、int16_t、uint16_t、int32_t、uint32_t、int64_t、uint64_t、half、float、double。

返回值说明

约束说明

  • 位于Global Memory的源地址必须1字节对齐,位于L1 Buffer的目的地址必须32字节对齐。

  • 调用连续搬运接口时,count * sizeof(T)需要32字节对齐,若未对齐,则搬运量会向下取整到32字节对齐。

  • 如果需要执行多个DataCopy指令,且DataCopy的目的地址存在重叠,需要通过调用PipeBarrier(ISASI).md)来插入同步指令,保证多个DataCopy指令的串行化,防止出现异常数据。如下图左侧示意图,执行两个DataCopy指令,搬运的目的GM地址存在重叠,两条搬运指令之间需要通过调用PipeBarrier<PIPE_MTE3>()添加MTE3搬出流水的同步;如下图右侧示意图所示,搬运的目的地址Unified Buffer存在重叠,两条搬运指令之间需要调用PipeBarrier<PIPE_MTE2>()添加MTE2搬入流水的同步。

  • 针对如下产品型号:

    Atlas A3 训练系列产品/Atlas A3 推理系列产品;

    Atlas A2 训练系列产品/Atlas A2 推理系列产品;

    在跨卡通信算子开发场景,DataCopy类接口支持跨卡数据搬运,仅支持HCCS物理链路,不支持其他通路;开发者开发过程中,需要关注涉及卡间通信的物理通路,可通过npu-smi info -t topo命令查询HCCS物理链路。

调用示例

以图1 连续搬运示意图所示场景为例:

constexpr uint32_t copyCount = 128; // 源操作数:GM上连续存放的128个half。 AscendC::GlobalTensor<half> srcGm; srcGm.SetGlobalBuffer((__gm__ half *)src, copyCount); // 目的操作数:L1 Buffer。 AscendC::LocalTensor<half> dstLocal(AscendC::TPosition::A1, 0, copyCount); // count = 128,表示搬运128个half元素,实际搬运字节数256B满足32B对齐约束。 AscendC::DataCopy(dstLocal, srcGm, copyCount);

【免费下载链接】asc-devkit本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言,原生支持C和C++标准规范,主要由类库和语言扩展层构成,提供多层级API,满足多维场景算子开发诉求。项目地址: https://gitcode.com/cann/asc-devkit

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询