CANN SHMEM 标量 put/get 访问 Host 内存样例解析:rma_d2h_demo 编译、运行与排障指南

发布时间:2026/9/19 23:12:39
CANN SHMEM 标量 put/get 访问 Host 内存样例解析:rma_d2h_demo 编译、运行与排障指南 CANN SHMEM 标量 put/get 访问 Host 内存样例解析rma_d2h_demo 编译、运行与排障指南【免费下载链接】shmemCANN SHMEM 是面向昇腾平台的多机多卡内存通信库基于OpenSHMEM 标准协议实现跨设备的高效内存访问与数据同步。项目地址: https://gitcode.com/cann/shmem导读本文围绕 CANN SHMEM 开源仓库中的 examples/rma_d2h_demo 样例系统讲解如何在昇腾设备上使用 SHMEM 的标量 put/get 数据传输接口aclshmem_int32_p/aclshmem_int32_g访问 Host 侧内存。读者将掌握该样例的完整数据流与内核实现、在 Atlas A3 与 Ascend 950PR 平台上的编译与运行方法以及运行前必须完成的内存容量检查和 Server ID 配置等前置校验并了解背后的对称内存symmetric memory与 Host 侧堆机制。样例概述与适用平台该样例演示的是 SHMEM标量scalarput get 数据传输接口访问 Host 内存的完整使用流程。与整段内存拷贝putmem/getmem不同标量接口针对单个基础类型元素提供低延迟的远程访问能力是构建细粒度跨节点同步逻辑的基础原语。支持的运行平台如下Atlas A3 训练系列产品 / Atlas A3 推理系列产品Ascend 950PR暂不支持 Ascend 950DT说明样例通过 CMakeLists.txt 中的aclshmem_add_fusion_example(rma_d2h_demo main.cpp)接入仓库统一的样例构建体系构建产物为build/bin/rma_d2h_demo。样例实现与数据流设计总体流程环形传递 PE 编号测试用例的逻辑非常直观每个 PEProcessing Element把自己在本卡上的编号通过 put 接口推给下一个 PE同时通过 get 接口从下一个 PE 的 output 中拉回对方的编号最终验证每个 PE 拿到的数据是否恰好等于(my_pe 1) % n_pes。// 摘录自 examples/rma_d2h_demo/main.cpp int mype aclshmem_my_pe(); int npes aclshmem_n_pes(); int peer (mype 1) % npes;测试用例实现步骤完整用例由 main.cpp 中的test_aclshmem_rma_scalar_8p承载分为四步初始化 ACL 与 SHMEM依次调用aclInit、aclrtSetDevice(my_pe)、aclrtCreateStream完成 ACL 侧初始化再通过aclshmemx_init_attr(ACLSHMEMX_INIT_WITH_DEFAULT, attributes)完成 SHMEM 初始化。初始化参数由仓库公共工具函数 test_set_attr 填充包括my_pe、n_pes、ip_port、local_mem_size与option_attr等。样例默认通过tcp://127.0.0.1:8998建立 PE 之间的 TCP 通信通道。分配内存并初始化数据通过aclrtMallocHost在 Host 侧分配input_host与output_host其中input初始化为 0output初始化为当前my_pe。随后调用aclshmemx_malloc(2*1024*1024, HOST_SIDE)分配 SHMEM 对称内存并以ACL_MEMCPY_HOST_TO_DEVICE将 Host 初始化数据拷入设备侧内存。启动内核执行在aclshmem_barrier_all()全局同步后调用run_demo_scalar启动kernel_test内核执行结束后再次以aclshmem_barrier_all()与aclrtSynchronizeStream确保所有 PE 完成通信。结果校验与资源清理将设备侧结果拷回 HostACL_MEMCPY_DEVICE_TO_HOST检查output是否等于(my_pe 1) % n_pes最后依次释放对称内存、销毁流并调用aclshmem_finalize、aclFinalize完成收尾。Kernel 实现标量 put/get 的核心调用内核侧kernel_test同样分为三步获取本 PE 编号、总 PE 数量与目标 PE 编号调用aclshmem_int32_p向下一个 PE 的 input发送本 PE 的编号随后调用aclshmem_quiet()等待 scalar 数据发送完成调用aclshmem_int32_g获取下一个 PE 的 output再次调用aclshmem_quiet()等待接收完成并把取回的值写入本 PE 的 output。for (int iii 0; iii 10; iii) { aclshmem_int32_p(input, peer, peer); aclshmem_quiet(); auto get_num aclshmem_int32_g(input, peer); aclshmem_quiet(); *(output) get_num; }值得注意的细节内核通过ASCEND_IS_AIC判断跳过 AI Core并在coreId 0时提前返回即只由 block 0 执行通信逻辑循环 10 次是为了反复验证 put/get 与aclshmem_quiet同步组合的稳定性在 include/device/gm2gm/shmem_device_rma.h 中shmem_int32_p/shmem_int32_g均被宏映射为aclshmem_int32_p/aclshmem_int32_gHost 侧同名接口定义于 include/host/data_plane/shmem_host_rma.h。从源码注释看p接口为针对单个基础类型元素提供低延迟 put 能力Provide a low latency put capability for single element of most basic typesg接口则返回单个元素值。为什么 put/get 能访问 Host 内存样例的关键在于aclshmemx_malloc(..., HOST_SIDE)在 include/host_device/shmem_common_types.h 中HOST_SIDE 0表示由 shmem 分配的内存位于 Host 侧。也就是说SHMEM 在 Host 物理内存上维护了一块可跨 PE 寻址的对称内存池样例默认配置 1GB见下文内存检查小节。标量 put/get 接口传入的input指针正是这块 Host 对称内存的本地地址SHMEM 运行时会依据对称内存的映射关系将其换算为目标 PE 上对应的对称地址从而完成跨节点的单元素读写。编译与运行环境准备环境配置请参考快速上手。完成 CANN Toolkit、驱动、固件以及构建依赖安装后按以下命令编译运行# A3 平台执行编译 bash scripts/build.sh -examples -cann # Ascend 950 平台执行编译 bash scripts/build.sh -soc_type Ascend950 -examples -cann cd examples/rma_d2h_demo # 运行用例 bash run.sh-cann选项用于链接 CANN 相关库Ascend950 平台的构建还会自动拉取nlohmann/json等第三方依赖详见编译与构建指南。运行脚本行为解读run.sh 默认以8 个进程并行启动build/bin/rma_d2h_demoexport SHMEM_UID_SESSION_ID127.0.0.1:8899 export LD_LIBRARY_PATH${PROJECT_ROOT}/build/lib:${ASCEND_HOME_PATH}/lib64:$LD_LIBRARY_PATHSHMEM_UID_SESSION_ID指定 PE 间会话标识服务地址用于多进程建连协调每个子进程执行rma_d2h_demo n_pes my_pe主进程通过wait等待全部后台进程结束并聚合退出码脚本支持-pes N参数自定义 PE 数量当小于 8 时自动将启动进程数收敛为 PE 数量。运行结果判定用例执行完成后打屏出现[INFO] demo run end in pe my_pe表示样例执行结束打屏出现[SUCCESS] run success in pe my_pe表示该 PE 结果校验通过若校验失败会打印[ERROR] run result incorrect in pe my_pe源码中对应的期望是input 变为前一个 PE 编号、output 变为后一个 PE 编号。每个 PE 还会打印一行received message input output可直接观察环形数据流动。约束限制与前置检查Ascend 950 运行环境要求若初始化阶段出现aclrtMemSetAccess failed请检查驱动、固件、CANN Toolkit 和 ops 包是否为相互兼容的配套版本。该错误通常意味着当前环境的内存访问权限设置与 SHMEM 初始化流程不匹配升级或对齐各组件版本后重试。查询 A3 超节点可用内存大小本样例默认配置1GB Host 内存因此要求查询得到的总可用内存大于 1GB。仓库提供了 check_support.py 脚本扫描物理内存中可被 SHMEM 使用的空闲连续段python3 check_support.py脚本的核心逻辑是遍历/sys/devices/system/node/下的所有 NUMA 节点通过/sys/devices/system/memory/block_size_bytes确定内存块粒度读取/proc/kpageflags的KPF_BUDDYbit 10标志识别 buddy 系统中处于空闲状态的物理页针对脚本内置的 4 个地址段0x29580000000、0xa9580000000、0x129580000000、0x1a9580000000每段 682GB计算空闲内存 ∩ 目标地址段的连续区间并按CONFIG_FORCE_MAX_ZONEORDER换算的 zone 页大小对齐最终按 NUMA 节点输出可用的空闲内存量MB并在 Summary 中给出总计GB。运行后示例输出见下请确认总空闲内存大于 1GB Summary NUMA node 0: 649216.00 MB NUMA node 1: 646144.00 MB NUMA node 2: 642048.00 MB NUMA node 3: 651264.00 MB PageSize: 0x1000, ZonePageSize: 0x200000 TotalFree: 2528.00 GBA3 超节点 Server ID 配置要求本样例在 A3 超节点环境下运行时必须确保各服务器的 Server ID 配置正确。特别是在更换故障硬件后可能出现 Server ID 未正确配置的情况导致样例运行失败。查询 Server ID 方法使用 npu-smi 工具查询当前服务器的 Server ID 配置npu-smi info -t spod-info -i 0 -c 0输出示例SDID : 16777216 Super Pod Size : 384 Super Pod ID : 0 Server Index : 4其中Server Index即为当前服务器的 Server ID需要确保一个计算节点内所有 NPU 保持一致。配置 Server ID 方法如果发现 Server ID 配置不正确可以通过Redfish 接口修改具体操作步骤请参考昇腾硬件配套的 Redfish 接口修改文档。配置完成后建议重启相关服务并再次使用上述 npu-smi 命令确认所有 NPU 的Server Index一致再重新编译运行样例。与仓库其他资源的关联对称内存管理HOST_SIDE类型内存的语义与 Host 侧堆基址说明见 include/host/mem/shmem_host_heap.h标量接口全集除int32外ACLSHMEM_TYPE_FUNC宏还为float/double/int8/int16/int64/uint8/uint16/uint32/uint64/char全类型生成*_p/*_g接口include/host/data_plane/shmem_host_rma.h有需要的开发者可直接替换数据类型同步原语aclshmem_quiet与aclshmem_barrier_all的详细语义可参考 API 文档 与 Python API 文档更多 RMA 样例仓库 examples 目录下还有simt_rma、simt_rma_scalar、udma_demo、sdma_d2h_demo等传输路径与标量语义相近的样例可作为对比学习材料。总结rma_d2h_demo 是理解 CANN SHMEM 标量 put/get 接口与 Host 侧对称内存访问的最小可运行样例它用环形传递 PE 编号这一直观场景完整覆盖了 ACL/SHMEM 初始化、Host 内存分配、内核标量通信、结果校验与资源释放的全链路。在实际部署到 A3 超节点或 Ascend 950PR 时务必先完成check_support.py的内存容量扫描与 npu-smi 的 Server ID 一致性检查二者是本样例稳定运行的两个关键前置条件。【免费下载链接】shmemCANN SHMEM 是面向昇腾平台的多机多卡内存通信库基于OpenSHMEM 标准协议实现跨设备的高效内存访问与数据同步。项目地址: https://gitcode.com/cann/shmem创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考