news 2026/8/15 23:29:36

6.3 显存与地址:amd_memory

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
6.3 显存与地址:amd_memory

要让 GPU 干任何活,第一步都是准备内存:命令流(IB/PM4)要放在 GPU 能读到的内存里,被拷贝的 src/dst 数据也要有 GPU 虚拟地址。裸用 libdrm 做这件事,每次都要走「分配 BO → 分配 VA 范围 → 建立映射 →(可选)CPU 映射」四步,还要处理各步失败时的逆序回滚。amd_memory.{c,h}的价值就是把这套样板收敛成一两个函数。这一篇讲清楚它封装了什么、每层 libdrm 调用各自负责什么、以及不同变体该怎么选。

一、一个 BO 从分配到可用,要过几关

在 amdgpu 的模型里,「一块能被 GPU 命令直接引用的内存」不是一次调用就绪的,它有三个正交的概念:

amdgpu_bo_alloc
分配物理 BO
(选 heap: VRAM/GTT)

amdgpu_va_range_alloc
分配一段 GPU 虚拟地址

amdgpu_bo_va_op MAP
把 BO 映射到该 VA

amdgpu_bo_cpu_map
拿到 CPU 指针(可选)

  • BO(buffer object):真实的物理后备,分配时用preferred_heap决定放在 VRAM 还是 GTT(系统内存),用flags指定 CPU 可访问等属性。
  • VA 范围:GPU 侧的虚拟地址空间,独立于物理 BO 分配。命令流里写的地址(如 WRITE_DATA 的目标)就是这个 VA。
  • MAP:把物理 BO 绑到某段 VA 上,页表由此建立,GPU 才能通过该地址访问到数据。
  • CPU map:可选,给测试代码一个void*去填数据 / 读回校验。

这四步任何一步失败,前面已成功的都要按逆序撤销——这正是最容易写错、也最值得封装的部分。

二、主力函数:amdgpu_bo_alloc_and_map

绝大多数测试用的就是它。一次调用把四步和回滚全包了:

intamdgpu_bo_alloc_and_map(amdgpu_device_handle dev,unsignedsize,unsignedalignment,unsignedheap,uint64_tflags,amdgpu_bo_handle*bo,void**cpu,uint64_t*mc_address,amdgpu_va_handle*va_handle){structamdgpu_bo_alloc_requestrequest={.alloc_size=size,.phys_alignment=alignment,.preferred_heap=heap,.flags=flags,};amdgpu_bo_handle buf_handle;amdgpu_va_handle handle;uint64_tvmc_addr;intr;r=amdgpu_bo_alloc(dev,&request,&buf_handle);if(r)returnr;r=amdgpu_va_range_alloc(dev,amdgpu_gpu_va_range_general,size,alignment,0,&vmc_addr,&handle,0);if(r)gotoerror_va_alloc;r=amdgpu_bo_va_op(buf_handle,0,size,vmc_addr,0,AMDGPU_VA_OP_MAP);if(r)gotoerror_va_map;r=amdgpu_bo_cpu_map(buf_handle,cpu);if(r)gotoerror_cpu_map;*bo=buf_handle;*mc_address=vmc_addr;*va_handle=handle;return0;error_cpu_map:amdgpu_bo_cpu_unmap(buf_handle);error_va_map:amdgpu_bo_va_op(buf_handle,0,size,vmc_addr,0,AMDGPU_VA_OP_UNMAP);error_va_alloc:amdgpu_bo_free(buf_handle);returnr;}

调用方拿回四样东西,各有用途:

输出类型用途
*boamdgpu_bo_handle提交时进 BO list,让内核知道这次提交引用了它
*cpuvoid*CPU 侧填数据 / 读回校验
*mc_addressuint64_tGPU 虚拟地址,写进 PM4 packet 的地址字段
*va_handleamdgpu_va_handle释放时归还 VA 范围

关键设计点是那串goto逆序回滚:CPU map 失败就只回滚到 unmap+free;VA map 失败就回滚 VA 分配……保证任何中途失败都不泄漏 BO 或 VA。这段逻辑写一次、所有测试复用,是这个库最实在的价值之一。

三、释放:一句对称的收尾

分配的逆操作同样打包好,顺序与分配严格镜像:

voidamdgpu_bo_unmap_and_free(amdgpu_bo_handle bo,amdgpu_va_handle va_handle,uint64_tmc_addr,uint64_tsize){amdgpu_bo_cpu_unmap(bo);amdgpu_bo_va_op(bo,0,size,mc_addr,0,AMDGPU_VA_OP_UNMAP);amdgpu_va_range_free(va_handle);amdgpu_bo_free(bo);}

CPU unmap → VA unmap → 归还 VA 范围 → 释放 BO。测试里alloc_and_map/unmap_and_free成对出现,就不会漏资源。

四、几个变体:什么时候用哪个

同一主题有几个变体,差别只在「映射那一步怎么做」:

函数差别适用场景
amdgpu_bo_alloc_and_map标准 MAP,默认读写权限绝大多数测试
amdgpu_bo_alloc_and_map_rawamdgpu_bo_va_op_raw,显式带READABLE|WRITEABLE|EXECUTABLE+ 自定义mapping_flags,并按getpagesize()对齐需要可执行页(放 shader ISA)或自定义映射标志
amdgpu_bo_alloc_and_map_syncsync参数分流:走 user-queue 路径(_uq)或普通路径用户队列(UQ)提交模型

_raw版本的映射长这样,注意它显式给出页权限并把大小对齐到系统页:

r=amdgpu_bo_va_op_raw(dev,buf_handle,0,ALIGN(size,getpagesize()),vmc_addr,AMDGPU_VM_PAGE_READABLE|AMDGPU_VM_PAGE_WRITEABLE|AMDGPU_VM_PAGE_EXECUTABLE|mapping_flags,AMDGPU_VA_OP_MAP);

放 compute shader 二进制的 BO 必须可执行,就得走_raw显式带EXECUTABLE位;普通数据 BO 用标准版即可。

五、BO list:把提交要引用的 BO 打包

提交一次命令,内核需要知道这次会碰到哪些 BO(用于驻留/换页)。amd_memory提供了一个最常用的两 BO 打包:

intamdgpu_get_bo_list(amdgpu_device_handle dev,amdgpu_bo_handle bo1,amdgpu_bo_handle bo2,amdgpu_bo_list_handle*list){amdgpu_bo_handle resources[]={bo1,bo2};returnamdgpu_bo_list_create(dev,bo2?2:1,resources,NULL,list);}

bo2传 NULL 就只登记一个。典型场景:bo1是命令 IB,bo2是数据 BO。这个 list 会交给下一步的命令提交(下一篇 6.4 之后的提交框架会用到)。

六、其它职责

amd_memory还兼管几类与内存相关的杂活,用到时知道去哪找即可:

  • 内存信息查询get_available_vram/get_available_system_memory/get_gpu_memory_info,用于按可用容量裁剪测试规模。
  • dmabuf / 导入导出create_dmabufvirtual_mem_to_gpu_bo(把一段用户虚拟内存包成 GPU BO),服务跨设备共享与 SVM 类场景。
  • 裸 CPU 虚拟内存virtual_alloc_memory/virtual_free_memory/wait_on_value,用于纯 CPU 侧的辅助缓冲与轮询等待。
  • 多 fence 等待amdgpu_command_submission_multi_fence_wait_all

七、关键结论

  • amdgpu 内存有三个正交概念:物理 BO、GPU VA 范围、二者的 MAP;amd_memory的核心就是把「分配四步 + 逆序回滚」封成一句amdgpu_bo_alloc_and_map
  • 一次分配返回四样东西各司其职:bo(进 BO list)、cpu(填/读)、mc_address(写进 PM4)、va_handle(释放用)。
  • 需要可执行页(放 shader)或自定义映射标志时用_raw变体;用户队列模型用_sync变体。
  • amdgpu_get_bo_list把「这次提交引用了哪些 BO」打包,衔接到命令提交环节。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/15 23:29:31

C-05. Kernel Fusion 代价边界:少写回 vs 寄存器压力与 occupancy

C-04 钉死:少同步点不等于该 fuse。 本章回答垂直融合何时省 GMEM 真赚、何时寄存器/occupancy 把收益吃掉。 本机:瘦融合随链长 3.9→9.8;fat 把 occupancy 6→1,相对瘦融合慢 8。 配套可复现:Yapeng-Gao/AI-System-P…

作者头像 李华
网站建设 2026/8/15 23:26:20

04-人脸对齐与ArcFace识别

人脸对齐与 ArcFace 识别:Umeyama、112112 与余弦阈值 本文讲透一件事:检测到的五点如何变成标准脸,标准脸如何变成可比较的向量,向量如何用余弦相似度判定「是不是同一个人」。对齐核心是 Umeyama 相似变换与 kRef5 模板&#xf…

作者头像 李华
网站建设 2026/8/15 23:22:02

告别双电机“较劲”,MOTEC主从控制模式让驱动“完美”同步。

在轨道巡检机器人、AGV、助爬器等众多自动化设备中,双电机共同驱动同一刚性负载的场景十分普遍。然而,这种结构长期面临一个棘手难题:两台电机和驱动器之间缺乏有效协调,即使微小的速度差或力矩分配不均,也会导致电机互…

作者头像 李华
网站建设 2026/8/15 23:20:08

MySQL安全配置:secure-file-priv原理、配置与实战指南

1. 项目概述:理解secure-file-priv的来龙去脉如果你在 MySQL 里尝试执行SELECT ... INTO OUTFILE /tmp/result.csv或者使用LOAD DATA INFILE命令时,突然蹦出来一个错误:“ERROR 1290 (HY000): The MySQL server is running with the --secure…

作者头像 李华
网站建设 2026/8/15 22:58:03

做弱电十年,筛选长期合作一级代理商核心条件

长期做弱电集成的同行都清楚,稳定供货渠道直接决定项目交付效率、投标通过率。筛选可长期合作的网络设备一级代理,不能只看单次报价,五大硬性标准缺一不可,今天结合多年项目经验逐条拆解。 第一条:持有品牌当期盖章一级…

作者头像 李华
网站建设 2026/8/15 22:57:27

ARM Cortex-A/R/M内核深度解析:从架构差异到实战选型指南

1. 项目概述:为什么需要区分Cortex-A、R、M?如果你刚开始接触嵌入式或者物联网开发,面对琳琅满目的芯片型号,比如STM32F103、i.MX6ULL、Raspberry Pi的BCM2711,可能会感到一头雾水。它们都基于ARM架构,但性…

作者头像 李华