news 2026/10/6 8:05:01

HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit/叠层/封装如何推动,相比 NVLink 与 PCIe 强在哪

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit/叠层/封装如何推动,相比 NVLink 与 PCIe 强在哪

HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit / 叠层 / 封装如何推动,相比 NVLink 与 PCIe 强在哪

声明:本文作为笔者个人备忘的文章,不喜勿喷。本文由AI辅助生成,技术参数与市场信息整理自公开资料,仅供参考。


〇、一句话结论

HBM(High Bandwidth Memory,高带宽内存)是为了打穿大模型的"内存墙"而诞生的 3D 堆叠内存。它不像 GDDR/DDR 那样靠"加引脚、提速率"平面扩展,而是把几十颗 DRAM用 TSV(硅通孔)垂直堆叠 + 2.5D 封装(CoWoS/EMIB 中介层)贴在 GPU 旁边,通过 1024→2048-bit 超宽并行接口换取超高带宽。一句话:HBM 用"堆得高 + 离得近 + 接口宽"换取"带宽快"。


一、HBM 完整演进史(从 2011 到 2027)

代际时间/首发每 die 接口宽度引脚速率单堆栈带宽单堆栈容量关键工艺
HMC/原型20111024-bit———TSV 堆叠内存业界首次提出
HBM12015(AMD Fiji)1024-bit~1Gbps~128GB/s4/8GB2.5D 中介层 + TSV + 微凸点
HBM22016(V100)1024-bit2.4Gbps256GB/s8/16GB微凸点成熟
HBM2E20191024-bit3.2-3.6Gbps~460GB/s8/24GB堆叠层数提升
HBM32022(H100)1024-bit6.4-7.2Gbps~717GB/s16/24GB8/12-Hi 大规模堆叠
HBM3E2023(H200/B200)1024-bit8-9.6Gbps~1.0-1.2TB/s24/36GB12-Hi 量产
HBM42025 标准/2026 量产2048-bit(翻倍)10-11Gbps~2.8-3.3TB/s36GB 12-Hi/48GB 16-Hi接口翻倍 + 可定制 base die
HBM4E2027 放量2048-bit11Gbps+3.5TB/s+48GB+ 16-Hi/24Hi混合键合 + 3D 封装推进

数据依据(SK海力士/Hot Chips 2026):单堆栈带宽 HBM2E≈460GB/s → HBM3≈717GB/s → HBM3E≈1024GB/s →HBM4≈2048GB/s(代际约翻倍);2025年 JEDEC 正式将 HBM4 接口 I/O 从 1024 位翻倍至 2048 位。


二、为什么是 40 / 80 / 96 / 141 / 288 / 576GB?(容量背后的算术)

2.1 容量公式

单颗 GPU 的 HBM 总容量 = 每 die 容量(bit) × 堆叠层数(Hi) × 堆叠数量(Stack)

决定容量的是三个整数变量:die 密度(先进制程决定)、叠几层(封装决定)、放几堆栈(封装面积/GPU 设计决定)。所以容量一定是"几的倍数",看起来像"怪数"。

2.2 典型值拆解

典型容量代表 GPU推算逻辑(口径各异,供参考)
40GBA100 (40GB 版)早期 HBM2e 中容量配置
80GBA100-80G / H10016GB/栈×5 栈 etc.(同代最大通用配置)
96GBHBM3 世代中/高配置24GB/栈×4 栈
141GBH200(HBM3E)8 颗高密度栈的非整数合
192GBB200(HBM3E)24GB/栈 × 8 栈 = 192GB
288GBB300 / Vera Rubin(HBM4)36GB/栈(Rubin) 或 大密度栈 ×8
576GBRubin Ultra V300(HBM4E)48GB+/栈 × 高栈数,Ultra 翻倍

结论:所谓"怪数"并非随机,而是die 密度 × 堆叠层数 × 堆栈数的组合结果;每一代通过提高 die 密度、加高堆叠、增加堆栈来推动容量翻倍。

2.3 背后的三大演进驱动力

  1. 带宽 bit(接口宽度):HBM1→HBM3E 一直 1024-bit/die,靠提高速率(1→9.6Gbps)提带宽;HBM4 接口翻倍到 2048-bit,一次提升 2 倍带宽——这是带宽跃迁的关键结构性变化。
  2. 叠层变化:从 4-Hi → 8-Hi → 12-Hi → 16-Hi(→24-Hi),叠得越高容量越大、但散热和良率越难。
  3. 封装变化:微凸点(micro-bump)→混合键合(hybrid bonding)(取消焊点、铜对铜直连,密度/带宽更高、电容更低);2.5D CoWoS 整片中继层 →EMIB 嵌入式硅桥(SK海力士联手英特尔,只在互连处用高密度布线,降成本;也为 HBM4E/3D 封装铺路)。

三、HBM 如何与 GPU/CPU 通信?走什么协议?

3.1 物理连接(关键:离得极近)

  • HBM 与 GPU 靠2.5D 封装放在同一硅中介层(CoWoS)上(或 EMIB 硅桥连接);
  • 每颗 HBM 通过PHY 物理层连接 GPU:1024 个 I/O、16 个伪通道(HBM3);HBM4 扩展到2048 个 I/O;
  • 走线长度仅毫米级,信号电容/电感低——这是高带宽能跑起来的物理基础。

3.2 协议

  • HBM 使用专有内存接口协议(DDR 的伪通道变体),栈内通过TSV 垂直互连;
  • 是内存协议,不是像 NVLink 那样的对等互联协议,也不是 PCIe 那样的通用外设协议。

3.3 三种高速互联定位对比

维度HBM(内存)NVLink(GPU全互联)PCIe(通用I/O)
本质靠近计算的堆叠内存GPU-GPU 直接互联通用外设/扩展总线
距离毫米级(封装内)同机/机柜(铜缆/光)板卡级
接口1024-2048 bit 并行高速串行链路PCIe 串行 lane
延迟极低(紧贴)低高(需 CPU/协议中转)
每卡带宽(参考)A100 2TB/s / H100 3.35TB/s600GB/s / 900GB/s64 / 128GB/s(双向)
容量有限(40-576GB)~(用于互联)—
定位解决"带宽墙"解决"卡间协同"通用连接

3.4 为什么 HBM 能这么快(快的内因)

  1. 超宽并行接口:1024→2048-bit 同时传,等于"上千根"内存线同时工作(对比 DDR 72 pin);
  2. TSV 垂直互连:穿过堆叠的数千条 TSV 提供低电感、超短路径;
  3. 离 GPU 极近:2.5D 封装距离毫米级,信号不必出芯片跨越长 PCB;
  4. 单位带宽功耗低:HBM 比 GDDR 以更优 pJ/bit 实现带宽。

四、为什么有 HBM?怎么想到的?核心解决什么问题?

4.1 痛点:内存墙(Memory Wall)

  • 一个残酷的物理事实:算力每 18 个月翻倍,内存带宽增速仅为算力增速的约 1/3;
  • DDR/GDDR 平面扩展受引脚数、面积、功耗限制,靠加大频率收益递减;
  • LLM 的"三重饥渴":
  • 容量:参数+优化器+梯度,Llama 3.1 405B 在 FP8 下约需400GB;
  • 带宽:自回归生成每生成 1 个 token 要读取整个模型权重;
  • KV Cache:长上下文推理的缓存也吃内存。

4.2 怎么想到的(架构逻辑)

  • 与其"平铺更多引脚",不如垂直堆叠 + 让内存贴近计算: 1. 用TSV把 DRAM 叠成 3D 堆栈(省面积、缩短互连); 2. 用2.5D 封装(CoWoS/EMIB)把堆栈贴到 GPU 身旁; 3. 用1024→2048-bit 超宽接口换取远超平面内存的带宽。

4.3 核心解决

  • 带宽墙:把内存带宽提升到可以喂饱 GPU 算力;
  • 功耗/面积:单位带宽功耗更低、占用基板面积更小(相对 GDDR 大量走线);
  • 算力-内存同步:让 AI 集群吞吐(Throughput)不再"卡在内存"。

五、成本变化(为什么 HBM 这么贵、还涨这么凶)

5.1 单价与占比

  • HBM 单价 ≈DDR5 的 5 倍;
  • HBM 占 DRAM 总产能/产值比:
  • 产能占比:2023 约 2% → 2024 约 5% → 2025 约 10%+;
  • 产值占比:2023 约 8% → 2024 约 21% → 2025 约 30%+;
  • HBM 单机柜价值(摩根士丹利/彭博口径):B200≈15.6 万美元 → Rubin V200≈38.2 万美元 →Rubin Ultra≈153.4 万美元;
  • 这是HBM4/LPDDR5X 涨价致 AI 服务器 2027 涨价超 15%的根源。

5.2 成本构成

  • TSV 工艺约占 HBM 成本30%(深硅刻蚀 + 铜电镀,工序复杂、良率压力大);
  • 加上 减薄(bonding)、微凸点/混合键合、中介层(CoWoS)、基板、测试——HBM 壁垒分散在一条很长的工艺链上,贵是有缘由的。

六、投资视角:行业占比、投资情况与趋势

6.1 市场规模与高增长

指标数据
全球 HBM 市场2023 约 43.56 亿美元 → 2024 约 169.14 亿(+288%) →2026 约 546 亿美元(+58%),占 DRAM 近四成
需求增速2024-2026 CAGR 超 60%;2026-2028 bit 需求 CAGR 约 63%(摩根大通)
远期空间2027-2028 达 1600 亿~2820 亿美元
供需缺口50%-60%;2026-2028 持续短缺(-20%→-16%)
产能结构新增 DRAM 产能 58% 投向 HBM;HBM 占 DRAM 产能 19%→31%

6.2 竞争格局(寡头垄断)

厂商HBM 份额(2026Q2 Counterpoint)动态
SK海力士50%HBM 出货量全球第一、三分之二供应英伟达;与英伟达深度绑定,HBM4 领先
三星32%DRAM 总份额第一(39.4%),2026H2 HBM4 占比升 60%+;扩产至月 25 万片
美光18%反击扩张,四大基地同步扩产、HBM4 已达产,份额追赶
长鑫CXMT(国产)—(DRAM 排第四 9.5%)已具 HBM3 量产能力,上海先进封装厂投资 171 亿

6.3 国产替代与设备机遇

  • 国产替代率预计 2026 突破25%;
  • 长鑫:合肥 2 厂+北京 1 厂月产约 30 万片;上海 2027 投产后总量翻倍;若 2027 出货 300 万颗 24GB 等效 HBM3,可支撑50-75 万颗国产 GPU(寒武纪/海光等);
  • 设备:TSV 成本占比 30%,刻蚀/沉积/键合/减薄设备国产替代空间大;混合键合设备(海外 BESI/ASMPT/K&S/AMAT 等领先);
  • 2024 年 12 月美国 BIS 将 HBM 纳入严格管控,倒逼国产加速。

6.4 相关标的(公开资料列示,非荐股)

  • 海外:SK海力士、三星、美光;
  • 国产存储:长鑫(未上市)、北京君正、江波龙、佰维;
  • 封测/模组:太极实业(海力士封测)、香农芯创(海力士代理)、深科技;
  • 材料/设备:雅克科技(前驱体)、联瑞新材、华海诚科、德邦科技;盛美上海、中微公司、拓荆科技、北方华创、芯源微、华卓精科。

七、当前主要优劣(HBM 技术本身)

优点

  1. 带宽极高(A100 2TB/s → Rubin 22TB/s/卡),专治内存墙;
  2. 单位带宽功耗低(能效 pJ/bit 优);
  3. 封装紧凑、节省基板面积。

缺点

  1. 容量小 + 成本极高(DDR5 五倍、工艺链复杂、TSV 占 30%);
  2. 散热难:十几层 DRAM 叠成"被子",紧贴高功耗 GPU,刷新功耗与可靠性受温度威胁;
  3. 良率/供应受限:微凸点→混合键合对平整度/洁净度要求极高;全球被三家垄断、BIS 管控;
  4. 供给缺口大(50-60%),是当前 AI 基建的核心卡点。

八、小结

  • HBM是打穿"内存墙"的 3D 堆叠内存:TSV 垂直堆叠 + 2.5D 封装贴着 GPU + 1024→2048-bit 超宽接口;
  • 典型容量值是 die 密度 × 堆叠层数 × 堆栈数的整数组合(40/80/96/141/192/288/576GB);
  • 演进驱动力:接口 bit 翻倍(HBM4)、叠层加高(4→16+Hi)、封装升级(TSV+微凸点→混合键合/EMIB);
  • 与 GPU 通信走专有内存协议 + PHY(1024/2048 I/O)+ 毫米级中介层;相比 NVLink/PCIe,带宽更高、延迟更低,但它解决的是"带宽墙"而非"卡间协同";
  • 投资主线:HBM 高景气(546 亿美元+、CAGR 60%+)、供需缺口 50-60%、三巨头垄断、美国 BIS 管控倒逼国产替代(长鑫)、TSV/混合键合设备国产化。

附:参考来源(公开资料整理)

  • SK海力士 / Hot Chips 2026(HBM2E 460→HBM3 717→HBM3E 1024→HBM4 2048GB/s、工艺链、散热、堆叠层数)
  • 美光(HBM4:2048-bit 接口、>11Gbps、2.8TB/s/栈、36GB 12-Hi/48GB 16-Hi、时间线 2011-2027)
  • 与非网/CSDN(HBM 架构、TSV 工艺、带宽公式、成本测算、GB200 NVL72 报价)
  • 移动通信网/CSDN(SK海力士联手英特尔 EMIB、HBM4 2048GB/s、16-Hi、IO 位宽翻倍、容量公式)
  • 电子发烧友(HBM4 放量、KV Cache、单堆栈 36→48GB、CoWoS 缺口、三条国产 HBM 路线)
  • 中证网/腾讯(HBM 2026 546 亿美元+58%、产能缺口 50-60%、DRAM 涨价、摩根大通供需)
  • 观点网/中证(摩根大通 2027-2028 1600-2820 亿美元、新增产能 58% 投 HBM、规格误读)
  • 国海证券/三个皮匠(2024 全球 HBM 169 亿美元+288%、三巨头垄断、TSV 成本 30%、设备国产化)
  • 腾讯/搜狐(Q2 DRAM 份额 三星 39.4%/海力士 24.9%/美光 23.3%/长鑫 9.5%;HBM 份额海力士 50%/三星 32%/美光 18%;美光扩产)
  • 东方财富/新浪(国产 HBM:长鑫产能、武汉新芯、171 亿先进封装厂、国产替代率 25%、50-75 万国产 GPU)

笔者按:本文为个人备忘与学习笔记,结合小红书、同花顺问财、慧博研报与公开资料,讲清 HBM 的演进史、带宽/叠层/封装的迭代驱动力、典型容量的由来、与 NVLink/PCIe 的定位差异及投资机会。因厂商口径差异,具体容量值以官方规格为准;存储市场数据以机构最新研报为准,文中公司均为公开资料列示,不构成投资建议。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/6 8:02:04

qq游戏模拟器哪个好 qq游戏模拟器游玩教程

QQ游戏大厅里的手游品类越来越丰富,从棋牌到卡牌再到音舞类都有覆盖。不少玩家想在电脑上玩QQ旗下的手游,却又担心模拟器的兼容性。QQ游戏生态适配到位的qq游戏模拟器成了不少玩家的刚需。一款好用的qq游戏模拟器不光要能流畅运行游戏,还得保…

作者头像 李华
网站建设 2026/10/6 8:02:03

MCP知识梳理(1)

作者:没有四次元口袋的蓝胖 日期:2026-10-05 标签:MCP协议, AI工具MCP协议基础 2024年底Anthropic开源了MCP(Model Context Protocol),短短一年多就成了AI工具生态的事实标准。Claude Desktop、Cursor、VS …

作者头像 李华
网站建设 2026/10/6 8:01:38

高频必考!N皇后:两个常数搞定二维棋盘,n=8为什么恰好92个解?

我们在一维数组上玩回溯——子集、组合、全排列。今天第一次登上二维棋盘:N皇后。 它难不在代码(核心只有20行),而在两件事: 怎么把二维搜索降到一维——88棋盘有64个格子,朴素枚举是C(64,8) ≈ 44亿种&…

作者头像 李华
网站建设 2026/10/6 8:01:36

Redis命令:HSCAN

Redis HSCAN 命令详细教程 HSCAN 以增量游标方式遍历 Hash 的字段与值,是遍历大 Hash 的标准手段。它每次调用只返回一部分数据,不会像 HGETALL 那样一次性阻塞服务端。 资料合集:https://pan.quark.cn/s/10e98d308913、https://pan.quark.…

作者头像 李华
网站建设 2026/10/6 8:00:20

GEO 优化是什么?它和 SEO 到底有什么区别

GEO(Generative Engine Optimization,生成式引擎优化)指的是让你的内容被豆包、DeepSeek、元宝、Kimi 这类 AI 引擎在生成答案时抓取并引用;它和 SEO 最大的区别是:SEO 争的是搜索结果页上的排名位置,GEO 争…

作者头像 李华