HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit / 叠层 / 封装如何推动,相比 NVLink 与 PCIe 强在哪
声明:本文作为笔者个人备忘的文章,不喜勿喷。本文由AI辅助生成,技术参数与市场信息整理自公开资料,仅供参考。
〇、一句话结论
HBM(High Bandwidth Memory,高带宽内存)是为了打穿大模型的"内存墙"而诞生的 3D 堆叠内存。它不像 GDDR/DDR 那样靠"加引脚、提速率"平面扩展,而是把几十颗 DRAM用 TSV(硅通孔)垂直堆叠 + 2.5D 封装(CoWoS/EMIB 中介层)贴在 GPU 旁边,通过 1024→2048-bit 超宽并行接口换取超高带宽。一句话:HBM 用"堆得高 + 离得近 + 接口宽"换取"带宽快"。
一、HBM 完整演进史(从 2011 到 2027)
| 代际 | 时间/首发 | 每 die 接口宽度 | 引脚速率 | 单堆栈带宽 | 单堆栈容量 | 关键工艺 |
|---|---|---|---|---|---|---|
| HMC/原型 | 2011 | 1024-bit | — | — | — | TSV 堆叠内存业界首次提出 |
| HBM1 | 2015(AMD Fiji) | 1024-bit | ~1Gbps | ~128GB/s | 4/8GB | 2.5D 中介层 + TSV + 微凸点 |
| HBM2 | 2016(V100) | 1024-bit | 2.4Gbps | 256GB/s | 8/16GB | 微凸点成熟 |
| HBM2E | 2019 | 1024-bit | 3.2-3.6Gbps | ~460GB/s | 8/24GB | 堆叠层数提升 |
| HBM3 | 2022(H100) | 1024-bit | 6.4-7.2Gbps | ~717GB/s | 16/24GB | 8/12-Hi 大规模堆叠 |
| HBM3E | 2023(H200/B200) | 1024-bit | 8-9.6Gbps | ~1.0-1.2TB/s | 24/36GB | 12-Hi 量产 |
| HBM4 | 2025 标准/2026 量产 | 2048-bit(翻倍) | 10-11Gbps | ~2.8-3.3TB/s | 36GB 12-Hi/48GB 16-Hi | 接口翻倍 + 可定制 base die |
| HBM4E | 2027 放量 | 2048-bit | 11Gbps+ | 3.5TB/s+ | 48GB+ 16-Hi/24Hi | 混合键合 + 3D 封装推进 |
数据依据(SK海力士/Hot Chips 2026):单堆栈带宽 HBM2E≈460GB/s → HBM3≈717GB/s → HBM3E≈1024GB/s →HBM4≈2048GB/s(代际约翻倍);2025年 JEDEC 正式将 HBM4 接口 I/O 从 1024 位翻倍至 2048 位。
二、为什么是 40 / 80 / 96 / 141 / 288 / 576GB?(容量背后的算术)
2.1 容量公式
单颗 GPU 的 HBM 总容量 = 每 die 容量(bit) × 堆叠层数(Hi) × 堆叠数量(Stack)决定容量的是三个整数变量:die 密度(先进制程决定)、叠几层(封装决定)、放几堆栈(封装面积/GPU 设计决定)。所以容量一定是"几的倍数",看起来像"怪数"。
2.2 典型值拆解
| 典型容量 | 代表 GPU | 推算逻辑(口径各异,供参考) |
|---|---|---|
| 40GB | A100 (40GB 版) | 早期 HBM2e 中容量配置 |
| 80GB | A100-80G / H100 | 16GB/栈×5 栈 etc.(同代最大通用配置) |
| 96GB | HBM3 世代中/高配置 | 24GB/栈×4 栈 |
| 141GB | H200(HBM3E) | 8 颗高密度栈的非整数合 |
| 192GB | B200(HBM3E) | 24GB/栈 × 8 栈 = 192GB |
| 288GB | B300 / Vera Rubin(HBM4) | 36GB/栈(Rubin) 或 大密度栈 ×8 |
| 576GB | Rubin Ultra V300(HBM4E) | 48GB+/栈 × 高栈数,Ultra 翻倍 |
结论:所谓"怪数"并非随机,而是die 密度 × 堆叠层数 × 堆栈数的组合结果;每一代通过提高 die 密度、加高堆叠、增加堆栈来推动容量翻倍。
2.3 背后的三大演进驱动力
- 带宽 bit(接口宽度):HBM1→HBM3E 一直 1024-bit/die,靠提高速率(1→9.6Gbps)提带宽;HBM4 接口翻倍到 2048-bit,一次提升 2 倍带宽——这是带宽跃迁的关键结构性变化。
- 叠层变化:从 4-Hi → 8-Hi → 12-Hi → 16-Hi(→24-Hi),叠得越高容量越大、但散热和良率越难。
- 封装变化:微凸点(micro-bump)→混合键合(hybrid bonding)(取消焊点、铜对铜直连,密度/带宽更高、电容更低);2.5D CoWoS 整片中继层 →EMIB 嵌入式硅桥(SK海力士联手英特尔,只在互连处用高密度布线,降成本;也为 HBM4E/3D 封装铺路)。
三、HBM 如何与 GPU/CPU 通信?走什么协议?
3.1 物理连接(关键:离得极近)
- HBM 与 GPU 靠2.5D 封装放在同一硅中介层(CoWoS)上(或 EMIB 硅桥连接);
- 每颗 HBM 通过PHY 物理层连接 GPU:1024 个 I/O、16 个伪通道(HBM3);HBM4 扩展到2048 个 I/O;
- 走线长度仅毫米级,信号电容/电感低——这是高带宽能跑起来的物理基础。
3.2 协议
- HBM 使用专有内存接口协议(DDR 的伪通道变体),栈内通过TSV 垂直互连;
- 是内存协议,不是像 NVLink 那样的对等互联协议,也不是 PCIe 那样的通用外设协议。
3.3 三种高速互联定位对比
| 维度 | HBM(内存) | NVLink(GPU全互联) | PCIe(通用I/O) |
|---|---|---|---|
| 本质 | 靠近计算的堆叠内存 | GPU-GPU 直接互联 | 通用外设/扩展总线 |
| 距离 | 毫米级(封装内) | 同机/机柜(铜缆/光) | 板卡级 |
| 接口 | 1024-2048 bit 并行 | 高速串行链路 | PCIe 串行 lane |
| 延迟 | 极低(紧贴) | 低 | 高(需 CPU/协议中转) |
| 每卡带宽(参考) | A100 2TB/s / H100 3.35TB/s | 600GB/s / 900GB/s | 64 / 128GB/s(双向) |
| 容量 | 有限(40-576GB) | ~(用于互联) | — |
| 定位 | 解决"带宽墙" | 解决"卡间协同" | 通用连接 |
3.4 为什么 HBM 能这么快(快的内因)
- 超宽并行接口:1024→2048-bit 同时传,等于"上千根"内存线同时工作(对比 DDR 72 pin);
- TSV 垂直互连:穿过堆叠的数千条 TSV 提供低电感、超短路径;
- 离 GPU 极近:2.5D 封装距离毫米级,信号不必出芯片跨越长 PCB;
- 单位带宽功耗低:HBM 比 GDDR 以更优 pJ/bit 实现带宽。
四、为什么有 HBM?怎么想到的?核心解决什么问题?
4.1 痛点:内存墙(Memory Wall)
- 一个残酷的物理事实:算力每 18 个月翻倍,内存带宽增速仅为算力增速的约 1/3;
- DDR/GDDR 平面扩展受引脚数、面积、功耗限制,靠加大频率收益递减;
- LLM 的"三重饥渴":
- 容量:参数+优化器+梯度,Llama 3.1 405B 在 FP8 下约需400GB;
- 带宽:自回归生成每生成 1 个 token 要读取整个模型权重;
- KV Cache:长上下文推理的缓存也吃内存。
4.2 怎么想到的(架构逻辑)
- 与其"平铺更多引脚",不如垂直堆叠 + 让内存贴近计算: 1. 用TSV把 DRAM 叠成 3D 堆栈(省面积、缩短互连); 2. 用2.5D 封装(CoWoS/EMIB)把堆栈贴到 GPU 身旁; 3. 用1024→2048-bit 超宽接口换取远超平面内存的带宽。
4.3 核心解决
- 带宽墙:把内存带宽提升到可以喂饱 GPU 算力;
- 功耗/面积:单位带宽功耗更低、占用基板面积更小(相对 GDDR 大量走线);
- 算力-内存同步:让 AI 集群吞吐(Throughput)不再"卡在内存"。
五、成本变化(为什么 HBM 这么贵、还涨这么凶)
5.1 单价与占比
- HBM 单价 ≈DDR5 的 5 倍;
- HBM 占 DRAM 总产能/产值比:
- 产能占比:2023 约 2% → 2024 约 5% → 2025 约 10%+;
- 产值占比:2023 约 8% → 2024 约 21% → 2025 约 30%+;
- HBM 单机柜价值(摩根士丹利/彭博口径):B200≈15.6 万美元 → Rubin V200≈38.2 万美元 →Rubin Ultra≈153.4 万美元;
- 这是HBM4/LPDDR5X 涨价致 AI 服务器 2027 涨价超 15%的根源。
5.2 成本构成
- TSV 工艺约占 HBM 成本30%(深硅刻蚀 + 铜电镀,工序复杂、良率压力大);
- 加上 减薄(bonding)、微凸点/混合键合、中介层(CoWoS)、基板、测试——HBM 壁垒分散在一条很长的工艺链上,贵是有缘由的。
六、投资视角:行业占比、投资情况与趋势
6.1 市场规模与高增长
| 指标 | 数据 |
|---|---|
| 全球 HBM 市场 | 2023 约 43.56 亿美元 → 2024 约 169.14 亿(+288%) →2026 约 546 亿美元(+58%),占 DRAM 近四成 |
| 需求增速 | 2024-2026 CAGR 超 60%;2026-2028 bit 需求 CAGR 约 63%(摩根大通) |
| 远期空间 | 2027-2028 达 1600 亿~2820 亿美元 |
| 供需缺口 | 50%-60%;2026-2028 持续短缺(-20%→-16%) |
| 产能结构 | 新增 DRAM 产能 58% 投向 HBM;HBM 占 DRAM 产能 19%→31% |
6.2 竞争格局(寡头垄断)
| 厂商 | HBM 份额(2026Q2 Counterpoint) | 动态 |
|---|---|---|
| SK海力士 | 50% | HBM 出货量全球第一、三分之二供应英伟达;与英伟达深度绑定,HBM4 领先 |
| 三星 | 32% | DRAM 总份额第一(39.4%),2026H2 HBM4 占比升 60%+;扩产至月 25 万片 |
| 美光 | 18% | 反击扩张,四大基地同步扩产、HBM4 已达产,份额追赶 |
| 长鑫CXMT(国产) | —(DRAM 排第四 9.5%) | 已具 HBM3 量产能力,上海先进封装厂投资 171 亿 |
6.3 国产替代与设备机遇
- 国产替代率预计 2026 突破25%;
- 长鑫:合肥 2 厂+北京 1 厂月产约 30 万片;上海 2027 投产后总量翻倍;若 2027 出货 300 万颗 24GB 等效 HBM3,可支撑50-75 万颗国产 GPU(寒武纪/海光等);
- 设备:TSV 成本占比 30%,刻蚀/沉积/键合/减薄设备国产替代空间大;混合键合设备(海外 BESI/ASMPT/K&S/AMAT 等领先);
- 2024 年 12 月美国 BIS 将 HBM 纳入严格管控,倒逼国产加速。
6.4 相关标的(公开资料列示,非荐股)
- 海外:SK海力士、三星、美光;
- 国产存储:长鑫(未上市)、北京君正、江波龙、佰维;
- 封测/模组:太极实业(海力士封测)、香农芯创(海力士代理)、深科技;
- 材料/设备:雅克科技(前驱体)、联瑞新材、华海诚科、德邦科技;盛美上海、中微公司、拓荆科技、北方华创、芯源微、华卓精科。
七、当前主要优劣(HBM 技术本身)
优点
- 带宽极高(A100 2TB/s → Rubin 22TB/s/卡),专治内存墙;
- 单位带宽功耗低(能效 pJ/bit 优);
- 封装紧凑、节省基板面积。
缺点
- 容量小 + 成本极高(DDR5 五倍、工艺链复杂、TSV 占 30%);
- 散热难:十几层 DRAM 叠成"被子",紧贴高功耗 GPU,刷新功耗与可靠性受温度威胁;
- 良率/供应受限:微凸点→混合键合对平整度/洁净度要求极高;全球被三家垄断、BIS 管控;
- 供给缺口大(50-60%),是当前 AI 基建的核心卡点。
八、小结
- HBM是打穿"内存墙"的 3D 堆叠内存:TSV 垂直堆叠 + 2.5D 封装贴着 GPU + 1024→2048-bit 超宽接口;
- 典型容量值是 die 密度 × 堆叠层数 × 堆栈数的整数组合(40/80/96/141/192/288/576GB);
- 演进驱动力:接口 bit 翻倍(HBM4)、叠层加高(4→16+Hi)、封装升级(TSV+微凸点→混合键合/EMIB);
- 与 GPU 通信走专有内存协议 + PHY(1024/2048 I/O)+ 毫米级中介层;相比 NVLink/PCIe,带宽更高、延迟更低,但它解决的是"带宽墙"而非"卡间协同";
- 投资主线:HBM 高景气(546 亿美元+、CAGR 60%+)、供需缺口 50-60%、三巨头垄断、美国 BIS 管控倒逼国产替代(长鑫)、TSV/混合键合设备国产化。
附:参考来源(公开资料整理)
- SK海力士 / Hot Chips 2026(HBM2E 460→HBM3 717→HBM3E 1024→HBM4 2048GB/s、工艺链、散热、堆叠层数)
- 美光(HBM4:2048-bit 接口、>11Gbps、2.8TB/s/栈、36GB 12-Hi/48GB 16-Hi、时间线 2011-2027)
- 与非网/CSDN(HBM 架构、TSV 工艺、带宽公式、成本测算、GB200 NVL72 报价)
- 移动通信网/CSDN(SK海力士联手英特尔 EMIB、HBM4 2048GB/s、16-Hi、IO 位宽翻倍、容量公式)
- 电子发烧友(HBM4 放量、KV Cache、单堆栈 36→48GB、CoWoS 缺口、三条国产 HBM 路线)
- 中证网/腾讯(HBM 2026 546 亿美元+58%、产能缺口 50-60%、DRAM 涨价、摩根大通供需)
- 观点网/中证(摩根大通 2027-2028 1600-2820 亿美元、新增产能 58% 投 HBM、规格误读)
- 国海证券/三个皮匠(2024 全球 HBM 169 亿美元+288%、三巨头垄断、TSV 成本 30%、设备国产化)
- 腾讯/搜狐(Q2 DRAM 份额 三星 39.4%/海力士 24.9%/美光 23.3%/长鑫 9.5%;HBM 份额海力士 50%/三星 32%/美光 18%;美光扩产)
- 东方财富/新浪(国产 HBM:长鑫产能、武汉新芯、171 亿先进封装厂、国产替代率 25%、50-75 万国产 GPU)
笔者按:本文为个人备忘与学习笔记,结合小红书、同花顺问财、慧博研报与公开资料,讲清 HBM 的演进史、带宽/叠层/封装的迭代驱动力、典型容量的由来、与 NVLink/PCIe 的定位差异及投资机会。因厂商口径差异,具体容量值以官方规格为准;存储市场数据以机构最新研报为准,文中公司均为公开资料列示,不构成投资建议。