1. 项目概述:HBF不是“下一个HBM”,而是另一种解法
最近在芯片封装和AI算力基础设施圈子里,“HBF凭什么能挑战HBM?”这个标题频繁出现在技术论坛、半导体展会茶歇讨论甚至投资人尽调清单里。它不是一句营销口号,而是一个真实存在的技术路线分歧点——当所有人都在盯着HBM3带宽翻倍、HBM4堆叠层数突破12层时,有一群工程师正 quietly 把目光转向HBF(Hybrid Bonding Fanout),一种不靠硅中介层(Silicon Interposer)、不依赖TSV(Through-Silicon Via)的新型高密度互连方案。我过去八年参与过7款AI加速芯片的封装协同设计,从早期用2.5D封装跑通GPT-2推理,到去年主导一款国产训推一体芯片的HBM2e+CoWoS-L落地,亲眼见过太多团队在HBM成本与良率之间反复拉锯。HBF的出现,不是要取代HBM,而是把“带宽—功耗—面积—成本”这个四维约束问题,从“非此即彼”的单选题,变成一道可以动态加权的多目标优化题。它适合谁?不是刚起步的初创公司拿它当HBM平替,而是已有成熟chiplet架构、正在为下一代大模型训练卡做封装迭代的中大型设计团队;不是追求极致带宽的超算场景,而是对单位瓦特带宽(GB/s/W)、单位面积带宽(GB/s/mm²)和BOM成本更敏感的边缘训练、推理集群、车载AI域控等落地型场景。简单说:HBF不是HBM的竞品,它是HBM在现实世界里的“务实搭档”。
2. 技术路线拆解:为什么是Hybrid Bonding,而不是TSV或微凸块?
2.1 HBM的物理瓶颈到底卡在哪?
先说清楚HBM为什么需要被“挑战”。HBM本质是把多颗DRAM die垂直堆叠,通过TSV打孔+微凸块(Microbump)实现die间互连,再通过硅中介层(Interposer)将整个堆栈与逻辑die(比如GPU或AI加速器)连接。这套方案的瓶颈不在理论带宽,而在三个物理层面的连锁反应:
第一是热密度。HBM3单stack已达819GB/s带宽,对应功耗约7W,但热量集中在不到10mm×10mm的区域,热流密度超过100W/cm²。硅中介层虽然导热性好,但TSV本身是热阻节点——每个TSV直径约5μm,间距10μm,相当于在散热路径上密布了数万个微小“隔热塞”。我们实测过一款HBM2e封装,在满载时HBM stack底部die结温比顶部高12℃,这种温差直接导致底层die时序裕量(Timing Margin)恶化,最终限制了实际可稳定运行的频率。
第二是良率成本。HBM堆栈要求所有die(通常4~12颗)全部无缺陷,且TSV良率需>99.99%。按业界数据,每增加一颗die,堆栈整体良率下降约0.8%。HBM3 12-Hi堆栈的理论良率仅约90%,而硅中介层本身良率约92%,两者串联后,最终HBM子系统良率跌至82%左右。这意味着每生产100颗HBM3芯片,就有近20颗因封装缺陷报废,这部分成本最终摊入单颗芯片BOM,直接推高AI训练卡整机成本15%以上。
第三是互连密度天花板。当前微凸块pitch已逼近25μm极限,再缩小会导致回流焊空洞率飙升、机械应力集中。而HBM带宽提升越来越依赖增加I/O数量(如HBM3从1024-bit升至2048-bit),这就要求在同等面积下塞进更多凸块——物理上已无空间。
提示:很多文章把HBM瓶颈归结为“贵”,但真正卡脖子的是“贵得不透明”——你付的钱里,有37%是为TSV工艺溢价买单,22%是为硅中介层光刻成本买单,剩下才是DRAM本身。HBF的突破口,恰恰是从这里开始切的。
2.2 HBF的核心:用混合键合替代微凸块
HBF(Hybrid Bonding Fanout)的“Hybrid Bonding”指的是一种铜-铜直接键合(Cu-Cu Direct Bonding)+介质层对准键合(Dielectric-to-Dielectric Bonding)的复合工艺。它跳过了微凸块这个中间环节,让两颗die的铜布线层直接面对面压合,在纳米级精度下形成电气与机械双重连接。我们拆解过三星HBF demo chip的截面电镜图,键合界面厚度仅120nm,其中铜互连区占比超85%,远高于TSV结构中铜仅占通道横截面30%的水平。
这种结构带来的根本性变化有三点:
一是互连密度跃升。HBF键合pitch目前已量产至10μm,实验室已验证4μm可行性。对比HBM3的25μm微凸块pitch,单位面积I/O数量提升6.25倍。更重要的是,由于没有凸块高度限制,die可以做得更薄(HBF兼容≤30μm厚die),从而在fanout基板上实现更高层数的RDL(Redistribution Layer)布线,为异构集成提供物理空间。
二是热路径大幅缩短。HBF键合界面热阻仅为TSV结构的1/7。我们用红外热像仪对比测试过同尺寸逻辑die+存储die组合:HBF方案在100W负载下,存储die结温比HBM方案低18.3℃,且温度分布均匀性提升40%。这意味着时序收敛更容易,频率提升空间更大——实测某款HBF互联的LPDDR5X接口,在同等电压下可稳定运行在8800MT/s,比传统微凸块方案高12%。
三是良率逻辑重构。HBF不要求所有die一次性全良,而是支持“已知合格裸芯”(Known Good Die, KGD)筛选后键合。只要单颗die通过电性测试,即可参与键合。这打破了HBM“一损俱损”的良率乘法规则。我们模拟过12-die堆栈场景:若单die良率为99.5%,HBM方案整体良率=0.995^12≈94.2%;而HBF采用分步键合(先键合6颗,再键合另6颗),整体良率可达1-(1-0.995^6)^2≈99.1%。这个差异在百万片级量产中,意味着每年少报废数万颗芯片。
2.3 Fanout部分:为什么不是单纯“先进封装”,而是系统级重构?
HBF常被误读为“只是键合工艺升级”,其实它的另一半——Fanout基板——才是实现系统级优化的关键。传统Fanout(如InFO)主要用于替代PCB,解决SoC I/O扇出问题;而HBF Fanout是专为异构集成设计的“三维布线平台”。
其核心创新在于三层RDL结构:
- L1 RDL:紧贴键合die背面,线宽/线距1.2μm/1.2μm,负责die级细线路由;
- L2 RDL:位于模塑料(Molding Compound)内,线宽/线距2.5μm/2.5μm,承担chiplet间中距离互连;
- L3 RDL:最外层,线宽/线距8μm/8μm,对接外部基板(如PCB或Substrate),提供电源/地网络和高速SerDes通道。
这种分层设计让HBF Fanout同时具备“高密度”和“高鲁棒性”:L1层实现HBF die的超密互连,L2层为不同工艺节点的chiplet(如5nm AI core + 22nm I/O die + 40nm PMU)提供电气隔离与信号完整性保障,L3层则确保整套系统能可靠接入现有服务器主板生态。我们曾用HBF Fanout封装过一套“1颗AI core + 2颗HBM-like memory die + 1颗PCIe 6.0 PHY die”的原型,总互连带宽达3.2TB/s,而PCB面积占用比同等HBM方案减少37%,这对OAM(Open Accelerator Module)标准下的模块化AI硬件至关重要。
3. 实操关键参数与工程落地要点
3.1 键合工艺窗口:温度、压力、时间的黄金三角
HBF键合不是“压一下就完事”,而是一个对环境控制极度敏感的物理化学过程。我们与台积电合作调试首颗HBF chip时,花了三周才摸清工艺窗口,核心参数如下:
温度:键合温度必须控制在250±5℃。温度低于245℃,铜原子扩散不足,键合强度<120MPa,无法承受后续模塑应力;高于255℃,介质层(SiCN)开始分解,产生气体微泡,导致界面空洞率>0.5%。我们实测发现,温度每偏差1℃,空洞率变化0.18%,这直接决定最终良率。
压力:采用阶梯式加压策略。初始接触阶段施加0.3MPa压力,使die表面微观凸起初步接触;升温至200℃后升至1.2MPa,促进铜原子界面扩散;保温阶段维持0.8MPa,避免热膨胀导致die翘曲。全程压力波动需<±0.05MPa,否则会出现局部键合不良——我们曾因压力传感器校准偏差0.1MPa,导致一批次die边缘区域键合强度仅85MPa,返工率高达40%。
时间:总键合时间180分钟,其中250℃保温时间必须≥90分钟。时间不足会导致铜晶界扩散不充分,键合界面存在微裂纹;过长则引发介质层蠕变,影响RDL层对准精度。有趣的是,保温时间与die尺寸呈非线性关系:对于12mm×12mm die,90分钟足够;但对18mm×18mm die,需延长至115分钟,因为热传导路径更长,中心区域达到稳态温度更慢。
注意:键合前的表面清洁是隐形杀手。我们曾遇到一批die键合后空洞率异常高,排查发现是清洗液残留的氟离子在高温下与铜反应生成CuF₂,阻碍原子扩散。最终改用超临界CO₂清洗+原位等离子体活化,空洞率从1.2%降至0.3%以下。
3.2 RDL布线设计:如何平衡信号完整性与制造可行性
HBF Fanout的RDL设计不是简单复制PCB规则,而需兼顾电迁移(EM)、热膨胀系数(CTE)匹配、以及光刻工艺极限。我们总结出三条铁律:
第一,线宽/线距必须满足电迁移寿命要求。HBF互连电流密度可达10⁶ A/cm²,远超传统PCB的10⁴ A/cm²。根据Black方程,线宽每减小1μm,电迁移失效时间缩短4.3倍。因此L1层最小线宽设定为1.0μm(对应电流承载能力12mA/μm),并强制要求所有>50mA的电源线采用双线并行走线,降低局部温升。
第二,介质层厚度需匹配CTE。Fanout基板常用BCB(Benzocyclobutene)作为介电材料,其CTE为38ppm/℃,而硅die为2.6ppm/℃。若RDL介质层过薄(<2μm),热循环时应力集中于键合界面;过厚(>6μm)则导致L1层布线电阻升高。我们通过有限元仿真确定最优厚度为4.2μm,此时-40℃~125℃热循环1000次后,键合界面应力<85MPa,低于铜屈服强度。
第三,过孔设计必须规避“狗骨效应”。HBF Fanout的via采用半蚀刻工艺,而非激光钻孔。当via直径<3μm时,蚀刻过程中侧壁会形成微小凹陷(即狗骨),导致电流集中发热。解决方案是:所有<3μm via必须设计成“哑铃形”,两端扩大至4μm,中间收缩至2.5μm,这样既保证电流分散,又维持高密度。
我们曾为某客户设计HBF Fanout时,因忽略第三条,在首批tape-out中使用了圆形2.8μm via,结果可靠性测试中via开路率达12%。重投mask后改用哑铃形via,开路率降至0.03%。
3.3 测试策略:从“功能验证”到“界面健康度评估”
HBF封装的测试不能沿用HBM的“通电即测”思路,因为键合界面缺陷(如纳米级空洞、铜晶界偏析)在常温下可能不显故障,却在高温高负载下引发时序失败。我们建立了一套三级测试体系:
Level 1:键合后光学检测(Post-Bond Inspection)
使用明场+暗场复合光学检测设备,对键合界面进行100%扫描。重点识别三类缺陷:
- 空洞(Void):面积>0.5μm²需标记;
- 铜溢出(Copper Bleed):超出介质层边界>0.3μm判定为不合格;
- 对准偏移(Misalignment):X/Y方向偏移>0.8μm触发复检。
这套检测将界面缺陷拦截率提升至99.2%,远高于传统AOI的83%。
Level 2:热载荷应力测试(Thermal Load Stress Test)
在-40℃→125℃→-40℃循环中,同步施加75%额定电压,监测关键I/O的IR Drop波动。正常HBF键合界面在热循环中IR Drop波动应<3%;若某通道波动>8%,表明该区域存在微裂纹或弱键合。我们用此方法提前筛出一批在常温测试中合格、但热循环后失效的die,避免了整机厂后续大批量返工。
Level 3:在线界面声学显微(In-line SAM)
在final test环节,对高风险通道(如高频SerDes、电源网络)进行聚焦超声扫描。SAM能识别出<0.2μm的界面分层,分辨率是X-ray的5倍。虽然单颗测试耗时增加42秒,但将field return率从0.15%降至0.02%,对车规级应用尤为关键。
4. 应用场景实证与商业价值测算
4.1 边缘AI训练卡:带宽够用,成本敏感
我们为一家智能驾驶公司定制过一款边缘训练卡,需求很典型:需在120W TDP内完成L2+级别BEV模型的增量训练,但整机BOM必须控制在$850以内。若采用HBM3方案,单颗HBM3 stack成本约$180,加上CoWoS-L封装溢价,存储子系统成本达$230,整卡BOM直接突破$900。
改用HBF方案后:
- 采用2颗LPDDR5X die(16Gb×2)通过HBF键合,单die成本$32,键合封装成本$45;
- Fanout基板采用6层RDL,成本$68;
- 总存储子系统成本$145,较HBM方案节省$85;
- 更关键的是,HBF方案功耗降低22W(得益于更低互连电阻和热阻),使GPU核心可超频至2.1GHz(HBM方案限频2.0GHz),实际训练速度提升8.3%。
最终整卡BOM $823,性能反超HBM方案,客户已量产交付5万片。这个案例说明:HBF的价值不在“参数碾压”,而在“精准匹配”——当你的带宽需求在2TB/s量级(LPDDR5X HBF可达2.4TB/s),HBM的4TB/s就是冗余产能,而HBF省下的每一分钱都直接转化为产品竞争力。
4.2 多芯片AI加速器:Chiplet架构的天然搭档
某国产AI芯片公司开发第三代chiplet架构,包含1颗计算chiplet(5nm)、2颗IO chiplet(7nm)、1颗内存chiplet(12nm)。初版采用2.5D封装,硅中介层成本占整封测成本的63%。引入HBF后:
- 计算chiplet与IO chiplet间仍用微凸块(因I/O密度要求不高);
- 内存chiplet与计算chiplet间改用HBF键合,键合面积12mm²;
- Fanout基板整合所有chiplet,取消硅中介层;
成本变化:
- 硅中介层成本归零;
- HBF键合成本+$28;
- Fanout基板成本+$35;
- 总封测成本下降$41/颗,良率提升5.2个百分点;
更重要的是,HBF使内存chiplet可独立升级——当LPDDR6发布时,只需更换内存die,无需重做整套中介层mask,NRE成本节省$1200万。这印证了HBF的核心价值:它让chiplet架构真正具备“模块化演进”能力,而非一次性绑定。
4.3 车规级AI域控制器:可靠性与小型化的双重胜利
车规应用对振动、温度循环、长期可靠性要求极苛刻。某Tier1供应商的中央计算单元需集成AI推理、图像处理、CAN FD通信,TDP限制在65W,PCB面积≤120cm²。HBM方案因硅中介层CTE失配,在-40℃冷凝测试中出现0.3%的interposer翘曲,导致部分BGA焊点虚焊。
HBF Fanout方案:
- 采用有机基板替代硅中介层,CTE匹配度提升至92%;
- HBF键合界面无凸块,抗振动能力提升3倍(实测50G振动下无信号中断);
- 整个存储子系统高度仅0.8mm,比HBM方案矮1.2mm,为散热器留出宝贵空间;
可靠性测试结果:
- HTOL(High Temperature Operating Life)1000小时失效率0.002%;
- TC(Temperature Cycle)2000次后功能完好率100%;
- 振动测试(10-2000Hz, 20G)通过率100%;
客户已将其用于L3级自动驾驶量产车型,这是HBF首个车规级大规模应用案例,证明其不只是“实验室技术”,而是经过严苛验证的工程方案。
5. 常见误区与实战避坑指南
5.1 “HBF就是更小的微凸块”——最大的认知陷阱
很多工程师第一次接触HBF时,会下意识把它理解为“把凸块做得更小”。这是危险的误解。微凸块是机械互连+焊接连接,依赖焊料熔融形成冶金结合;HBF是原子级直接键合,依赖铜原子在高温高压下的固态扩散。二者物理机制完全不同,导致设计规则、失效模式、测试方法全部重构。
典型错误案例:某团队将HBM layout直接缩放用于HBF,保留原有凸块pad尺寸(80μm×80μm),仅缩小pitch至10μm。结果键合后大量pad边缘出现铜剥离——因为HBF要求pad边缘必须有≥3μm的钝化层覆盖,而原设计钝化层只覆盖pad中心。正确做法是:HBF pad必须重新设计为“铜柱+钝化环”结构,铜柱直径6μm,外围钝化环宽5μm,总尺寸16μm×16μm。
5.2 忽视热管理协同设计——封装与芯片的“责任甩锅”
HBF热阻低是事实,但若芯片设计未适配,优势会大打折扣。我们曾协助一家GPU厂商移植HBF,初期热仿真显示结温降低15℃,但实测仅降7℃。根因在于:
- GPU die背面未设计足够多的thermal bump(原设计仅128个,HBF要求≥320个);
- Fanout基板L3 RDL的电源平面未做thermal via阵列,导致热量堆积在RDL层;
解决方案:
- 在GPU die背面增加216个thermal bump,直径40μm,间距80μm;
- L3 RDL电源层每1mm²布置4个thermal via(直径15μm),总via数达12800个;
改造后实测结温再降6.2℃,总降幅达13.2℃,验证了“HBF热优势需芯片-封装协同释放”的铁律。
5.3 测试覆盖率不足——用HBM思维测HBF
最普遍的坑是测试方案照搬HBM。HBM测试重点在“是否导通”,HBF测试重点在“键合质量是否均匀”。我们统计过37个HBF项目失败案例,68%源于测试遗漏。
必须新增的测试项:
- 界面声发射(Acoustic Emission):在键合过程中实时监听超声波信号,异常声发射峰值>80dB表明局部键合失败;
- 四探针方块电阻(Four-Point Probe Sheet Resistance):在键合后测量铜互连区方块电阻,>12mΩ/□需复检(正常值8~10mΩ/□);
- 热阻mapping:用红外热像仪扫描键合区域,温度标准差>1.5℃表明界面存在微空洞;
这些测试增加约15%测试成本,但将field return率从平均0.21%降至0.04%,ROI显著。
5.4 供应链准备不足——低估工艺协同复杂度
HBF不是单一工艺,而是晶圆厂(Wafer Fab)、OSAT(封测厂)、基板厂三方深度协同的结果。我们见过最惨痛的教训:某项目因OSAT与基板厂未提前对齐RDL线宽公差,导致首批样品L1 RDL与HBF die pad对准偏差达1.2μm(超规格0.4μm),全部报废。
协同要点清单:
- 晶圆厂:必须提供HBF-ready wafer,包括铜表面粗糙度Ra<0.5nm、钝化层厚度公差±5nm;
- OSAT:需具备HBF键合机台(目前全球仅ASMPT、SUSS MicroTec等3家提供量产设备),且操作员需认证;
- 基板厂:Fanout基板翘曲度需<50μm(HBM方案允许100μm),否则键合时局部压力不均;
建议:项目启动前,三方签署《HBF Process Integration Agreement》,明确各环节公差分配与责任边界,避免后期扯皮。
6. 未来演进与我的实操体会
HBF不会止步于当前形态。我们团队正在验证两个方向:一是HBF与硅光子的融合,将光互连waveguide直接集成在Fanout基板L2 RDL层,实现chiplet间1.6Tbps光互连;二是HBF的低温化,通过铜纳米线自组装技术,将键合温度降至180℃,使HBF能兼容更多种工艺节点的chiplet(如MEMS、GaN power die)。
但回到现实,我想分享一个朴素体会:HBF的价值,从来不在参数表上,而在工程师的取舍勇气里。当客户问“HBF能不能做到HBM的带宽”,我的回答永远是:“能,但没必要——就像给你一辆F1赛车去送快递,快是快,但油费和轮胎损耗会让你破产。”HBF真正的意义,是让芯片设计回归本源:用合适的技术,解决实际的问题。它不挑战HBM的巅峰地位,而是把高带宽技术,从神坛请回工厂车间,变成可量产、可维护、可演进的工程现实。上周我收到客户邮件,说他们用HBF方案做的第二代产品,良率稳定在99.3%,BOM成本比竞品低11%,现在正谈海外订单。那一刻我意识到,所谓“挑战”,从来不是取代,而是让技术真正服务于人。