news 2026/10/8 3:59:10

TFLN Chiplet平台推400G每通道PIC,破解AI光互连带宽瓶颈

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
TFLN Chiplet平台推400G每通道PIC,破解AI光互连带宽瓶颈

光学互联这两年是被AI算力硬生生抬到台前的,但真正卡脖子的往往不是光口速率本身,而是调制器能不能在功耗和体积的天花板下顶住带宽需求。HyperLight这次在TFLN Chiplet平台推出每通道400G的PIC,把薄膜铌酸锂(TFLN)、芯粒(Chiplet)、光子集成电路(PIC)三个词绑到了一起,瞄准的是下一代人工智能互连。这事对从事800G、1.6T光模块、光引擎或者AI集群网络架构的人来说,都值得仔细看一眼。

简单来说,这件事解决的是AI集群里“光互连带宽追不上GPU算力扩张”的错配问题。过去多通道并行堆速率的路子还在,但单通道速率上不去,就意味着更多激光器、更多调制器、更多功耗。HyperLight的思路是用TFLN做调制器,以Chiplet形式封装成PIC,把每通道速率推到400G。这篇内容适合光通信工程师、模块厂商产品规划、AI数据中心网络架构师,以及想判断下一代光器件方向的投资和技术决策者阅读。

1. 这项发布究竟做了什么:平台、器件与400G的真实含义

1.1 TFLN是什么,为什么它总被当成“下一代材料”

TFLN是薄膜铌酸锂(Thin-Film Lithium Niobate)的缩写。铌酸锂本身不是什么新鲜材料,体铌酸锂调制器在高端通信里用了很多年,特点是电光系数高、带宽大、 chirp低,100G时代的相干光模块里大量使用。问题在于体材料波导结构尺寸大、半波电压高、难以与激光器或其他有源器件做高密度集成,做成商用模块往往体积可观、成本居高不下。

薄膜化之后,铌酸锂被做成几百纳米厚的单晶薄膜,再通过刻蚀形成脊型波导,光场被限制在亚微米量级的截面里。这样一来,调制效率和集成密度都大幅提升,同时保留了铌酸锂本身的高线性度和超高带宽优势。做调制器的人都知道,材料决定物理天花板,硅光调制器在带宽和线性度上可以做到“够用”,但当每通道速率往200G、400G走的时候,硅的载流子色散效应、EML的啁啾问题都会把做链路预算难度拉高一大截。TFLN属于那种“天生为高频而生”的材料,这也是HyperLight敢在这个时间点把每通道400G推到台前的原因。

1.2 Chiplet在光电子领域不是噱头,是工程现实

Chiplet这个词是从电子芯片封装领域火起来的,意思是把大芯片拆成不同功能的小芯粒,再用先进封装拼成一个系统。在电子领域,它解决的是良率、复用和异构集成问题。HyperLight管自家平台叫TFLN Chiplet,本质上就是把TFLN调制器、无源光路、可能还有激光器、驱动电路等,按芯粒的方式做模块化组合。

这个命名不是蹭热点。光模块由分立器件转向共封装光引擎(CPO,Co-Packaged Optics)后,需要的不再是一整颗完整PIC,而是可以灵活组合的光学子单元。调制器作为一个chiplet出片,再与激光器chiplet、DSP die放进同一封装体,能大幅提升单个PIC的通用性和迭代速度。如果你手头有做光电共封装的背景,应该能理解这种做法的杀伤力:过去换一个调制器方案等于重新流片整个PIC,现在只需要换对应chiplet。

1.3 每通道400G意味着什么

当前主流的AI集群光互连正处在单通道200G向400G迁移的节点。800G DR8模块采用单通道100G PAM4,1.6T DR8则采用单通道200G PAM4,而下一代3.2T模块、或者同等速率下更少通道的方案,大概率需要单通道400G PAM4来实现。换句话讲,单通道400G意味着能用两对光纤干过去需要八对光纤才能干的活,激光器数量、调制器数量、驱动芯片数量、光纤布线密度都会同步下降。

单通道400G对调制器带宽的要求很直接:400G PAM4的符号率大约在106.25 GBd,留给调制器有效带宽的余量非常有限。硅光调制器、EML在这个速率上能工作,但要么需要特别高的驱动电压,要么需要复杂的预加重和均衡来补偿带宽不足,结果都是功耗和DSP复杂度上去了。TFLN调制器在这点上几乎是“降维打击”,实验室里超100GHz带宽和多GHz线性度是常态,所以HyperLight做这个事情在物理层面站得住脚。

2. 为什么偏偏是AI互连,这个时间点的真实推力

2.1 AI训练集群的带宽模型与光互连的供需错配

AI训练集群里的GPU几乎每半年换一代,算力翻倍的同时,卡间通信量也在滚雪球。以大规模Transformer训练为例,张量并行、流水线并行、专家并行这些模式会把“集合通信”彻底变成性能瓶颈。网络侧如果不升级,GPU闲下来等数据的时间占比就会越来越高,单位算力的实际产出反而下降。

光互连在这里承担的,是大规模跨节点通信的主干道。过去两三代网络从100G升到200G再升到400G,主要是靠提升并行通道数,比如DR4、DR8这种4通道或8通道并行方案。但并行通道数不能无限上涨,因为光纤数量、模块功耗和交换机面板空间都有上限。于是行业形成共识:下一阶段必须靠“单通道速率翻倍”来解决问题,这恰恰是400G每通道被热捧的根本原因。

2.2 功耗、密度与成本,三个约束同时收紧

如果把AI集群里的光互连抽象成三个约束条件,功耗、密度和成本几乎同时逼近红线。400G光模块如果只是把两个200G模块拼起来,功耗几乎翻倍,网络成本也成倍上涨,这在万卡集群里是不可接受的。单通道400G方案可以在速率翻倍的情况下不增加模块数量和功耗系数,这是它真正的经济价值。

而在交换机侧,面板速率的总需求可能要达到51.2T甚至102.4T。如果单通道只有200G,那就需要几百条光纤进出一台交换机,光纤管理、风扇空间、故障排查都会变成灾难。每通道400G之后,端口数量与光纤数量可以显著减少,散热和运维压力跟着下降。HyperLight在这个点推400G PIC,匹配的正是这种系统级需求,而不是单纯秀指标。

2.3 光电共封装与超大规模集群的新节奏

AI互连的另一个趋势是CPO,也就是把光引擎往交换芯片封装里挪,缩短电链路、降低功耗。CPO需要紧凑、可灵活扩展的光引擎形态,传统可插拔模块那种独立封装不能满足要求。TFLN Chiplet这类平台天然适配CPO场景:它体积小、功耗低、可以做成die级单元,还能与交换芯片共用先进封装工艺。

超大规模集群对光互连的节奏要求也在改变,过去一个光模块产品生命周期可能五六年,现在AI业务要求一年内完成方案验证到批量部署。拥有标准化chiplet接口、能独立升级调制器能力的平台型方案,在这一轮竞争里会比“出一颗用一颗”的传统模式更有生存力。

3. 技术点拆解:从薄膜材料到PIC成品的几个关键环节

3.1 电光调制的基本盘:为什么铌酸锂带宽天生占优

光模块里的电光调制器,本质上是把电信号“写”到光上。硅光调制器靠自由载流子色散效应改变折射率,速度相对有上限;铌酸锂靠的是线性电光效应(普克尔斯效应),折射率变化对外加电场响应极快,理论上能到几百GHz以上。TFLN继承了这种优势,在薄膜波导结构里实现了接近体材料的高电光系数。

一个关键参数是半波电压(Vπ),也就是让光相位改变π所需施加的电压。Vπ越低,驱动电路需要的电压摆幅越小,功耗越低。TFLN因为光场限制在极小截面中,电场与光场重叠度提高,Vπ可以做到1V级别甚至更低。这是我看到HyperLight发这类PIC时特别关注的一点:在400G PAM4下,驱动器功耗是整个模块功耗的很大一部分,低Vπ直接等于省电。

3.2 从体材料到薄膜:TFLN工艺的核心难点

TFLN材料本身的优势几十年都没变过,真正卡住量产脖子的,是把铌酸锂从“晶体块”变成“高质量薄膜”并完成波导刻蚀。铌酸锂是一种非常稳定的晶体,化学性质不活泼,不容易被常规干法刻蚀刻出陡直光滑的侧壁。早期研究只能靠飞秒激光写波导或质子交换,损耗和模式限制都不理想。

近几年行业内逐步解决了晶圆键合、离子切片和干法刻蚀三条核心工艺链。简单理解就是,先在铌酸锂晶圆里注入离子形成损伤层,再把它键合到带氧化硅缓冲层的硅衬底上,从损伤层处剥离得到亚微米级TFLN,再通过电子束光刻或深紫外光刻与干法刻蚀形成波导。每一步都会影响波导损耗、侧壁粗糙度和片内一致性。HyperLight能做chiplet级PIC,说明这些工艺在良率和重复性上已经达到了可工程化水平。

3.3 “Chiplet化”对集成度与良率的双重影响

芯片制造的基本矛盾是:芯片面积越大,单片上缺陷导致废片的概率越高。TFLN工艺尽管在成熟,但每片晶圆上还是可能分布着局部缺陷。如果把一整颗大PIC作为单一器件,哪怕只有一个调制器坏了,整颗芯片都报废。一个PIC上放多个TFLN调制器芯粒,先单测芯粒再挑选优质颗粒封装,能显著改善良率损失。

从设计角度看,调制器芯粒复用性也很强,同一颗TFLN调制器chiplet可以用于DR4、DR8,甚至不同代际的模块。换句话讲,HyperLight推的不只是调制器芯片,而是定义一套“好用的、可拼装的光学子单元”标准。这对模块厂和系统厂来说,供应链的灵活性大幅提升,不用担心单一方案堵死后续演进路径。

3.4 同一颗PIC里到底装了什么:一种典型的TFLN Chiplet PIC构成

如果拆开看一颗面向每通道400G的TFLN Chiplet PIC,通常会包含这几个主要功能区:

  • 输入端:接收来自外部激光器或集成光源的光,通过模斑转换器完成光纤到波导的耦合。
  • 分光网络:把一路输入光分成多路,或者给多个调制通道送光,常用多模干涉耦合器或级联Y分支。
  • 调制区:TFLN马赫-曾德尔调制器阵列,每个通道一个调制器,负责把PAM4信号加载到光上。
  • 输出端:调制后的光信号耦合回光纤或光波导,再传向后续复用/解复用部分。
  • 监控与校准结构:用来监控光功率、偏置点,保证调制器工作在最佳工作点。

这其中的无源部分可以用氮化硅或铌酸锂本身实现,有源调制区用TFLN chiplet,整个PIC的“功能密度”远高于传统分立方案。做成chiplet后,每一部分都可以单独测试与筛选,组成系统的总良率比单个大芯片高不少。

4. 落到系统层面:评估这类400G PIC时要看什么

4.1 别只看带宽,先把链路预算算清楚

很多工程师拿到调制器PIC第一反应是看带宽、看插损,但真正决定能不能在系统里用的,是完整的光功率预算。调制器插损、分光损耗、光纤耦合损耗、后续复用损耗,每一项都要加进预算表。每通道400G对光信噪比的要求比100G/200G更高,如果插损多了1dB,DSP功耗和误码率都会立刻恶化。

我建议的做法是先找PIC的完整参数表,把每一段的损耗列成表格,不要只看“低插损”宣传。最好拿到同一芯片的批量测试数据,看损耗分布的均值和方差。单颗样片表现优秀没有意义,量产时Cpk(过程能力指数)够不够才是能否用的关键。

4.2 偏置点稳定性和热漂移,是被低估的头号工程问题

TFLN马赫-曾德尔调制器本质上是一台干涉仪,两臂光程差受温度影响会发生慢速漂移。如果没有闭环偏置控制,工作点慢慢飘走,输出光功率和消光比就会劣化,误码率随之升高。HyperLight这类TFLN PIC通常会集成监控光电二极管(MPD)和偏置控制电路接口,但具体实现还要看模块厂商的算法和电路设计。

在现场集成时,要特别注意热源分布。调制器旁边可能紧挨着DSP或者驱动芯片,这些热源的功耗波动会通过基板传到TFLN chiplet,导致偏置点快速变化。如果偏置控制响应带宽不够,高速场景下就会出现偶发误码块。做系统验证时,建议单独做电源切载和温度阶跃测试,观察误码率是否有固定节奏的波动。

4.3 驱动电压与DSP交互,决定实际功耗

调制器标称Vπ只是一个静态值,实际PAM4驱动需要的是在一定带宽下达到所需调制深度的摆幅。如果Vπ低,驱动器的输出摆幅要求就低,驱动功耗和发热都同步下降。400G每通道的系统里,DSP芯片都在追求更低功耗,如果调制器侧能省下几百毫瓦,整个800G模块的散热方案就可能降一个等级。

不过要注意高带宽下的Vπ会有所劣化,厂商给的直流Vπ和射频Vπ往往不同。这里最好实测驱动芯片输出端到调制器输入端的S参数和实际眼图张度,特别是对106.25 GBd这种速率,连接处的反射和损耗都可能让有效驱动电压明显衰减。灵活的链路匹配设计(比如片上终端电阻、封装的低损耗走线)很关键,但也要防止阻抗失配带来的额外功耗。

4.4 从样品到量产:可靠性测试必须提前启动

先进材料和新型PIC最容易栽在可靠性上。铌酸锂调制器本身有成熟应用基础,但薄膜化、刻蚀后的波导侧壁和键合界面会带来新的失效模式。建议在导入早期就做温循试验和带电老化,重点关注波导损耗是否漂移、偏置控制是否正常、光纤耦合点是否出现偏移。

可靠性测试的周期往往比芯片开发还要长,如果等项目快量产再启动,发现问题就很难回头修改设计。我见过一些项目因为材料吸湿或热应力导致耦合偏差,最后不得不重新改封装。早点拿到可靠性数据,哪怕只是初步数据,也能帮你避免后续供应链锁定后才发现致命缺陷。

5. 常见误区与“我以为”的翻车现场

5.1 误区一:TFLN成本高得用不起

这个印象来自体铌酸锂调制器时代的经验,那时候每只调制器都要人工对准光纤,成本高、产量低。薄膜化之后,工艺流程向半导体制造靠拢,晶圆级加工、光刻、自动测试都能复用成熟产线,单位成本结构已经发生了根本变化。

当然,TFLN当下的成本仍然高于硅光,但每通道400G速率下,传统方案要达到同等性能所需的高线性EML、超高速DSP和复杂散热方案,成本也不低。比单器件成本意义不大,要比“达到目标链路性能的整模块成本”。在1.6T DR8这类场景里,TFLN方案的物料清单有可能比传统方案更简洁,整体成本可能更有竞争力。

5.2 误区二:400G每通道没有标准,太超前

2024到2025年,IEEE 802.3df定义了200G每通道的接口,而400G每通道正在进入后续标准讨论框架。一些行业联盟也在推动400G/lane的光接口定义,包括调制格式、FEC余量、链路距离目标。虽然没有完全冻结,但总方向已经清晰。

对于做产品的人来说,标准冻结之前切入不算太早,关键是方案要有前向兼容性。比如,一颗支持400G每通道的PIC也可以降速率当200G用,这样一个设计就能覆盖两代产品。HyperLight在时间点上卡得比较准,正好是1.6T模块开始起量、3.2T预研启动的阶段。

5.3 误区三:Chiplet只是封装层面的营销词

在电子领域,Chiplet是因为先进制程良率问题和设计复用需求才兴起的;在光电子领域,它的价值类似,但表现形式更直接:把PIC从“整块定制”变成“标准积木”。这不仅仅是封装技术,更是产品定义方式的改变。

如果HyperLight的TFLN Chiplet平台能在不同速率、不同通道数产品间复用同一套调制器芯粒,那对客户来说意味着交付周期缩短、供应链风险降低、迭代速度加快。这不是宣传话术能覆盖的,而是实实在在影响研发节奏的商业逻辑。

5.4 翻车现场:光模块侧只看速率不看性能窗口

很多人拿到400G PIC,第一句话是“速率够高吗”,却忽略了器件正常工作需要一个性能窗口。比如,TFLN调制器的偏置点控制窗口、射频输入功率窗口、温度窗口,都有限制。如果不仔细读规格书中关于“推荐工作条件”的部分,直接拉到极限在外场测试,很容易得出“性能不行”的错误结论。

我建议任何新PIC到手,先小范围做参数扫描测试,把误码率随驱动幅度、偏置电压、温度变化的曲线全部描出来,找准中心工作区。这个工作看起来繁琐,但对后续调试和故障定位帮助极大,尤其是当你需要区分“器件问题”还是“周边链路问题”的时候。

6. 做系统集成时我的几条实操建议

如果你所在团队正准备评估TFLN Chiplet方案的400G每通道PIC,我建议从这几个点入手:

第一,先建一个最小链路验证平台,不急着做完整模块。用现成的高速误码仪、驱动器评估板和PIC样品搭一个精简系统,测清楚带宽、眼图和误码率随驱动条件的变化。这样做能帮你把“器件能力”和“系统能力”解耦,避免在后续模块集成里各环节问题纠缠不清。

第二,重视光纤耦合封装设计。TFLN波导模场尺寸与单模光纤不匹配时,耦合损耗会直接吃掉链路余量。如果厂商提供的是带尾纤的封装形式,要重点关注耦合点的长期稳定性,确认是否做了抗应力设计。如果是裸die形式,那封装工艺的积累就至关重要,这部分难度有时比芯片本身还大。

第三,拿量产统计数据进行决策。这里有一份建议评估参数清单,可以作为参考:

评估维度关键参数关注点
带宽电光S21带宽、3dB/6dB点在106.25 GBd下是否留足余量
损耗片上插损、耦合损耗、PIC总损耗计算整链路预算
电压Vπ@DC、射频Vπ评估驱动器功耗与复杂度
线性度无杂散动态范围(SFDR)、三阶截点PAM4信号下线性是否足够
稳定性偏置漂移速率、热时间常数判断偏置控制要求
可靠性温循、湿热老化、带电老化初测评估长期失效风险

更关键的是要看这些参数的批次间波动,比如同批芯片插损差0.5dB和差2dB,对系统校准和测试良率的影响完全不同。这类数据厂商不一定主动提供,但可以要求给几组多片测试数据自己统计分析。

第四,与DSP选型强绑定。400G每通道的调制器最终要与DSP的均衡能力配合工作。如果DSP的均衡算法很强,调制器的一些频响缺陷可以被补偿;反过来,如果DSP功耗预算有限,就需要调制器本身更“干净”。所以不要单独评估PIC,要把“调制器PIC+DSP+驱动器”作为整体做功耗和性能权衡。

最后说到后续扩展,这套TFLN Chiplet平台最合理的演进路径是把激光器也芯粒化,做成完整的光引擎chiplet,进一步降低封装复杂度。当调制器、激光器、探测器都能以标准芯粒形式组合时,光模块厂商的研发模式会从“定制PIC流片”转向“选型组合”,整个供应链速度都会上一个台阶。到那时,AI集群的光互连可能真的不再是瓶颈,而是一块快速迭代的乐高积木。

我个人实操中的体会是,先进光器件导入的最大障碍往往不是技术指标本身,而是团队是否愿意用新思维重做链路预算和工艺验证。TFLN Chiplet这条路能走多远,最终取决于整个产业链能不能把这个平台思维落地成稳定的供应体系,而不只是靠一两颗样片证明可行性。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 3:58:10

储能电池参与一次调频的容量配置技术经济模型与Matlab实现

做电力系统仿真这些年,反复被问到关于储能容量配置的问题。尤其“储能参与一次调频”这个方向,大家都认可技术方向是对的,电池响应快、精度高、双向调节能力强,看到频率偏差就能毫秒级顶上,比起传统火电机的爬坡限制和…

作者头像 李华
网站建设 2026/10/8 3:58:02

费曼学习法+错题闭环:一个月高效备考拿证的核心方法

项目标题: 别再盲目刷题了!我用一套“费曼学习法错题闭环”一个月拿下专业资格证项目正文: 最初我只是想考个证提升竞争力,结果发现传统复习方法根本扛不住遗忘曲线。后来我把“费曼学习法”和“错题闭环管理”结合,用一个多月时间拿下了专业…

作者头像 李华
网站建设 2026/10/8 3:57:18

正弦余弦指引的乌鸦搜索算法SC-CSA:原理、代码与改进效果

最近在做一个多峰函数的优化项目,常规的乌鸦搜索算法(CSA)跑了几轮,发现结果总在差不多的位置卡住。后来我想到把正弦余弦算法(SCA)的振荡机制融进CSA里,用正弦和余弦的周期性波动来引导乌鸦跳出…

作者头像 李华
网站建设 2026/10/8 3:57:06

本地模型Agent实战:从CLI、skills到harness的工程化边界

1. 为什么“本地模型”突然成了绕不开的话题这两年我身边做开发的朋友,聊天内容从“你调哪个API”慢慢变成了“你本地跑什么模型”。这个转变不是跟风,而是被现实逼出来的。一方面,云端模型的调用成本在规模化之后非常可观,尤其是…

作者头像 李华
网站建设 2026/10/8 3:55:58

Python变量赋值:从标签模型到浅拷贝深拷贝陷阱

先抛一个问题:a [1, 2, 3]之后执行b a,然后a.append(4),请问b打印出来是[1, 2, 3]还是[1, 2, 3, 4]?我每次拿这个问题问刚学 Python 的朋友,十有八九会答错,剩下答对的人里,又有大半说不出原理…

作者头像 李华