news 2026/10/6 5:55:38

CPO与LPO如何重构数据中心互连?从架构对比到选型避坑指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CPO与LPO如何重构数据中心互连?从架构对比到选型避坑指南

简介:《CPO热潮下的技术思考》是腾讯胡胜磊撰写的PDF,聚焦数据中心与高性能计算场景的光互连技术,适合光通信、网络架构及数据中心运维人员阅读。资源仅含1个PDF,大小1.49MB,内容紧凑。目前已有164人学习,适合正在关注CPO产业化路径或需要做技术选型评估的读者。文档以“追光者众”梳理CPO从交换设备间连接到芯片封装的演进路径,分析“曲径通幽”的光引擎尺寸、局部大芯片封装、热管理、光纤管理与可靠性挑战。“另辟蹊径”对比VCSEL直驱、LPO线性模块与“one half”架构,给出功耗、成本、复杂度与互通性的量化对比(如功耗从8W到4.5W、BER和延迟变化)。还延伸至双碳绿色数据中心指标、200G/λ测试趋势、全光交换缓解Spine瓶颈,以及机器学习预测光模块激光器故障。整体上,这份资料能帮助读者快速建立从系统级需求到器件级方案的完整认知。

1. CPO为什么突然成为数据中心互连的焦点:从交换设备到封装内芯片

CPO(Co-Packaged Optics,共封装光学)在今年被反复提及,热度甚至盖过了可插拔光模块的常规迭代节奏。核心逻辑并不复杂:当交换芯片容量走到 51.2T、102.4T 的量级,面板空间和功耗预算已经很难让可插拔光模块继续“体面”地活下去,于是把光引擎搬到交换芯片封装内,缩短 SerDes 走线距离,成了业界普遍认可的下一步。这份来自腾讯专家的分享脉络很清晰:CPO 从交换设备之间互联起步,逐渐延伸到封装内的芯片到芯片互联;但产品级批量应用还面临热管理、端面耦合、可制造性和可维护性等一堆工程问题。与此同时,VCSEL 直驱方案和 LPO(线性可插拔光学)也在“另辟蹊径”——它们不换封装,只改电芯片的架构,就拿到了接近 CPO 的功耗收益。这篇文章不是讲 PPT 里的概念图,而是把这几种路线放到同一张比较表上,讲清楚为什么说“one half”折中方案,以及你在选型时真正要卡的参数和会踩的坑。

2. 追光者众:CPO 的两种应用场景与产品化瓶颈

2.1 设备间光互联与芯片间互联:两条路径的演进逻辑

CPO 的第一类场景是设备到设备的互联。交换机的面板光口被取消或大幅缩减,光引擎直接贴在交换芯片封装基板(substrate)边缘,SERDES 走线从“芯片出封装 → PCB 走线 → 连接器 → 光模块 PCB → 光引擎”这条长链路,缩短为“交换芯片 → 封装内走线 → 光引擎”,链路损耗和功耗明显下降。

第二类场景更激进:芯片与芯片之间的光互联,也就是把光 I/O 做进封装内,连接 ASIC、HBM、GPU、FPGA 等不同 die。这本质上是把传统电互连的瓶颈用光来打破,硬件资源池化的前提也在这里——如果 GPU 和 HBM 之间的带宽墙能被光打穿,算力资源就能跨机柜调度。不过这个场景的问题也很明显:封装内光引擎意味着重做整个封装流程,涉及 Interposer、EIC(电 IC)、PIC(光子 IC)、PCB 的联合设计,介入门槛非常高,目前只有少数头部玩家在推进。

工程上要区分这两种场景,因为它们的良率目标和测试策略完全不同。

设备间互联的光引擎坏了,至少还能设计成模块化更换;而封装内光互联一旦出问题,动的是整块基板,维修边界只有一个字:拆。所以从产品化难易度看,第一条路走得更快,第二条路是中长期方向。

2.2 光引擎尺寸、封装热设计与端面耦合:从 Cisco 数据看制造边界

这份资料引用了一张很关键的数据图,对比了 4xOSFP 800G 可插拔模块和 3.2T CPO 光引擎的尺寸。结论是:从 400G 到 800G 再到 3.2T、6.4T,容量在翻倍增长,但光引擎局部尺寸增幅远小于容量增幅——这正是“共封装”的意义所在:把光引擎塞进封装后,容量翻倍不再需要面板面积同步翻倍。

但这也带来一个反直觉的问题:硅面积没有同步变大,功耗密度却上去了。光引擎本身含激光器、调制器驱动、TIA、CDR 等多个发热源,全部集中在一个小封装区域里,散热路径相比可插拔模块反而更难受。可插拔模块至少有完整的散热器和面板风道,而 CPO 光引擎要和交换芯片抢同一块散热空间。

端面耦合是另一个隐藏瓶颈。光引擎边缘耦合要保证激光器到波导的对准精度,封装后的耦合良率直接决定成本。这个问题在实验室做样品不是问题,但在量产线上,基板翘曲、热膨胀、贴片偏移都会让耦合效率波动。可靠性的担忧也集中在“耦合点会不会在长期热循环后慢慢偏移”,一旦偏移,光功率掉下来,链路的预 FEC BER 就会恶化。

2.3 容量翻倍不等于集成度翻倍:PIC 尺寸与工作速率的联动约束

资料里有一条明确的曲线:PIC 尺寸和容量/DIE 的关系。从 400G 到 800G 再到 3.2T、6.4T,PIC 尺寸从 11.8 增长到 22.5,再到按线性外推的 3 倍左右。换句话说,容量增长 8 倍,PIC 尺寸只涨了约 3 倍——好的一面是集成度在提升,坏的一面是单位面积功耗密度、良率压力、封装应力都在同步上升。

这里有一个设计上的联动约束链条:光芯片尺寸决定工作速率的下限,工作速率决定 SerDes 接口速率,而接口速率又反过来影响电芯片的封装复杂度。当前工艺下,光芯片的高速调制器要同时满足带宽、插损和驱动电压,尺寸缩不下来,速率提不上去,那么封装内走线再短也白搭。所以整个 CPO 系统实际上是“光芯片 → 封装 → 电芯片”三者的联合优化,任何一环单独激进都会成为木桶短板。

这也解释了为什么业界一致认为 CPO 产品级批量应用还早:结构创新和封装创新虽然已经跑在前面,但可制造性(能否在产线上稳定量产)、可维护性(坏了能不能修)、光纤管理(光纤怎么在整机柜里走出来不折断)这三个问题没解决,PPT 上的功耗优势就落不了地。

3. 曲径通幽:VCSEL 直驱与 LPO 如何绕开 CPO 的落地难题

3.1 VCSEL based CPO:直驱、Bias-t 与 2~3 pj/bit 的功耗账

如果觉得硅光 CPO 的门槛太高,VCSEL 路线提供了另一种“便宜”的切入方式。VCSEL 的优势是天然支持垂直方向出光,可以做并行光学耦合,不需要端面耦合那种精密对准。最关键的是,VCSEL 可以直接用 SerDes 信号驱动,不需要额外加昂贵的调制器驱动芯片。

资料中提到 IBM 和 HPE 都在推这个方向。具体说,VCSEL based CPO 适合对功耗和成本要求苛刻、连接距离比较短的场景,比如机柜内交换机和服务器之间的互联。它可以用直驱方案,SerDes 出来的信号经过简单的 Bias-t 电路直接给到 VCSEL 激光器,省掉一级驱动芯片。

功耗效率大约在 2~3 pj/bit,相比传统可插拔方案优势明显。VCSEL 激光器的等效阻抗 Rs 约 80 欧姆,和传输线阻抗匹配相对容易;配合 DC-DC 多通道串联 Bias 供电,可以进一步降低电源转换损耗。直驱结构里,DSP 和 DAC 负责信号整形,200G/400G 速率下用 SR4 并行方式,每个通道承担 50G 或 100G 速率。

但 VCSEL 路线的物理边界也很明显:多模光纤的传输距离天花板就在几十米内,出了机柜就玩不转。也就是说,VCSEL CPO 适合“最后一跳”,替代不了硅光方案在长距离互联中的地位。

3.2 LPO 可插拔:去掉 oDSP 后链路余量怎么补

LPO 的思路更“取巧”:不换封装,把光模块里的 oDSP 拿掉,用线性驱动器和线性 TIA 直接把信号从主机 SerDes 传给光芯片。这样做的好处是功耗和成本直接被打下来——DSP 是模块里最耗电最贵的芯片。

代价是链路均衡的重担全部压到主机 SerDes 上。现在的 112G SerDes 一般都带 FFE/DFE/CDR,配合线性的驱动器和 TIA,理论上能在一定链路损耗范围内工作。资料里给的架构是:Host SerDes LR(Long Reach)模式带 FFE/DFE/CDR,经过 CTLE 补偿后驱动 EML 或硅光调制器;接收端 TIA 后面直接接回主机 SerDes 的均衡器。

这里有一个关键认知:LPO 不是简单拆掉 DSP,而是把 DSP 的均衡能力“搬”到主机 SerDes 里。如果交换芯片的 SerDes 能力不够强,LPO 链路就会在长走线、插损大的场景下翻车。所以 LPO 的成功前提是交换机 ASIC 和光模块联合设计,这也解释了为什么 Arista 要做 OFC 演示、Nvidia 要公开发布结果——这种深度协同本来就是系统厂商的强项。

3.3 Arista 和 Nvidia 公开结果:VCSEL LPO 到硅光 LPO 的演进边界

资料里引用了 Arista 在 OFC 2023 上的演示结果:VCSEL B2B 预 FEC BER 在过扣板时能做到 1E-6,MAC 板测试到 1E-7;使用硅光 LPO 方案的 112G 光模块也表现出一定的应用前景。从数字看,VCSEL LPO 在 112G AOC 上有可行性,硅光 LPO 在模块上也具备竞争力。

这些结果的另一个价值是告诉大家:“模块和交换机参数双向调参能实现较优性能”。也就是说,LPO 不是把模块装上就能跑,而是要对主机 SerDes 的均衡系数、CTLE 增益、输出摆幅做一轮联合调优。这个过程有点像 RF 链路的调优思路,而不是传统数字模块“即插即用”的习惯。

Nvidia 公开的结果也印证了一个趋势:行业头部厂商在做 LPO 时,已经把协同设计做成了一个标准动作。简化调参流程下,VCSEL LPO 的可量产性已经比较明确,硅光 LPO 则需要更多扩展场景边界去验证。

4. 各抒己见:One Half 架构如何平衡性能、成本与风险

4.1 One half 可插拔方案:TX-XSR / RX-MR 接口设计与 Retimer 位置

在纯 DSP 和全线性方案之间,还有一条中间路线,资料里叫 “One half” 架构,源自 OIF Co-Packaging 的讨论文档。它的思路是把光引擎的 e-gress(出口侧)放置一颗 Retimer 芯片,光模块内部保留一半的 DSP 功能,但不做传统的完整 oDSP。

接口设计上是这样定:ASIC 侧使用 TX-XSR(eXtreme Short Reach)接口发送信号到模块,模块内部通过 Retimer 整形后再驱动光芯片;接收端使用 RX-MR(Medium Reach)接口,从光芯片的 TIA 出来,经过模块内的 CDR/均衡再回传给 ASIC。

这样做的好处是:ASIC 的 SerDes 不需要工作在满负荷的 LR 模式。传统上,网络设备 ASIC 的 SerDes 能力要设计在 LR 上保证性能裕量,这占用了大量芯片面积和功耗。One half 方案下,ASIC 发端只需要出 XSR 信号跑很短一段,模块内的 Retimer 承担后续的驱动和均衡,整个链路的信号完整性压力被分散了。

实际的产品形态会分化成几种:一种叫“半线性、半 DSP”,发送端用线性驱动器,接收端用 oDSP 的 RX 数字均衡;另一种是发送端用 One half oDSP 带 TX FIR(3.3Vpp 驱动),接收端用线性 TIA。两端组合起来在链路里就能形成 DSP-DSP、Linear-DSP、DSP-Linear 等多种连接组合,不一定要求两端模块同构。

4.2 四种模块架构对比:功耗、EIC 成本、BER 与延迟的取舍

资料里有一个很实用的对比表,把四种光模块架构放在一起比。我按参数整理成表:

架构功耗EIC 成本BER(典型)延迟
通用标准 PAM4 模块(5nm oDSP)8 W1(DSP+TIA)1E-9100 ns
“半线性” “半 DSP”(RX 数字均衡)5.5 W0.68(1/2 DSP+TIA+DRV)1E-850 ns
“半线性” “半 DSP”(TX FIR)5 W0.56(1/2 DSP+TIA)1E-850 ns
线性光模块(DRV+TIA)4.5 W0.25(DRV+TIA)1E-7 至 1E-6 或更差10 ns

这个表的阅读方法很直接:越往右下方走,功耗越低、成本越低、延迟越小,但 BER 性能越差、成熟度越低。One half 架构恰好站在中间——它比全线性方案多了 DSP 的均衡能力保证 BER 在 1E-8 量级,比全 DSP 方案节省约 30% 功耗和约 30%~40% 的 EIC 成本。

需要特别注意的是延迟指标。全线性方案能做到 10ns 的极低延迟,这对高性能计算和 AI 集群有一定吸引力,但 BER 掉到 1E-6 甚至更差,对 FEC 的依赖就大大增加。One half 把延迟控制在 50ns 级别,BER 却保持在 1E-8,是个比较稳的折中档位。

还有一个容易被忽略的维度:互通性。资料明确说 One half 架构支持与通用标准 PAM4 模块互通。这很重要,因为这意味着在 CPO 和 LPO 还没有统一标准之前,One half 模块可以插在现网交换机上,和传统 PAM4 模块混用,不要求整网同步升级。

4.3 One half 有源铜缆:小裕量低代价与极限性能的博弈

One half 架构不仅用在光模块上,还延伸到了有源铜缆(AEC)。资料里展示了两种 AEC 类型和一个关键对比:在同样的 112G 铜缆链路上,发射端用提升摆幅的方式做预加重,接收端用 FFE(7 tap / 5 tap)和 22 tap FFE 的均衡组合。

这里有一个很有意思的设计语言:光模块提升电压摆幅可以等效成一种预加重方法,而铜缆发射端提升摆幅,本质上在做同一件事——用更大的驱动电压来对抗链路损耗。参数上,发射端可以提供 0~1.2V 或 0~3V 的不同差分摆幅,接收端使用 CTLE 两级,每级提供 10~15dB 增益,不需要 pre-distortion,也不用做 SNR/FEC monitoring。

从覆盖距离看,One half Retimer 方案在 DAC(直连铜缆)和 2 米 ACC(有源铜缆)场景下,覆盖大约 3.5m 和 4.5m;而 One one LR Retimer 方案可以延伸到 6m,接近 IEEE 112G 铜缆方案的极限。但 LR Retimer 的功耗显著更高,属于“大裕量、大代价”。One half 的定位很明确:小裕量、小代价,靠牺牲一点距离换来功耗和成本的平衡,给中等长度链路一个不“豪华”但能用的选项。

5. CPO 与 LPO 方案选型避坑:五个常见翻车点与排查思路

5.1 翻车点一:光引擎尺寸缩小后局部热密度反而升高

现象:样品测试时,光引擎区域温度超标,激光器波长漂移,BER 恶化到无法收敛。

原因:只看光引擎总功耗下降了,没算封装内的热密度。CPO 把光引擎塞到交换芯片旁边,散热面积被压缩,热源集中在一个很小区域。可插拔模块时代,散热器和风道是独立设计的;共封装后,光引擎和交换芯片共享散热路径,相互加热。

解决:选型时不要只对比“模块功耗”这一项。要看封装内热源的分布、光引擎和交换芯片之间的热耦合系数。设计阶段用热仿真跑几种布局,优先把激光器放在靠近基板散热通孔的位置。如果空间允许,考虑在封装内加微尺度热管或热电制冷器,但每加一样都要重新做可靠性评估。

5.2 翻车点二:端面耦合良率与测试成本的黑匣子

现象:小批量做出来的光引擎,耦合插损飘得厉害,同一个批次里有的 -1.5dB、有的 -4dB,无法批量发货。

原因:端面耦合的精度要求极高,基板翘曲、贴片应力和温度变化都会造成光斑偏移。实验室里的耦合对准是人工微调的,到产线上要靠自动封装设备保证实时对准精度,产线设备能力和工艺窗口不匹配就会出现这种波动。

解决:第一步先建立耦合损耗的统计分布,不要只看单颗最佳值。第二步加一道“预筛选测试”,在光引擎贴片完成后、封装灌胶前,做一次主动对准优化,把损耗超标的筛选掉。第三步倒逼封装工艺,用翘曲度检测控制基板来料质量,这会直接决定耦合一致性。

5.3 翻车点三:LPO 只是去掉 DSP?链路均衡被严重低估

现象:LPO 模块在实验室 B2B 场景测试通过,部署到机柜后发现前 FEC BER 在 1E-5 到 1E-6 之间波动,换不同交换机端口表现还不一样。

原因:LPO 去掉 DSP 后,均衡重任全压在主机 SerDes 上。不同交换机 ASIC 的 SerDes 均衡器能力差异很大,有的 FFE 只有 5 tap,有的带 MLSE,性能不在一个水平。实验室的 B2B 测试链路短、插损低,掩盖了这个问题。

解决:LPO 选型之前,先拿到交换机 ASIC 的 SerDes 规格书,确认支持多少 tap FFE、有没有 DFE 和 CDR、均衡范围是多少。部署前做一轮模块和 ASIC 的双向联调,用链路仿真把插损边界跑一遍,看到最差端口能跑到什么 BER 再定方案。最忌讳的事就是只凭“LPO 功耗低”就拍板,最后发现现有交换芯片的 SerDes 根本带不动。

5.4 翻车点四:One half 模块与现有 PAM4 模块互通的隐性问题

现象:One half 模块插入交换机,和传统 DSP 模块对传时 BER 正常,但和另一品牌 One half 模块对传时出现偶发误码。

原因:One half 架构的特殊性在于 TX 和 RX 接口能力不对称(TX 出 XSR、RX 收 MR)。不同厂商对 XSR 配置和 Retimer 均衡参数理解不同,导致端到端链路的整体均衡分配出现偏差。资料里明确说了,不存在“弱-弱”对传链路——两个低能力端对传必然出问题。

解决:One half 部署前先做矩阵互通测试,至少验证“One half 与 DSP 模块”和“One half 与 One half”两种组合,记录每组组合的预 FEC BER。运维上设定一个原则:One half 模块尽量和 DSP 模块或同一厂商的 One half 模块配对,避免两弱对传。如果必须混插,提前跑满 24 小时长期漂移测试,别只看瞬时 BER。

5.5 翻车点五:可维护性被忽略——CPO 坏一个光引擎等于动整板

现象:CPO 设备在现网运行半年后,一个光引擎的激光器衰减,链路误码率超限。维护团队发现更换这个光引擎需要把整块主板拆下来返厂,停机窗口从预期 2 小时变成 2 天。

原因:这是 CPO 形态天然带来的代价。光引擎和交换芯片封装在一起,光纤管理、基板结构都是整体的,不可能做到像可插拔模块那样轻松“拔下来换一个”。选购阶段如果只对标功耗指标,忽视可维护性设计,到了运维阶段就会体会到“无后悔药”的感觉。

解决:评估 CPO 产品时,把可维护性纳入一票否决项。问供应商三个问题:光引擎故障是整板返修还是板上更换?返修时间窗是多少?是否设计了独立供电和状态监控,能在故障早期预警?如果你的运维团队不具备返厂维修条件,就优先考虑 LPO 或 One half 这类可插拔兼容形态,至少还有“拔插换新”的后路。

6. 验证方法落在实处:从 B2B 预 FEC BER 到系统裕量的三级测试习惯

6.1 第一级:模块级 B2B 预 FEC BER 基线

拿到任何一款 CPO、LPO 或 One half 模块,我会先做的第一件事是在实验室跑背靠背(Back-to-Back)预 FEC BER 基线测试。背靠背链路没有任何连接器和长走线损耗,测出来的是模块本身的性能天花板。以 LPO 为例,VCSEL 方案的 B2B 预 FEC BER 通常能做到 1E-7 到 1E-8 量级,硅光方案略好;如果连背靠背都跑不到 1E-7 以上,说明这个模块的光电协同设计本身就存在问题,后面的系统级测试没有意义。

6.2 第二级:过扣板过连接器的系统级裕量测试

B2B 测完只是第一步,紧接着要加插损:把模块接到真实交换机端口上,让信号经过扣板、背板连接器、MAC 板走线,看预 FEC BER 掉到多少。资料里 Arista 那个数据很典型:VCSEL LPO 在过扣板场景测到 1E-6,MAC 板测到 1E-7。这里要注意,BER 从 1E-8 掉到 1E-6,说明链路余量已经很紧张——不是不能跑,而是你必须在正式部署前知道这个余量还有多少。如果系统级 BER 在 1E-6 附近徘徊,建议做一轮“双向调参”:调整主机 SerDes 均衡系数、TX 摆幅、CTLE 增益,看 BER 能否收敛到 1E-7 以下。

6.3 第三级:生存性验证与部署计划

第三级测试最容易被人跳过,但我强烈建议做:温度循环下 24 到 48 小时的长期 BER 漂移测试。光模块的 BER 会随温度变化漂移,激光器波长跟着温度走,模块内部均衡参数的温度补偿系数如果没调好,稳态测试通过的产品在温度变化下会翻车。跑完生存性测试之后,再把可维护性纳入部署计划——如果链路用的是一体化光引擎,至少要在监控系统里加载激光器 Bias 电流和温度遥测,提前发现衰减趋势。从那以后我经手每个 CPO/LPO 项目都强制走一遍这三步,先 B2B 定基线、再过连接器看裕量、最后做温度生存性,全部达标才敢上量。这套流程挡掉过至少三个看着实验室数据很好、实际现网撑不过一个夏天的方案。希望帮到你。

本文还有配套的精品资源,点击获取

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/6 5:55:26

AI代理谈判实战:从意图理解到本地部署的完整指南

AI代理(AI Agent)这个词,今年在圈子里几乎是逢会必谈。工具、框架、benchmark满屏飞,可真正把它用在刀刃上的人其实不多。我见过不少朋友上来就问"哪个AI代理能帮我跟供应商砍价",结果工具换了一堆&#xff…

作者头像 李华
网站建设 2026/10/6 5:55:06

AI应用安全实战:提示注入、Agent权限与数据隐私防护指南

1. 现状与核心矛盾:AI落地越快,安全欠账越多过去一年,我身边做AI应用的人明显分成了两拨。一拨天天在朋友圈晒数据:AI客服把工单回复效率提了三倍、AIGC团队用模型把海报出图成本打到原来的十分之一、用AI编程写单元测试直接省掉一…

作者头像 李华
网站建设 2026/10/6 5:54:59

Sniffer Pro抓包实战:从混杂模式到五种协议报文拆解

简介:这是一份面向计算机网络相关专业实训课程的任务书,围绕嗅探器工具在网络协议分析中的应用,适合需要完成协议抓包实验或撰写实训报告的学生与网络初学者使用。任务书从实训目的、需求分析到嗅探器工作原理逐步展开,重点讲解数…

作者头像 李华
网站建设 2026/10/6 5:54:50

电机控制器母线电容选型计算:从能量守恒到Excel工具

控制器的母线电容,很多工程师真的就是“拍脑袋”选的:功率大点就多并两个电容,功率小点就少并两个,再不行就照着竞品抄。这种办法在前期调试可能看不出毛病,可一到批量、一到高温耐久、一到客户那边满载跑起来&#xf…

作者头像 李华
网站建设 2026/10/6 5:54:47

单文件AI编码代理:支持GUI操控与MCP协议

1. 为什么我要自己造一个 AI 编码代理市面上能用的 AI 编码助手我基本都试过一遍。云端方案响应快、模型强,但代码得传到别人服务器上,公司内网的私有项目根本没法用;本地部署的方案呢,要么依赖一大堆 Python 环境、CUDA 版本、模…

作者头像 李华
网站建设 2026/10/6 5:54:47

FPGA DDR4实战:Vivado MIG IP核引脚配置与约束精修指南

1. 项目概述:为什么DDR4在FPGA项目里总让人头皮发麻?“别再死磕手册了!”——这句话我第一次在Xilinx官方论坛看到时,正对着UG586第327页的DDR4 PHY timing diagram发呆,手边是三块反复布线失败的开发板、两份被红笔划…

作者头像 李华