数据中心光互联深度解析:LPO与CPO技术路线对比与选型
发布时间:2026/9/29 14:53:30 锦皓数字建站

跑数据中心这几年最直观的一个感受是机柜里原先那些圆滚滚的铜缆正在被一根根细光纤和光模块取代。“光互联”从一个芯片厂推销PPT里的概念变成了我规划网络时要天天算账的事而“CPO”“LPO”这两个词几乎是每场技术会上都会被拉出来对比一遍的对象。但说实话这三个词的热度虽然高真想弄明白它们关系的人并不多。有人把LPO当成CPO的过渡版有人以为CPO是光模块的某个新封装还有人直接把“铜缆升级”看成“换根贵点的线”。这篇文章就把我自己的理解、踩过坑和一些实测心得写下来。它面向正在做数据中心网络规划、AI集群组网或者单纯想搞懂800G/1.6T时代技术走向的读者。文章不推任何厂商只聊逻辑和取舍。先从最根本的问题说起铜线为什么会输而且输得这么彻底。1. 为什么说铜线走到尽头了1.1 铜缆的物理天花板带宽乘距离数学上就锁死了很多做网络的人可能还有印象十年前机柜内互联无源铜缆DAC是绝对主力。一根QSFP的DAC跑40G走3米5米轻轻松松。到了100G时代跑56G PAM4走2到3米开始有压力但还能凑合。等到了现在的112G PAM4 per lane也就是400G/800G时代无源DAC能稳定工作的距离基本就是1米到2米这个区间。很多实验室实测超过1.5米眼图就开始塌。眼图为什么会塌因为铜缆传高频信号时导体的趋肤效应让电流往导体表面挤等效电阻随着频率上升而增大再加上介质损耗和相邻线对的串扰信号每走一米衰减和失真都要吃掉一大块链路预算。这个趋势算到数学上就是“带宽和距离是互锁的”——速率每翻一倍有效传输距离差不多要减半甚至更多。于是行业里出现了一个尴尬局面线材越做越粗屏蔽越加越厚铜缆SerDes的速率和距离却还是追不上光。有人马上想到那用有源铜缆AEC或者有源光缆AOC中间中继一下不就行了。确实AEC靠两端的重定时芯片把信号“重启”一次可以把距离拉到几十米甚至更长但它吃掉的是功耗和热量。你去翻设备手册看一根两端带有源芯片的AEC功耗可能比一对同速率的无源铜缆高出一个数量级。在一个塞了几十张GPU卡的AI机柜里这个热量代价几乎是不可接受的。1.2 功耗账AI集群里的“电费刺客”到了AI集群这个场景功耗问题被放大到极限。我说一个粗算假设一个规模的训练集群光口总数在8000个量级取当前800G可插拔光模块的典型功耗早期型号普遍在14瓦到18瓦左右这是行业公开数据里比较常见的口径光模块总功耗就是8000乘以15瓦上下大概120千瓦。这是什么概念很多机房的一个整柜额定功率才几千瓦到十几千瓦光模块自己就吃掉了一整排柜子的电而这还只是网络互联的开销之一。正因为这个背景行业对“光模块能不能少吃点电”这个问题几乎是发了狠地研究。DSP芯片是整个光模块的耗电大头它主要做信号整形、时钟恢复、均衡补偿。于是有人就想如果是短距离、场景可控、链路质量相对干净的互联能不能不要这颗DSP这就引出了LPO的逻辑。另一个思路更大胆既然交换芯片和光引擎之间还要过一段PCB和连接器的长走线能不能把这个路径直接砍掉把光引擎塞进交换芯片封装里这就是CPO。1.3 别急着判铜缆死刑铜缆并不会在机房里一夜消失。背板连接、芯片到芯片的Die-to-Die互联铜的成本、功耗、时延优势依然是压倒性的。真正被终结的是“跨机柜、跨几米到几十米距离的铜缆数据骨干”。所以更准确的说法是铜线在它够得着的领域继续活但凡是它够不着的地方光互联会全面接管。想通这一点后面看技术路线就不会被“非黑即白”的争论带偏。2. 光互联的三条路线可插拔、LPO、CPO的区别光互联不是新词它讲的是用光信号而不是电信号来搬数据。过去大家把它等同于光模块现在这个“互联”的范围被拓宽了不光有电-光-电的模块转换还有把光直接封装进芯片的趋势。所以有必要把三条路线摆在一起聊。2.1 可插拔光模块今天的主力也是在出问题的组件传统可插拔光模块像QSFP-DD、OSFP里面有光引擎也有一颗完整的DSP。信号路径是这样的交换芯片SerDes把电信号发出来经过PCB走线到面板插进模块DSP对信号重新整形、均衡、恢复时钟再由激光器变成光信号送到光纤接收方向则做一遍逆变换。可插拔最大的优点是解耦。买哪家的交换芯片不影响我用哪家的光模块光模块坏了一线工程师随手就能换运维体感很好。它的缺点也正出在这条“长尾巴”链路上从交换芯片到模块之间的距离产生了大量信号损耗、串扰和额外功耗。到了224G per lane的SerDes速率这条通道的质量控制变得越来越难模块DSP的功耗也几乎到了热设计极限。业界不少公开材料都指出1.6T时代如果继续用纯可插拔加DSP方案散热和面板密度都是硬伤。2.2 LPO不装DSP的可插拔光模块LPO全称Linear-drive Pluggable Optics中文常翻译为“线性驱动可插拔光模块”。它和传统可插拔光模块最大的区别就是模块里不装DSP。发送方向主机SerDes出来的信号直接通过线性驱动放大再驱动激光器接收方向光电探测器出来的微弱信号直接放大后送回交换芯片SerDes处理。模块里的均衡、时钟恢复这些“动脑子”的工作全部扔给主芯片的SerDes电路。这个设计的收益是实打实的比特能耗低延迟接近光电转换的物理极限成本也能降一截。做过的厂商测试普遍认为和同代DSP方案相比LPO能把模块功耗降30%左右这对一个8000端口的大集群来说就是几十千瓦的节省。但它也把难处转嫁到了交换芯片和系统设计上。主芯片SerDes必须支持足够强的均衡算法链路两端的噪声底都必须低连接器和PCB走线质量也不能有一点马虎。一句话LPO是在用整个系统的协同换模块功耗的降低。2.3 CPO光引擎和交换芯片住进一个“小区”CPO全称Co-Packaged Optics中文叫共封装光学。做法是把光引擎和交换芯片封装在同一个基板上或者放在紧邻位置让电信号的传输路径从“PCB长走线加面板连接器”压缩到封装内部的毫米级线段。这样一来信号完整性大幅提升功耗下降单块面板能塞进来的带宽也更高。CPO的核心价值还有一层它不是在模块这个层面上修修补补而是从系统级别重新定义了光接口的位置。过去光电转换发生在机器面板现在它发生在交换芯片旁边整个交换系统的电域部分大大缩短。代价是什么是维护模式的改变。光引擎坏了不能单独换要返修整块板卡光引擎对热量敏感而交换芯片是大热源两者共处一地散热耦合设计必须从头做对厂商的测试和良率来说也不再是一个可独立筛选和升级的组件难度是系统级的。2.4 三种路线对比一张表看懂我列一个对比表方便大家存档维度可插拔光模块LPOCPO模块内核心光引擎 DSP光引擎 线性放大光引擎封装在芯片基板功耗水平高中低延迟DSP处理有额外延迟接近光电转换极限接近光电转换极限现场维护模块可插拔更换模块可插拔更换整机/板卡返修对主机SerDes要求常规要求高依赖均衡能力与交换芯片深度协同成熟度成熟广泛部署样品到小批量早期部署/定制方案看完表你会发现LPO和CPO并不是同一个平面的竞争对手。如果可插拔是“今天”LPO是“今天过后最容易落地的那步”CPO则是“更远但极限也更高”的方向。而且有个容易被忽略的交集CPO要规模化对线性驱动、链路预算的思路和LPO是一致的所以LPO积累的数据和经验很可能会直接给CPO铺路。3. CPO封装技术优势到底强在哪CPO这个词最近被搜索最多的是“CPO封装技术优势”。我身边也有不少朋友拿着厂商PPT问这东西到底是不是噱头。我的判断是不是噱头但它的优势要拆开算因为它有一个非常具体的“好吃点”也有几个很硬的“代价”。3.1 功耗与带宽密度账要这么算先说功耗这是CPO最出彩的地方。传统可插拔方案里信号要从交换芯片出发经过基板、PCB、连接器最后进入模块DSP这一段路径上到处都是损耗DSP要用大量晶体管和功耗去把这些损耗补回来。CPO直接把这条路径砍到毫米级插损小、串扰少主芯片对链路均衡的负担轻光引擎的驱动电路也可以做得更简单。业内很多分析都给出一个方向CPO的比特能耗比带DSP的可插拔方案能下降大约一半。带宽密度是另一个特点。可插拔模块的面板端口密度受限于面板面积、模块尺寸和散热CPO是基于封装的二维甚至三维布局光引擎可以围绕交换芯片一圈摆放单位面积能装下的光通道数远超可插拔。对51.2T甚至102.4T的交换芯片来说这是目前唯一能同时解决带宽密度和功耗的路径。如果哪家芯片厂想在下一代继续提高交换容量CPO几乎是绕不开的考点。3.2 信号完整性把电信号的路程压到厘米级做高速信号设计的人都知道224G SerDes要在PCB上走一段5厘米以上的线还要过一个连接器难度有多大每一厘米走线都要算插入损耗连接器的串扰要控过孔残桩要挖掉阻抗连续性要做到极致。CPO的出现等于直接把这些问题从“板级”变成了“封装级”。光引擎离交换芯片足够近电信号几乎不经过PCB这个“脏环境”链路预算的压力大幅缓解。延迟这个指标在AI集群里也特别敏感。DSP在模块里要做均衡和时钟恢复固定的处理延迟绕不开。早期对光模块的实测里模块DSP通常会增加几百纳秒的处理延迟。CPO和LPO这种去掉DSP的路线延迟几乎只来自光电转换本身所以在超算和AI集群这类延迟敏感场景里优势会一层层传导到端到端训练效率上。3.3 代价热、维修、良率一个都不能少CPO不是免费的午餐。第一关是热。交换芯片本身功耗就在几百瓦光引擎里的激光器对温度又非常敏感温度一高发射功率和波长都会漂移寿命还会缩。所以现在很多CPO方案采用外置激光光源把激光器放在交换模块外面避免和主芯片一起压在散热大坑里这就是常说的ELS方案。第二关是维修。可插拔光模块坏了运维马上换一片CPO光引擎坏了可能要把整台交换机返厂。对大规模数据中心来说这意味着备用整机和更高的故障恢复成本。第三关是良率与测试。可插拔模块是独立测试、独立老化、独立筛选CPO则要和主芯片一起做级联测试任何一个子件出问题整片封装都受影响。这也是为什么CPO到目前为止主要出现在头部云厂商的定制系统里而不是通用交换机的标配。3.4 第一批吃螃蟹的人是谁CPO真正的第一批用户不是传统企业网而是那些能主导链路设计的超大规模数据中心和AI集群。因为它们交换机数量多、链路拓扑固定、运维模式可控能接受定制封装、整机返修这类“重模式”并把这笔账摊到集群总成本里去算。反过来看普通机房要是没有固定的拓扑设计团队没有整版备货能力直接用CPO运维大概率会崩。所以做方案选型时千万别只看PPT上的功耗优势还要问清楚自己团队的运维边界。4. LPO没你想的那么“免费”LPO这两年声量突然变大除了功耗优势还有一个现实原因它仍然是可插拔形态不用动交换机和面板架构。很多团队把LPO当成“过渡期的白捡方案”。但我实际测试下来LPO确实省却不是不付代价。4.1 省掉DSP省下的不只是钱LPO对系统的省电是真实的。模块少了DSP这颗大功耗芯片几乎等于卸载了整条数字信号处理链路。成本上DSP也是模块物料清单里的最大头去掉之后模块的物料成本会有明显下降。对大规模采购方来说单模块省几十块美金乘上几万只模块就是一笔很可观的数字。但这个“省”等于把账转移了交换侧SerDes需要承担更多均衡任务所以选型时不能只盯着交换机端口的线速要重点确认SerDes是否支持更强的发送端加重和接收端均衡是否支持去掉重定时器后的可调FEC策略。很多传统交换芯片的SerDes是为带DSP模块设计的硬上LPO链路性能会非常吃力甚至直接开不了口。4.2 LPO对链路预算的苛刻要求在带DSP的光模块里DSP能对发送信号做预加重对接收信号做均衡很大程度上可以“兜底”链路两端的缺陷。LPO没有这个兜底它把问题暴露给整个系统连接器插损、光纤端面清洁度、激光器功率、接收端的噪声底任何一个环差点都会直接反映到误码率上。我实测过一个常见场景使用LPO模块做互联第一次上架后三天两头报误码查了半天最后发现是光纤跳线端面脏了一小块。同样的脏污放在带DSP模块的环境里DSP可能会把它“校回来”LPO环境里直接表现为纠错前误码率飙升。可以说LPO把整个链路的“容错余量”分给了现场维护。4.3 实际部署最易翻车的三个坑结合我自己的经验部署LPO最容易被坑的基本是下面三件事混插兼容性。LPO对链路预算特别敏感不同厂商的模块、不同SerDes参数、不同交换芯片版本都会改变链路表现。厂商给的兼容列表必须做实测确认别信一张营销兼容表。端面和光纤污染。前面说了LPO几乎容忍不了连接器端面有瑕疵。上架前必须用光纤显微镜检查清洁工具要备齐这不是可有可无的操作规程是刚需。FEC策略调整。LPO信号纠错前误码率可能高于DSP方案这时就必须依赖交换芯片的FEC机制来兜底。有些默认关闭FEC或FEC增益不足的平台照搬原来的配置参数LPO链路会直接下线。5. 从选型到排障给从业者的实操建议如果看了上面这些你还是准备上LPO或者评估CPO那下面这些实操层面的内容应该能帮你少走弯路。5.1 看规格书先看这三个指标不管是选LPO模块还是评估CPO方案我建议第一眼先盯三处比特能耗、链路预算、工作温度范围。比特能耗别信厂商的典型最低值要看满速率、满温下的表现。链路预算直接决定你能在什么距离、什么环境下用。工作温度范围则影响光引擎寿命CPO和LPO因为DSP少了热冗余设计也跟着变。另外模块的数字诊断监控字段也要打开来看。LPO模块里没有DSP很多厂商原本依赖DSP采集的诊断数据会变少你要确认模块还能量到哪些关键的TEC温度、偏置电流、接收功率。否则后期故障定位会抓瞎——连光模块是不是温度过高导致掉链子都判断不了。5.2 链路异常排查经验很多第一次玩LPO的人看到误码率上升就习惯性地先怀疑模块。我的经验是反过来的先清光纤端面再看兄弟连接器的插损然后看交换芯片SerDes端的眼图和误码统计最后才去怀疑模块本身。原因很简单LPO链路把大部分容错交给了链路质量而链路质量问题里端面污染大概占一半以上。实际操作中我还会要求维护组给每条LPO链路做固定周期的端面巡检特别是在机房温湿度波动大的季节。经验数据虽然不严谨但从我的实践看这种投入换来的误码率下降是肉眼可见的。不要以为MPO连接器插一次就万事大吉灰尘和氧化是慢慢累积的。5.3 这两年我自己踩过的坑最后说两个踩过的坑。第一个是“拍脑袋看距离”。刚接触LPO时我以为它和同规格的DSP模块支持的传输距离差不多结果在一个拉远场景里栽了跟头——链路预算不够误码率一直在FEC纠错上限附近徘徊。后来重新算链路预算才发现LPO哪怕标称DR8支持500米现实中也别把它当500米用余量最好按50%到70%去留。第二个坑是混插。有一次在两个品牌的交换机互联口上做LPO实测厂商原本的兼容清单上写的是“支持”但两边SerDes的均衡参数差别很大最终只能把那排接口全部改成同品牌同型号。从那以后我的原则是凡LPO必须做真实设备互联测试报告没出来之前默认它不兼容。聊到这里其实就回到开头那句光互联不是把铜线换成光纤这么简单。LPO与CPO一个在改模块的形态一个在改整个系统的架构各有各的账要算。我个人的习惯是把LPO当成一件顺手能做的事先做起来把链路预算和现场维护的底子打扎实CPO则作为后续系统级的演进方向去跟踪。真到了需要选型的那一天手里有实测数据心里就不慌。
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。