从并行总线到SerDes:为什么现代芯片设计都离不开高速串行通信?
从并行总线到SerDes:为什么现代芯片设计都离不开高速串行通信?
几年前,当我第一次尝试设计一块需要连接多个高速ADC和FPGA的板卡时,我本能地选择了传统的并行LVDS接口。毕竟,教科书和早期的项目经验都告诉我,并行总线简单、直观。然而,随着时钟频率向500MHz迈进,噩梦开始了:布线上百根等长线带来的巨大挑战、同步时钟的抖动和偏移导致的时序裕度急剧收缩、以及最终调试阶段那永远无法完全睁开的“数据眼图”。那次经历让我彻底明白,为什么整个行业都在转向一种看似更复杂的技术——SerDes。它不仅仅是一个技术选项,而是现代高性能计算、数据中心、乃至消费电子芯片设计中,突破物理极限、实现带宽跃升的唯一现实路径。今天,我们就来深入聊聊这场从“并”到“串”的静默革命,看看SerDes是如何成为芯片间通信的绝对主流的。
1. 并行总线的黄金时代与它的阿喀琉斯之踵
在数字电路的早期,并行总线是不二法门。它的逻辑简单至极:用N根物理连线同时传输N位数据,一个时钟沿到来,所有数据位一并被锁存。从早期的8位ISA总线到后来的32位、64位前端总线,这种“人多力量大”的思路支撑了计算机性能的初期飞跃。
注意:这里提到的“人多力量大”仅指数据位宽带来的理论吞吐量优势,在实际高速场景下,并行总线的物理限制会迅速抵消这一优势。
然而,当摩尔定律推动晶体管密度指数级增长,芯片内部处理速度越来越快时,芯片与芯片之间、板卡与板卡之间的通信瓶颈就变得异常尖锐。并行总线在高速下的固有缺陷开始全面暴露:
- 引脚数量与封装成本:每增加一位数据位宽,就需要增加至少一个引脚(对于差分信号则是两个)。当数据位宽达到64位甚至128位时,仅数据线就需要占用海量的封装引脚。这直接导致芯片封装变得异常复杂和昂贵。更关键的是,PCB板上的走线密度也面临极限,层数激增,制造成本飙升。
- 时序同步的噩梦:这是并行总线最致命的弱点。为了保证所有数据位在同一时钟沿被正确采样,必须确保所有数据线从发送端到接收端的传输延迟(Flight Time)严格一致。在低速时,这可以通过粗略的等长布线实现。但在GHz级别的频率下,情况完全不同:
- 时钟偏移(Skew):时钟信号到达不同接收触发器的微小时间差异。
- 数据偏移(Data Skew):不同数据信号由于布线长度、过孔、负载差异导致的传输延迟差异。
- 建立/保持时间(Setup/Hold Time):在时钟沿前后,数据必须保持稳定的时间窗口。随着频率升高,这个窗口本身就在缩小。
这些因素共同作用,导致“数据有效窗口”(也就是我们常说的眼图的水平宽度)被严重挤压。工程师不得不花费大量精力进行极其精确的时序分析(Timing Analysis)和PCB布局,而最终的系统最高频率,往往不是由芯片性能决定,而是由这些板级时序裕度决定的。
并行总线与SerDes关键瓶颈对比
| 对比维度 | 传统并行总线 (如DDR, LVDS) | 高速SerDes |
|---|---|---|
| 引脚效率 | 低。带宽提升严重依赖增加引脚数。 | 极高。单对差分线即可实现极高带宽。 |
| 时序挑战 | 极大。需严格处理多路信号间的偏移(Skew)和抖动(Jitter)。 | 极小。采用时钟数据恢复(CDR),无需外部同步时钟。 |
| 传输距离 | 短。通常限于板级或背板级。 | 长。可通过均衡技术支持从厘米到公里级的传输。 |
| PCB设计复杂度 | 高。需要大量等长线,占用布线空间大。 | 低。差分线对数量少,布线灵活,空间占用小。 |
| 可扩展性 | 差。提升带宽需大幅增加物理接口,成本非线性增长。 | 优秀。可通过提升单通道速率(如从10G到112G)轻松扩展。 |
上表的对比清晰地揭示了并行总线在进入GHz时代后的力不从心。行业需要一种能从根本上规避多路信号同步难题的新架构。
2. SerDes的核心哲学:化繁为简的串行智慧
SerDes是Serializer(串行器)和Deserializer(解串器)的合成词。它的核心思想极具颠覆性:既然多路并行信号的同步如此困难,那为什么不把所有数据变成一路高速流,在接收端再重新整理出来呢?
这个想法催生了一套完整的技术体系。一个典型的SerDes收发器链路包含以下几个关键部分,我们可以通过一个简化的功能框图来理解:
发送端 (Tx) ────────────────────────────────────> 接收端 (Rx)
│ │
├─ 并串转换器 (Serializer) ├─ 时钟数据恢复 (CDR)
├─ 编码器 (如8B/10B, 64B/66B) ├─ 均衡器 (EQ: CTLE, DFE)
├─ 驱动器 (Driver) ├─ 解码器
└─ (可选)预加重 (Pre-emphasis) └─ 串并转换器 (Deserializer)
让我们拆解其中几个革命性的设计:
- 时钟数据恢复(CDR):这是SerDes的“灵魂”。它彻底摒弃了并行总线中那根脆弱的外部同步时钟线。CDR电路直接从接收到的数据流本身实时提取出时钟信号。因为数据和时钟“同路”,它们经历的路径延迟、抖动完全一致,从根本上消除了源同步架构中时钟与数据路径不匹配带来的时序问题。
- 差分信号传输:SerDes几乎无一例外地使用低压差分信号(如LVDS、CML)。每一对差分线(D+和D-)传输一路串行数据。差分传输对共模噪声(如同步开关噪声、电磁干扰)具有天然的免疫力,因为干扰会同时作用于两根线,而接收器只关心两者之间的电压差。这为在嘈杂的板级环境中传输微弱的毫伏级信号奠定了基础。
- 均衡技术:当信号速率达到数Gbps甚至上百Gbps时,信道(PCB走线、电缆、连接器)的损耗(主要表现为高频衰减)会变得非常严重,导致信号严重失真、眼图闭合。SerDes通过在接收端(有时也在发送端)集成均衡器来对抗这一效应。
- 连续时间线性均衡(CTLE):像一个可调的高通滤波器,放大信号的高频成分,补偿信道的高频损耗。
- 判决反馈均衡(DFE):一种更强大的非线性均衡器。它利用已判决出的数据位,来预测并消除当前比特受到的“码间干扰”(ISI)。DFE是突破长距离、高损耗信道极限的关键。
// 一个极其简化的DFE核心思想伪代码示例,帮助理解其工作原理
// 假设当前接收到的模拟信号电压为 `rx_signal`
// 历史判决结果存储在寄存器 `prev_bits[1:N]` 中
// 抽头系数 `coeff[1:N]` 代表了前N个比特对当前比特的干扰强度
current_isi = 0;
for (i = 1 to N) {
current_isi += prev_bits[i] * coeff[i]; // 计算历史比特造成的干扰总和
}
adjusted_signal = rx_signal - current_isi; // 从当前信号中减去预估的干扰
current_decision = (adjusted_signal > threshold) ? 1 : 0; // 对“干净”的信号做判决
// 更新历史寄存器
prev_bits = {current_decision, prev_bits[1:N-1]};
这段伪代码揭示了DFE如何通过“学习”信道的特性,动态地消除前后比特间的相互干扰,从而在看似已经闭合的眼图中,“挖”出一个可以正确采样的开口。
3. 现代SerDes技术栈:不止于传输,更是智能的信号处理器
今天的SerDes已经远远超出了一个简单的串并转换器。它集成了模拟、数字和算法领域的多项尖端技术,成为一个高度智能、可自适应环境的信号处理系统。
3.1 自适应均衡与信道协商
在高性能计算和数据中心交换芯片中,SerDes链路可能连接着不同长度、不同损耗的背板或光纤。固定参数的均衡器无法应对所有情况。因此,现代SerDes普遍支持自适应均衡。
- 工作原理:链路初始化时,发送端会发出一段特殊的训练序列(Training Pattern)。接收端的均衡器根据接收到的训练序列质量(通常通过误码率BER或眼图张开度间接测量),动态调整其参数(如CTLE的增益峰值、DFE的抽头系数),直至找到使信号质量最优的配置。这个过程通常是双向的,接收端也会指导发送端调整预加重的强度。
- 协议支持:像PCIe、以太网等标准,都将链路训练和均衡自适应作为物理层规范的一部分,确保了不同厂商设备间的互操作性。
3.2 先进的调制与编码:PAM4与FEC
当NRZ(不归零码,即2电平调制)的单通道速率逼近香农极限时,为了在不增加波特率(从而不增加信道带宽需求)的前提下进一步提升比特率,行业引入了更高效的调制方式。
- PAM4(4电平脉冲幅度调制):这是当前112Gbps SerDes的主流选择。与NRZ用高、低两个电平表示1和0不同,PAM4使用四个电平(如-1, -1/3, +1/3, +1)来表示两个比特的信息(00, 01, 10, 11)。这样,在相同的符号速率下,数据率直接翻倍。
- 代价:PAM4的信号眼图从NRZ的一个变成上下叠放的三个,眼高仅为NRZ的1/3,对噪声和干扰更加敏感,对接收机线性度和信噪比的要求呈指数级提高。
- 前向纠错(FEC):为了对抗PAM4带来的更高误码率,高速SerDes普遍集成强力的FEC引擎。FEC通过在数据流中添加冗余的校验码,使接收端能够检测并纠正一定数量的错误比特,从而将系统误码率从不可接受的水平(如1E-5)降低到极低的水平(如1E-15)。FEC是保证数据中心级链路可靠性的基石。
3.3 电源与信号完整性协同设计
一颗集成了数十甚至上百个SerDes通道的SoC,其功耗和信号完整性设计是巨大的挑战。
- 功耗管理:SerDes的模拟前端(特别是驱动器、接收器和时钟电路)是功耗大户。高级的SerDes支持多种功耗状态(如L0s, L1),在链路空闲或低负载时,可以快速关闭或降低部分电路的功耗。
- 封装与互连:为了将如此高速的信号引出芯片,传统的wire-bond封装已不适用。硅中介层(Silicon Interposer)、扇出型封装(Fan-Out)和2.5D/3D封装技术被广泛应用。这些技术通过更短、更均匀的互连,将SerDes芯片与高带宽内存(HBM)或其他芯片直接连接,实现了前所未有的片上系统互连带宽和能效。
4. SerDes的应用图谱:从芯片内到数据中心
SerDes技术已经渗透到数字世界的每一个角落,其应用场景根据速率和距离要求,形成了清晰的分层。
4.1 短距芯片间互连(< 30cm)
这是SerDes最经典的应用,主要用于同一PCB板上的芯片互联。
- 用例:CPU与PCIe Switch、FPGA与高速ADC/DAC、ASIC与存储控制器之间的连接。
- 典型协议/标准:PCI Express (PCIe) 是绝对的王者。从Gen1的2.5GT/s发展到今天的Gen5的32GT/s(NRZ)和Gen6的64GT/s(PAM4),PCIe依靠SerDes技术持续为计算和扩展提供核心总线。此外,JESD204B/C 标准专门用于连接数据转换器(ADC/DAC),其确定性延迟特性对射频采样系统至关重要。
4.2 中长距板级与机架内互连(30cm ~ 10m)
这类应用通常通过电缆或背板连接。
- 用例:服务器机柜内TOR(Top of Rack)交换机与服务器网卡之间的连接、存储阵列控制器与硬盘柜的连接。
- 典型协议/标准:以太网(Ethernet) 是主导者。从10G、25G、40G、100G到今天的400G、800G,以太网的物理层完全由SerDes技术驱动。不同的介质(如DAC铜缆、AOC有源光缆、光纤)对应不同的SerDes发射器和接收器设计。
4.3 超长距与光网络互连(> 10m)
当距离超过数米,电信号的损耗已无法克服,SerDes需要与光模块协同工作。
- 用例:数据中心园区互联、城域网、长途电信骨干网。
- 工作模式:芯片上的SerDes核心(通常称为SerDes PHY)将高速电信号驱动至光模块的电接口。光模块内部的激光驱动器将电信号转换为光信号,通过光纤传输。在接收端,过程相反。这里的SerDes需要具备极低的抖动和强大的时钟恢复能力,以应对长距离传输带来的累积抖动。
提示:在选择SerDes IP或芯片时,必须明确其目标应用场景。用于芯片间互联的短距SerDes和用于驱动光模块的长距SerDes,在架构、功耗和均衡能力上有显著差异。
5. 设计挑战与选型考量:拥抱SerDes并非毫无代价
尽管SerDes优势巨大,但将其集成到设计中,尤其是对于初次接触的团队,会面临一系列新的挑战。
5.1 模拟/混合信号设计门槛
高性能SerDes的核心——高速驱动器、接收器、低抖动锁相环(PLL)、高精度模数转换器(ADC)——都属于模拟或混合信号电路范畴。这要求设计团队具备深厚的模拟IC设计经验,或者选择向第三方IP供应商(如Synopsys, Cadence, Alphawave)购买经过硅验证的SerDes IP核。IP选型是一项关键决策,需要权衡:
- 数据速率与协议支持
- 功耗与面积
- 工艺节点兼容性
- IP供应商的技术支持与生态
5.2 测试与验证的复杂性
验证一个SerDes系统远比验证一个数字逻辑模块复杂。它涉及:
- 混合信号仿真:需要运行长时间的瞬态仿真,并注入各种抖动和噪声模型,以评估比特误码率。
- 复杂的测试设备:需要高性能的比特误码率测试仪(BERT)、实时示波器(用于眼图、抖动分析)和网络分析仪(用于信道S参数测量)。
- 系统级协同仿真:需要将SerDes的模型与封装、PCB的电磁仿真模型结合起来,进行端到端的系统性能评估。
5.3 信号与电源完整性
虽然SerDes减少了布线数量,但对每一对差分线的质量要求却极高。设计者必须精通:
- 差分对的严格阻抗控制(通常为85-100欧姆)。
- 减少过孔stub效应、保持走线对称性。
- 电源分配网络(PDN)的优化,为敏感的模拟电路提供极其干净、稳定的电源,因为SerDes对电源噪声极其敏感。
在我参与的一个高速网络芯片项目中,我们曾因为一颗电源芯片的开关噪声耦合到了SerDes的模拟电源域,导致在特定温度下链路误码率飙升。最终花了数周时间,通过增加磁珠隔离、优化去耦电容布局和修改电源芯片的开关频率才解决问题。这个教训让我深刻体会到,SerDes的成功,一半在于芯片设计,另一半在于系统级的协同设计与精心的板级实现。
从并行到串行,这场通信技术的范式转移,本质上是工程设计哲学在面对物理极限时的必然选择。SerDes通过将复杂度从难以控制的板级时序,转移到可高度集成、算法化管理的芯片内部,为数字系统带宽的持续增长打开了大门。它不再是一个可选的“高级功能”,而是构建任何高性能计算、通信和存储系统的基础性使能技术。对于今天的芯片和系统架构师而言,理解SerDes的原理、掌握其设计权衡、并能在实际项目中驾驭它,已经成为一项不可或缺的核心技能。下次当你看到主板上那寥寥几对连接CPU和GPU的PCIe线路,或者数据中心机架上那些承载着海量数据的纤细光纤时,你会知道,其中奔腾的每一比特,都凝聚着SerDes这项精巧技术的智慧。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)