Quantum 系列:

如果说在数据中心网络赛道,博通(Broadcom)是依靠庞大生态和通用性稳坐钓鱼台的“老钱”,那英伟达(NVIDIA)的 Quantum(InfiniBand)系列​ 就是带着万亿参数大模型杀回马枪的“新皇”

自从英伟达收购 Mellanox 并将其技术深度融合后,Quantum 系列就不再仅仅是一颗“交换机 ASIC”,而是进化成了专为 HPC(高性能计算)和生成式 AI 量身定制的“网内超级计算机”。目前,它是全球绝大多数顶级 AI 大模型(如 ChatGPT)训练集群的绝对互联底座

为了让您一目了然,我将从代次演进五大硬核技术壁垒以及实战场景三个维度为您深度拆解。


Quantum 系列代次演进(算力扩张史)

英伟达 Quantum 平台的迭代速度极快,短短几年内就完成了从 200G 到 800G,甚至迈向 1.6T 的跨越。以下是其核心代次的演进路径:

代次 / 平台

核心芯片 / 交换机

发布时间

单端口速率

交换容量 (单芯片)

灵魂技术突破

第一代/Quantum-1

Quantum QM8700

约 2018-2019年

200G​ (HDR)

16 Tb/s (40x 200G)

奠定低延迟基础,支持早期 SHARP 网内计算,框式系统可扩展至万级端口。

第二代/Quantum-2

Quantum QM9700/QM9790

2021年 (GTC)

400G​ (NDR)

51.2 Tb/s (64x 400G)

引入 7nm 工艺,SHARPv3,支持 32 个并行流,AI 加速能力比上代提升 32 倍。

第三代/Quantum-3

Quantum-X800

2024年 (GTC)

800G​ (XDR)

115.2 Tb/s (144x 800G)

专为万亿参数 AI 模型打造,引入 SHARPv4(算力飙升 9 倍),支持 FP8 精度加速。

第四代/Quantum-X

Quantum-X1600(预计)

2026年 (GTC官宣)

1.6T

~230.4 Tb/s

全面迈入 3nm 工艺和 CPO(光电共封装)​ 时代,剑指百万 GPU 集群互联。

(注:QM9700 带板载子网管理器,适合中小型集群开箱即用;QM9790 无带外管理,适合大型数据中心通过 UFM 统一管控。)


Quantum 凭什么“吊打”传统以太网?

在超大规模 AI 训练中,GPU 最怕的不是计算,而是“等数据”。Quantum 系列之所以能成为行业标准,核心在于它解决了传统以太网无法解决的三个致命痛点:延迟太高、多租户互相干扰、集体通信(All-Reduce)太慢

它主要通过以下五大“黑科技”构筑了极深的护城河:

1. 网内计算 (In-Network Computing / SHARP)

这是英伟达压箱底的绝活,也是 Quantum 系列的灵魂。

  • 传统网络:GPU 算完梯度后,需要把数据发给 CPU 或其他 GPU 进行汇总平均,占用大量PCIe带宽和计算资源。

  • Quantum 的做法:直接在交换机芯片内部集成了计算引擎(SHARP 技术)。当数据经过交换机时,交换机顺手就把加法和乘法给做了。这直接释放了宝贵的 GPU 算力,让 AI 训练时间呈指数级缩短。

2. 硬件级性能隔离 (Performance Isolation)

在公有云或多租户的 AI 训练环境中,经常会遇到“吵闹的邻居(Noisy Neighbor)”——隔壁租户的突发流量导致的训练任务网络抖动。

  • Quantum 的解法:通过先进的主动监控和基于遥测的拥塞控制,Quantum 能够在硬件层面将不同租户的流量隔离开来。无论邻居怎么疯狂传输,的任务依然能享受到像“专线”一样的稳定低延迟。

3. 网络自愈 (Self-Healing)

AI 集群规模越大,光模块或线缆发生故障的概率就越高。传统网络在断链后需要依赖上层软件重新收敛路由,耗时几十秒甚至分钟级。

  • Quantum 的解法:凭借硬件级的自愈机制,一旦检测到链路故障,交换机 ASIC 能在毫秒级甚至微秒级自动切换流量路径。这种“无缝容灾”确保了昂贵的 GPU 不会因为一次网络闪断而全员罢工。

4. 自适应路由 (Adaptive Routing)

在胖树(Fat-Tree)拓扑中,静态路由很容易导致某几条主干链路拥堵。

  • Quantum 的解法:实时监测全网链路的拥塞情况,动态调整数据包的转发路径,确保每一丁点带宽都被压榨殆尽,杜绝“热点链路”。

5. 光电一体化封装 (CPO) —— 突破物理极限的终极武器

当单芯片速率迈向 1.6T 甚至更高时,传统可插拔光模块的电信号衰减和发热量会成为机器的“致命杀手”。

  • Quantum-X 的解法:在最新的 Quantum-X800 及未来的 X1600 平台上,英伟达直接将硅光引擎和交换 ASIC 封装在同一个基板上(CPO技术)。这不仅让信号完整性飙升,还将功耗暴降,整机可靠性提升了 10 倍以上,为未来跨机房连接百万 GPU 的“AI 超级工厂”铺平了道路。

Spectrum 系列:

如果说英伟达的 Quantum(InfiniBand)系列是专为 HPC 和 AI 大模型训练打造的“特种兵”,那么 Spectrum(Ethernet)系列​ 就是活跃在云数据中心、企业网以及新兴 AI 以太网集群里的“多面手”

在过去,以太网虽然生态庞大、成本低廉,但因其“尽力而为”的天性,在 AI 集群中容易出现拥塞和丢包,导致 GPU 算力空转。为了打破这一僵局,英伟达通过 Spectrum 系列,把 InfiniBand 的高级特性(如无损传输、精准拥塞控制)“降维”移植到了以太网上,打造出了专为 AI 和云原生时代优化的“加速以太网”

为了让您一目了然,我将从代次演进核心黑科技以及实战选型三个维度为您深度拆解。


Spectrum 系列代次演进(全面加速史)

英伟达(收购 Mellanox 后)的 Spectrum 系列严格遵循着“带宽每代翻倍”的摩尔定律,从早期的云数据中心主力,一路狂飙成为如今 AI 工厂的神经网络。

代次 / 平台

核心芯片 / 交换机

发布时间

单芯片带宽

最大端口配置

灵魂技术突破

Gen 1 / Spectrum-1

SN2000 系列

约 2016-2017年

3.2T

32x 100G

首次将全共享数据包缓冲区架构引入以太网,打下低延迟基础。

Gen 2 / Spectrum-2

SN3000 系列

2019年

6.4T

64x 100G

强化 VXLAN 等 Overlay 协议处理,成为云级脊叶架构的主力。

Gen 3 / Spectrum-3

SN4000 系列

2020年 (GTC)

12.8T

32x 400G

引入 50G PAM4,专为云级网络和分布式存储打造。

Gen 4 / Spectrum-4

SN5000 系列

2022年 (GTC)

51.2T

64x 800G

AI 以太网里程碑!​ 全球首个专为 AI 打造的以太网平台,零接触加速 RoCE。

Gen 5 / Spectrum-5

SN5000 / SN6000

约 2024年

51.2T / 102.4T

64x 800G / 128x 800G

采用台积电 CoWoS-S 封装,进一步提升 AI 云多租户性能和缓存能力。

Gen 6 / Spectrum-6

SN6000 系列

2025/2026年 (GTC)

102.4T

128x 800G

引入 200G PAM4 SerDes,光电一体化封装 (CPO) 登场,直击百万 GPU 集群。

(注:英伟达近期重磅推出了 Spectrum-X​ 品牌,它不仅是单颗芯片,而是包含 Switch ASIC、SuperNIC 网卡和软件的端到端优化平台。)


Spectrum 凭什么被称为“加速以太网”?

传统的以太网就像一辆没有交通规则的破旧巴士,人满为患、走走停停;而英伟达的 Spectrum 则像是一条带有智能交通调度系统的高速磁悬浮。它的核心壁垒在于以下四大“黑科技”:

1. 零接触加速 RoCE (RDMA over Converged Ethernet)

在传统的 TCP/IP 网络中,数据传输需要经过操作系统内核,极度消耗 CPU 算力且延迟高。

  • Spectrum 的解法:通过硬件级优化,实现了对 RoCE 协议的“零接触”加速。数据可以直接绕过 CPU,在网卡和交换机之间高速穿梭。结合 BlueField DPU 或 ConnectX SuperNIC,真正实现了端到端无损传输

2. 包级自适应路由 (Packet-level Adaptive Routing)

AI 训练(如 All-to-All 或 All-Reduce 操作)会产生极少数的巨型“象流(Elephant Flows)”,传统以太网的静态路由极易导致某几条链路拥堵。

  • Spectrum 的解法:它打破了传统的静态哈希路由,能够实时监测全网负载,将一个数据流拆分成多个数据包,通过不同的空闲路径“喷射”出去,最后在接收端由网卡进行乱序重排。这让网络带宽利用率从传统的 60% 飙升到 95% 以上

3. 硬件级性能隔离 (Performance Isolation)

在公有云或多租户的 AI 环境中,“吵闹的邻居”是致命伤。

  • Spectrum 的解法:通过先进的主动监控和基于遥测的拥塞控制,Spectrum 能够在硬件层面将不同租户的流量严格隔离开来。无论邻居的 AI 任务多么吃带宽,您的任务依然能享受到专线般的稳定低延迟。

4. 打破物理极限的 CPO (光电共封装技术)

当单芯片速率迈向 102.4T (Spectrum-6) 时,传统可插拔光模块的电信号衰减和发热量会成为机器的“致命杀手”。

  • Spectrum 的解法:在最新的 Spectrum-6 SN6000 系列中,英伟达直接将硅光引擎和交换 ASIC 封装在同一个基板上(CPO技术)。这不仅让信号完整性飙升,还将功耗暴降了 5 倍,整机可靠性提升了 10 倍,为跨机房连接百万 GPU 的“AI 超级工厂”铺平了道路。

两大交换芯片系列:代次演进与横向对比

在AI算力集群的牌桌上,英伟达(NVIDIA)不仅靠GPU“算得快”,更靠着两把“传得快”的利器——Spectrum(以太网)Quantum(InfiniBand)——统治了现代数据中心的网络层。

简单来说,如果Quantum是专为万亿参数大模型量身定制的“特种兵”,那么Spectrum就是活跃在云原生和AI以太网集群里的“多面手”。

Spectrum vs. Quantum 横向硬核对比

这两大系列在底层技术上共享了不少“黑科技”(如自适应路由、网络自愈),但由于所处的生态位不同,它们的核心卖点和适用场景有着本质区别:

对比维度

Spectrum 系列 (以太网)

Quantum 系列 (InfiniBand)

核心 Slogan

极具性价比的 AI 加速以太网

极致低延迟的 HPC/AI 训练底座

主攻战场

企业数据中心、多云环境、AI 公有云 (MaaS)

国家级超算中心、千亿/万亿参数大模型训练

灵魂技能

端到端 RoCE 优化:通过 Spectrum 交换机与 ConnectX 网卡的协同,在以太网上实现无损传输和强大的拥塞控制。

网内计算 (SHARP):直接在交换机芯片内做数据聚合计算,彻底释放 GPU 算力。

生态与兼容性

极高:兼容现有的全部以太网基础设施、TCP/IP 协议栈和云原生工具链。

封闭但极致:需要专用的 Subnet Manager (UFM),与现有以太网设备不互通。

扩展性与容灾

强依赖传统 IP 路由协议,规模受限但通过 CPO 技术正向百万 GPU 迈进。

天生支持 Dragonfly+ 等高级拓扑,3 跳即可扩展至 100 万节点,自带微秒级网络自愈。

典型客户画像

云服务商 (AWS/Azure/阿里云)、需要兼顾传统业务与 AI 的大型企业。

OpenAI、Anthropic 等追求 AGI 极致性能的“炼丹”大厂。

代次演进与横向对比总览


系列 代次 单芯片/系统带宽 端口速率 核心创新
Spectrum Spectrum-4 51.2 Tb/s 800 Gb/s 为 AI 优化的以太网平台 (Spectrum-X)
Spectrum-X (CPO) 409.6 Tb/s (系统级) 800 Gb/s CPO 技术,实现极致能效与密度
Quantum Quantum-2 51.2 Tb/s 400 Gb/s 成熟的 400G InfiniBand,支持 SHARP
Quantum-X 115.2 Tb/s 800 Gb/s CPO 技术,为百万 GPU 集群而生

怎么看这个表格?我们可以从以下四个维度来深度解读这份对比:

1. 战略维度:从“二选一”到“双轨并行”

过去,人们常争论“以太网 vs InfiniBand”谁会是未来。但这份对比显示,NVIDIA 已经不再做单选题,而是通过双轨制覆盖了 AI 的全生命周期:

  • Spectrum (以太网) 是“普及者”:它的任务是把 AI 网络门槛降下来。通过 Spectrum-X 平台,NVIDIA 强行给标准以太网“补课”(加入无损传输、拥塞控制),让那些不想被 InfiniBand 封闭生态绑定的云厂商(如微软、甲骨文等)也能搭建高性能 AI 集群。
  • Quantum (InfiniBand) 是“天花板”:它的任务是守住性能的极限。对于像 GPT-5、GPT-6 这种万亿参数模型的训练,只有 Quantum 能提供确定性的零丢包和网络内计算(SHARP)。

怎么看: 这不是竞争关系,而是互补关系。Spectrum 负责把 AI 算力铺向千行百业(推理、微调),Quantum 负责在金字塔尖冲击算力极限(预训练)。

2. 技术维度:CPO 是 2026 年的“分水岭”

对比表中,2026 年推出的 Spectrum-X (CPO)Quantum-X (CPO) 是最值得关注的亮点。

  • 物理层面的革命:以前的交换机是“芯片+可插拔光模块”,到了 800G/1.6T 时代,电信号传输损耗太大,功耗太高。CPO 技术直接把光引擎封装在芯片旁边,这是物理形态的根本改变。
  • 数据背后的意义
    • 功耗降低 3.5 倍:这意味着 AI 集群的 PUE(能源效率)将大幅优化,电费成本骤降。
    • 可靠性提升 10 倍:去掉了易坏的光模块插槽,对于拥有百万张显卡的“AI 工厂”来说,维护成本将指数级下降。

怎么看: 2026 年是 CPO 的商用元年。如果你现在规划新的超大规模数据中心,不看 CPO 方案就是落伍。这标志着网络竞争已经从“逻辑协议”下沉到了“物理封装”层面。

3. 商业维度:Spectrum-X 的“95% 吞吐率”是杀手锏

在对比中,Spectrum-X 提到的**“有效吞吐率提升至 95%”**是一个极具商业杀伤力的指标。

  • 痛点解决:传统以太网跑 AI,因为拥塞控制不行,实际利用率往往只有 50%-60%。这意味着你买了一堆 800G 的卡,实际只能当 400G 用。
  • 商业价值:Spectrum-X 通过软硬结合(交换机+BlueField DPU+软件),把以太网利用率拉到了 95%,这直接等同于帮客户省了一半的硬件钱

怎么看: 这是 NVIDIA 对以太网阵营(如博通)的降维打击。它告诉客户:不用非要去挤 InfiniBand 的独木桥,用更便宜的以太网方案,配合 NVIDIA 的优化,也能跑出接近 InfiniBand 的效果。

4. 演进维度:带宽密度的“摩尔定律”

从 Spectrum-4/Quantum-2 的 51.2T,到 Spectrum-X (CPO) 的 409.6T(系统级),短短两三年间,交换密度翻了 8 倍。

  • 百万卡集群的入场券:只有达到这种密度,才能支撑起所谓的“百万 GPU 集群”。如果交换机密度不够,就需要层层级级堆叠更多的交换机,导致网络层级过深,延迟无法忍受。
  • NVLink 的延伸:NVIDIA 正在把机架内的 NVLink 高速互联体验,通过 Spectrum/Quantum 延伸到整个数据中心。

怎么看: 网络已经不再是瓶颈,而是成为了算力的倍增器。未来的 AI 竞争,不仅是 GPU 芯片的竞争,更是谁能把 10 万、100 万张 GPU 连在一起高效工作的竞争。

实际应用中,如何根据业务需求选择?

在 NVIDIA 的“双轨”网络战略下,选择 Spectrum 还是 Quantum,本质上是在做一道关于**“生态兼容性、性能极致度与总体拥有成本”**的权衡题。

这不仅仅是看带宽大小,更要看业务是更依赖“开放的以太网生态”,还是更渴求“极致的无损计算性能”。为了做出最准确的决策,整理了一份选型决策指南

三步走

1.看“业务属性与网络文化” (定性)

这是最根本的分界线,决定了网络基因。

  • 如果是“开放生态与通用计算”派:

    • 场景:一家公有云厂商(如 AWS、Azure)、大型企业 IT 部门,或者运维团队精通以太网,习惯使用 Linux、SONiC 等开源工具。
    • 痛点:需要在一个网络上跑多种业务(AI 训练、推理、Web 服务、存储),不能为了 AI 单独搞一套封闭系统,且对成本敏感。
    • 选择Spectrum 系列 (以太网)
    • 理由:它是**“改良派”**。Spectrum-X 平台通过引入无损以太网技术(RoCE),让标准的以太网也能跑 AI,且兼容现有的运维体系,不会造成“技术孤岛”。
  • 如果是“极致性能与专用计算”派:

    • 场景:要建设国家级超算中心、顶级 AI 实验室,或者专门训练万亿参数大模型(LLM)。
    • 痛点:的业务对延迟丢包是“零容忍”的。哪怕 0.1% 的丢包都会导致昂贵的 GPU 集群效率大幅下降。
    • 选择Quantum 系列 (InfiniBand)
    • 理由:它是**“激进派”**。InfiniBand 天生就是为高性能计算设计的,自带“无损”属性,配合 SHARP 技术(交换机也能做计算),能把网络延迟压到物理极限。
2.看“AI 负载类型” (定量)

AI 训练和推理对网络的需求截然不同。

  • 如果是“大规模 AI 训练” (Training):

    • 需求:成千上万个 GPU 需要频繁同步梯度数据,流量呈现“突发”特性(计算时无流量,同步时流量瞬间打满)。
    • Spectrum-X:适合通用 AI 训练。它通过动态路由解决了以太网的拥塞问题,能将有效吞吐率从传统的 60% 提升到 95%,性价比极高。
    • Quantum-X:适合超大规模/前沿模型训练。当 GPU 数量达到数万甚至百万级时,InfiniBand 的确定性低延迟优势会碾压以太网,确保模型收敛速度最快。
  • 如果是“AI 推理” (Inference) 或 混合负载:

    • 需求:用户请求是随机的,网络需要处理大量的并发小数据包,且可能同时承载数据库查询等其他流量。
    • 选择Spectrum 系列
    • 理由:推理场景更看重通用性和多租户隔离。Spectrum 的多租户性能隔离技术(Multi-tenancy Isolation)能确保一个客户的突发流量不会卡死另一个客户的推理请求。
3.看“物理架构与未来演进” (CPO)

这是 2026 年及以后必须考虑的因素。

  • 如果关注“能效与布线复杂度”:
    • 无论是 Spectrum-X 还是 Quantum-X,NVIDIA 都推出了 CPO (光电共封装) 版本。
    • 如果数据中心规模极大(万卡以上),必须选择 CPO 版本。它能将功耗降低 3.5 倍,可靠性提升 10 倍,这是传统可插拔光模块方案无法比拟的。

终极选型速查表

可以参考下表对号入座:

业务场景 推荐系列 具体型号建议 核心理由
顶级 AI 超算 / 万亿参数大模型训练 Quantum Quantum-X (CPO) 追求极致性能,利用 InfiniBand 的无损特性和 SHARP 网络计算加速,缩短训练周期。
公有云 AI 服务 / 通用企业 AI 平台 Spectrum Spectrum-X 兼容以太网生态,支持多租户隔离,性价比高,能同时处理 AI 和传统业务。
AI 推理集群 / 边缘计算 Spectrum Spectrum-4 / X 推理流量复杂,Spectrum 的灵活性和低延迟足以应对,且部署成本更低。
万卡级以上巨型集群 Quantum / Spectrum CPO 版本 规模达到这个级别,CPO 技术带来的节能和布线简化是刚需,否则电费和维护成本会爆炸。
已有大量以太网设备,想平滑升级 AI Spectrum Spectrum-X 利用现有以太网运维经验,无需重新学习 InfiniBand 技术栈。

个人建议

  • 不要忽视“软件栈”

    • 选择 Spectrum,在选择 SONiC + Linux + RoCE 的开放生态。
    • 选择 Quantum,在选择 NVIDIA 封闭但高效的 InfiniBand 全栈
    • 如果没有 InfiniBand 运维经验,强行上 Quantum 可能会带来管理上的噩梦。
  • 关注“有效吞吐率”

    • 在传统以太网上跑 AI,实际利用率可能只有 50%-60%。Spectrum-X 的核心价值在于通过端到端优化(交换机+DPU+软件),把这个数字拉到了 95%。如果业务对网络抖动敏感,Spectrum-X 是比传统以太网交换机更好的选择。
  • CPO 是分水岭

    • 在 2026 年,如果项目规划是新建超大规模 AI 工厂,直接跳过可插拔光模块,选择 CPO 架构。这不仅是省电的问题,更是为了解决 800G/1.6T 时代信号传输损耗和故障率高的问题。

总结一句话:顶级超算、追求极致速度,闭眼冲 Quantum (InfiniBand);搞公有云、企业网、追求性价比和兼容性,踏实选 Spectrum (以太网)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐