“十万卡”,曾经是 AI 算力竞赛最直接的答案。

当这个数字在 WAIC 成真,旧问题似乎得到回答,可新的追问又随之出现。

卡越来越多,真正能够被调用的算力有多少?大模型训练结束后,这些算力会被什么任务持续消耗?当 Agent、机器人持续调用算力,量子计算也接入现有算力体系,每一次计算能换回多少可以交付的结果?

答案没有集中在某个展台。

它散落在十万卡集群与超节点里,藏在 Agent 连续调用模型和软件的任务链中,也出现在机器人每一次感知、决策和行动之间。而在另一边,量子计算机在融入算力中心,企业谈论算力时,也越来越频繁地提到 Token 成本、任务完成率、客户订单和商业回报。

今年 WAIC 评出了 10 件镇馆之宝,横跨算力集群、智能体和机器人,幕后的低调运行,与台前的精彩纷呈交织在一起,回答的是同一组问题:算力该如何被组织,如何被持续使用,又该如何证明自己的价值。

三个变化,由此浮现。

图片

01

让“十万卡”变成一台机器

过去几年,AI 算力竞争很容易被压缩成几组数字:制程、单卡性能、芯片数量、模型参数。进入万卡、十万卡阶段后,这套评价方式越来越难以单独解释真实能力。

华为昇腾 950 超节点、沐曦股份新一代 AI 超节点产品曦景 S600、首个全国产十万卡 AI 超集群“曙光 8000”等在本届 WAIC 集中亮相,释放出的信号简单粗暴:大规模算力竞争的基本单位,正在从一张卡转向一整套计算系统。

图片

曦景 S600

十万张卡可以累加出庞大的理论峰值,但无法自动生成同等规模的有效算力,芯片互联、数据传输、存储读写、资源调度、故障恢复和软件适配,都会影响最终产出。抵达这一阶段,真正的门槛,是让分散的处理器像一台机器那样稳定工作。

把更多同类芯片连接成一台机器,只是算力系统化的一条路径,另一条路径则是:让不同类型的计算资源进入同一套基础设施,根据任务特点协同工作。

7 月 18 日,中器无量在 WAIC 正式发布算力中心级中性原子量子计算机“清河一号”,并在世博展览馆主展区同步展示大规模容错量子计算系统架构与核心光镊技术。作为全球领先的面向算力中心设计的可部署量子计算机,尤为值得关注的是它对自身产品形态的定义:“清河一号”面向算力中心进行标准机柜集成设计,可直接部署于现有计算集群,与 CPU、GPU 等经典算力进行统一调度与协同计算。

图片

“清河一号”发布现场

图片

中器无量展台

与过去强调独立运行的实验型装置相比,“清河一号”试图按照算力中心的规则设计自己,把量子处理器变成异构计算系统中的一种专用节点,算力系统的扩张由此出现两种方向:向横向扩展,通过更多同类处理器形成超节点和大型集群;向异构扩展,把通用计算、智能计算和量子计算纳入同一套资源体系。

WAIC 上,数据港、思朗科技和玻色量子的量超智融合创新平台,把这种异构扩展向基础设施与服务层又推进了一步。平台依托数据港的算力底座,结合思朗科技的科学智能能力和玻色量子的专用量子计算机,尝试打通算力硬件、工具算法、平台服务与行业应用,推动多元算力统一接入、协同调度和场景适配。

图片

量超智融合平台

“清河一号”展示的是量子计算机如何成为算力节点,三方平台尝试回答的,则是多种算力进入基础设施后,如何接入、调度并形成可调用的服务。

从十万卡集群到量超融合,本届 WAIC 呈现出的算力竞争已经扩展到系统能力,互联、存储、调度、软件、基础设施和异构协同,正在共同决定一套算力系统能够完成什么任务。

02

训练结束,算力没有下班

当把分散的芯片组织成一套系统,系统能力又与另一项变化相互成就:模型训练完成后,算力还要在应用端持续工作。

大模型训练是一种高度集中的算力负载。企业在一段时间内投入大量计算资源,完成预训练、后训练和模型更新。在传统问答模式下,应用端的计算通常由一次提问触发,模型给出回答,一轮调用随之结束。

Agent 正在改写这一结构。

我们以入选本届 WAIC 十大镇馆之宝的百度“搭子”为例,当用户提出制作一份竞品分析报告的需求后,系统随即自主拆解任务、检索信息并生成文档,全程无需人工干预,其公开的产品能力还包括工具调用、跨应用与跨文件协作,并协同执行搜索研究、数据分析和 PPT 生成等任务。

图片

WAIC 十大镇馆之宝之:百度搭子

用户看到的只是一份报告,算力处理的却是一条更长的任务链。理解目标、拆解步骤、调用工具、检索资料、处理文件和结果生成,都可能带来新的模型推理与数据访问,计算不再围绕一次回答展开,而是围绕一个业务目标连续运转。

京东 JoyAI 模型则展示了另一种变化。

实时视频编辑模型 JoyAI-Video-Edit,支持自定义画面,用户可以边预览边修改,视频剪辑更加实时和灵活;实时语音交互模型 JoyAI-Talker,面向低延迟的实时语音交互,具备情绪理解、工具调用和记忆等能力。今年以来,京东已经发布 7 个具备全球领先水平的基础模型,能力指向持续感知、实时交互与动作执行等。

图片

JoyAI:图源网络

在这类计算场景中,只要任务仍在推进、视频流仍在变化或机器人仍在行动,模型就要保持观察、判断和响应,算力的工作时间随之拉长,从一次调用扩展为持续运行的服务过程。

机器人又把这种变化带进物理世界。

本届 WAIC 汇集了百余家具身智能企业,部分展台以跳舞、踢球及多种互动表演吸引观众,另一些企业则把货架取物、超薄钣金件装配等真实操作任务搬到了现场。与固定动作相比,这类任务要求机器人识别目标、理解指令、规划动作,并在环境发生变化时及时调整。

聊天模型响应慢几秒,影响的多为使用体验,可机器人进入货架、产线和服务现场后,延迟、错误和系统中断会直接影响任务能否完成。算力不仅需要长期保持稳定,还要让模型、终端、数据系统和云基础设施共同工作,这就是本届 WAIC 物理 AI 案例强调“闭环”的原因。

Agent 让算力进入业务流程,机器人让算力参与物理行动,它们把训练之后的计算链条大幅拉长。集中训练仍在上游持续发生,应用端又增加了数量庞大、反复调用并要求即时响应的推理与控制任务,算力竞争由此增加了一道新的考题:模型被训练出来后,系统能否以可承受的成本,长期稳定地让它工作起来。

03

向每一次计算要结果

模型训练完成后,算力仍要围绕 Agent、机器人和智能终端持续工作,在计算从阶段性任务转变成长期运行的服务后,另一组问题随之进入前台:这些算力究竟生产了什么,完成一项任务需要多少成本,计算结果能否达到交付标准。

本届 WAIC 上频现的“Token”,正是这种变化最直接的体现。

图片

场内随机捕获“Token”

是石科技在 WAIC 上发布“国产 Taken 优化工厂”,现场展示平均 TPM(每分钟 Token 数)、TTFT(首字延迟)等关键指标,观众可以比较模型优化前后的运行效果;无问芯穹披露其“Taken 工厂” Agentic MaaS 平台的日均 Token 调用量较年初增长约 40 倍,过去一年推理成本下降明显。这些源自展台披露的情况反映出一个清晰变化:算力企业开始围绕单位成本能够稳定生产多少有效 Token 展开竞争。

只是,Token 能够计算消耗,却无法独自证明价值。

相同数量的 Token,可能生成一份可直接使用的代码,也可能停留在一段需要重新思考的回答上。因此,当计算真正进入业务后,评价标准还要继续向前一步:任务有没有完成,结果能不能使用,人工需要介入多少,客户是否愿意为它付费。

西门子的 Eigen 工程智能体提供了一个更接近任务交付的案例。公开资料显示,它连接西门子 TIA Portal 工程软件,能够理解具体项目,编写和修改 PLC 代码,配置设备,生成测试逻辑,并围绕既定标准执行检查和修正,已在 19 个国家的 100 多家企业中进行试点或使用,执行速度可达到人工流程的 2-5 倍,工程效率最高提升 50%,整体方案质量最高提升 80%。

这组指标的价值在于,评价对象从模型输出延伸到了工程任务:速度提高多少,结果质量如何,能否直接进入现有工程系统,成为衡量 AI 能力的依据。

从一段代码到一项工业配置,算力开始面对明确的交付标准,算力的评价体系也增加了新的坐标。

图片

卡数说明拥有多少资源,利用率说明其中多少真正处于工作状态;Token 吞吐衡量计算产出,任务完成率检验这些产出是否有效;客户付费、持续使用和复购,则决定这套能力能否长期运转。

AI 正在向每一次计算要结果。

04

算力开始用结果作答

超节点把分散的芯片组织成系统,Agent 和机器人让算力进入持续运行,量子计算机与量超融合则把更多计算类型接入同一套基础设施。这些变化放在一起,WAIC 揭示的信号已经很清楚:算力正被要求从规模走向结果。

  • 系统能否高效协同,决定理论资源中有多少真正可用;

  • 推理能否持续运行,决定 AI 能否进入业务流程和物理世界;

  • 任务能否稳定完成并形成收入,决定这些计算最终能否转化为可持续产出。

下一轮差距,必将体现为一组更现实的指标:集群利用率、单次任务成本、Agent 自主完成任务比例、机器人连续运行时长,以及一套算力系统最终支撑了多少客户、订单和收入。

AI 已经开始追问算力。

下一阶段,算力必须用结果作答。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐