AI 新闻日报 2026-09-14:万级 Agent 编排、多模型路由降本、人形机器人万台产能
主题: 智能体规模化第一次被当成"能力"本身计量——万级 Agent 集群 88 小时跑通千禧年难题证明;具身智能同日跨过"万台产能"门槛,“能造"之后开始比"能干活”
编制时间: 2026-09-14
本期看点: 万级 Agent 编排 / 多模型路由降本 / 人形机器人万台产能
一、要闻速览(Top Stories)
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | OpenAI 用约 1 万个 AI 智能体、88 小时给出纳维–斯托克斯方程奇点证明,并公开 166 页论文与 Lean 验证代码 | AI Coding | 1 万 Agent、88 小时、1300 亿输出 token、Lean 形式化、署名争议 |
| 2 | DeepSeek 被曝将推 3 万亿参数 Code 2.0,设计重点是 Computer Use,窗口在 9 月 | AI Coding | 3 万亿参数、Computer Use、开源、V4.1-Pro、超越 Astra |
| 3 | 多模型编排成为主战场:Sakana Fugu Max / Ultra v2 发布,Cognition Devin Fusion 成为首个上榜的多模型编码 Agent | AI Coding | 编排即产品、$2/$6、便宜 40–60%、便宜 43%、快 31% |
| 4 | 25 位菲尔兹奖得主联名发布《AI 在数学中的严重错位》 | 综合 | 陶哲轩、邓煜、misalignment、发布流程、学术传承 |
| 5 | 英伟达 129.303 亿美元收购 Hugging Face,开放模型分发入口易主 | 综合 | 12.9B、1800 万开发者、平台中立、2027H1 交割 |
| 6 | Skild AI 发布 S1 机器人基础模型:看一段视频学会长程操作 | 具身智能 | 上下文学习、66% vs 9%、1 段视频≈380 次示教、1 亿美元 ARR |
| 7 | 京东 JDD 开源 JoyAI-EchoWM 世界模型,启动"物理 AI 加速计划" | 具身智能 | 可交互世界模型、开源、5 年采购 300 万台、1000 万小时数据 |
| 8 | 高德发布 ABot-Earth 0.7:全球首个 3D 原生城市世界模型 | 具身智能 | 3DGS、消费级单卡 10 分钟、千倍提效、覆盖 196 国 |
| 9 | 优必选柳州万台级工业人形超级工厂投产,每 10 分钟下线 1 台 | 具身智能 | 万台产能、机器人造机器人、联合西门子、面向东盟 |
| 10 | 智元确认启动赴港上市,基石投资人给出 400–500 亿港元目标估值 | 具身智能 | 赴港 IPO、8400 台、全球四成份额、2027 冲百亿营收 |
筛选标准:10 条,其中 AI Coding 3 条、具身智能 5 条、综合生态 2 条;每条均经两个以上独立信源交叉验证,爆料类信息已单独标注可信度。

二、AI Coding 深度动态
1. OpenAI 万级智能体 88 小时攻坚千禧年难题:Agent 规模化第一次成为"能力指标"
事件: 9 月 8 日,OpenAI 发布声明称,一个能力"远超 GPT-6 Astra"的未公开内部模型,组织约 1 万个 AI 智能体并行协作,用 88 小时给出了纳维–斯托克斯方程(Navier–Stokes)存在性与光滑性问题的证明,并同步公开 166 页论文与 Lean 定理证明器的验证代码。该系统 9 月 1 日启动、9 月 5 日得到解答,随后由 GPT-6 Astra 用 17 小时完成 Lean 形式化。
核心数据:
- 并行规模:约 1 万个并发智能体,其中近 100 个先用约 50 小时攻克了"无外力欧拉方程有限时间爆破"这一铺垫性难题,随后资源整体转向纳维–斯托克斯。
- Token 消耗:仅纳维–斯托克斯一项就产生约 270 万条智能体消息、约 1300 亿输出 token;整个项目(含其余千禧年问题)合计约 490 万条消息、3000 亿输出 token。
- 成本口径:团队在发布会上给出的等价商业报价约为 1500 万美元/次任务;OpenAI 明确表示不会申领克雷数学研究所的 100 万美元奖金。
- 证明边界:OpenAI 未证明"无外力解必然光滑",而是选择克雷官方题面的 C、D 情形——构造处处光滑的有限外力,使光滑解无法维持到所有时间。克雷数学研究所目前仍将原问题列为未解决。
值得关注的原因:
- "编排规模"第一次被当作独立的能力维度来宣传。 智能体分组拿到不同题面、可读缓存互联网、可跑代码、可组内交流,再由 Codex 汇总思路并交叉分发。这一批结果的启示是:在前沿推理任务上,把 1 万个平庸流程组织好,可能比换一个更强的单模型更有效——这正是编码 Agent 工程化的外推。
- AI 与科研共同体的冲突被推到台前。 纽约大学数学家 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 早在 8 月 15 日就拿到相近的"带外力欧拉方程"结果并于 8 月 22 日通过 Lean 验证,两人在研究过程中大量使用 Codex 处理草稿与推导;争议点集中在"路径选择是否被训练数据/会话记录影响"以及署名安排上,OpenAI 承认"无法完全排除"产品数据间接参与训练。
- 这给企业侧一个现实参照。 单次任务的 token 与消息量级,意味着"多智能体并行攻坚"目前仍是百万美元级操作;真正能落地的是把同一套编排范式缩到代码仓库规模——这也解释了本周三家工具厂商为何同时把"多模型路由"写进路线图。
2. DeepSeek 被曝将推 3 万亿参数 Code 2.0:主攻 Computer Use
事件: 9 月 13–14 日,多家媒体转述爆料称,DeepSeek 即将发布名为 Code 2.0 的模型,发布窗口在 9 月内,预计性能将击败当前两个前沿级模型 Mythos 5.1 与 GPT-6 Astra,并继续保持开源开放。
核心参数(爆料口径):
- 参数规模 3 万亿以上。作为参照:Kimi K3 为 2.8 万亿、Qwen 3.8 Max 为 2.4 万亿、DeepSeek 自家 V4 Pro 为 1.6 万亿。
- 设计重点是 Computer Use(电脑控制),即让 AI 替代人操作电脑完成大量工作——Astra 目前最令人惊讶的能力也多来自这一方向。
- 产品线分工:Pro 系列新品已确定为 V4.1-Pro(升级细节未公布),V4.1-Flash 面向通用 Agent 任务,Code 2.0 作为偏代码/逻辑的旗舰。
- 落地节奏:DeepSeek 本周发布的 V4.1-Flash(552B MoE、Causal Encoder-Decoder 非对称结构、输入激活 8B/输出激活 16B、KV Cache 压缩 75%)已在 9 月 14 日完成全量路由,并接入 OpenCode Go 订阅;官方同时宣布 9 月 14 日之后继续提供 V4 Pro 的 API 调用服务。
值得关注的原因:
- "开源 + 旗舰参数 + Computer Use"是一个此前没有出现过的组合。开源阵营过去主要在推理与代码上追赶,Computer Use 需要长程状态保持与屏幕理解,对上下文与工具调用稳定性的要求远高于普通对话;如果 Code 2.0 真按此定位落地,国产开源模型将第一次在前沿 Agent 能力上正面对标闭源旗舰。
- 可信度需要打折看。 该信息目前仅有媒体转述的爆料来源,DeepSeek 官方未确认;历史上带"Code"名字的 DeepSeek 模型表现平平,且 V4 Pro-0813 正式版反馈不及预期。可作为观察项而非事实。
- 对国内 AI Coding 生态的连锁影响值得预判:一旦 3 万亿级开源权重放出,Cursor / Claude Code / Codex 等工具的中文用户会立刻要求接入,模型路由市场会再洗一轮牌。
3. 多模型编排成了主战场:从"选一个最强模型"到"编排一段最便宜的工作流"
事件(两条同日发酵的动态):
- Sakana AI 于 9 月 10–11 日发布 Fugu Max 与 Fugu Ultra v2——它们不是传统意义上的模型,而是"编排引擎":把请求拆解后路由到背后的模型池,再拼回一个答案,对外只暴露一个 OpenAI 兼容端点。
- Cognition 的 Devin Fusion 成为 Artificial Analysis Coding Agent Index 上首个多模型编码 Agent:主模型跑 Claude Fable 5.1(xhigh)或 GPT-6 Astra(xhigh),副驾为 SWE-2(medium)。
核心参数:
| 项目 | Fugu Max | Fugu Ultra v2 |
|---|---|---|
| 输入 / 输出价格(每百万 token) | $2 / $6(缓存 $0.25) | $5 / $30(超 272K 上下文翻倍) |
| 相对成本 | 比 Sonnet 5 / GPT-5.6 Terra / Kimi K3 低 40–60% | 与 v1 持平 |
| 模型池 | 规模最大,含 NVIDIA Nemotron 家族 | 明确排除 Fable 5、Fable 5.1、GPT-6 Astra |
| 架构 | TRINITY(~0.6B 协调器,分 Thinker / Worker / Verifier)+ Conductor(7B RL,可递归自调用) | 同架构,新增视觉输入、function calling、结构化输出 |
关键数据: Fugu Max 在 10 项自研/公开基准中拿下 6 项第一(含 Terminal-Bench 2.1、GPQA Diamond),并在 7 项上拓展了成本–性能帕累托前沿;Devin Fusion 的两套配置得分 62(Fable 5.1 主)与 59(Astra 主),Astra 配置便宜 43%、快 31%。
值得关注的原因:
- 竞争焦点从"单模型谁最强"转向"编排系统能否用最低成本交付旗舰级结果"。 GitHub 的 HydraFusion、微软 HyDRA 打分器、Sakana 的 TRINITY、Cognition 的旗舰+副驾,本质是同一件事的四种实现;当旗舰与"够用"的能力差被压缩,路由层的议价能力就上来了。
- Sakana 的路线带有明确的"去依赖"意图。 Ultra v2 主动把 Fable 5.1 与 GPT-6 Astra 移出模型池,宣示"前沿可以由一群开放/专用模型协同构成"。在欧盟不可用、无权重可自托管、路由过程不透明——这三条限制决定了它现在更适合作为成本对照,而不是关键业务底座。
- 对团队的直接动作项:先测"每个成功任务的实际成本"而不是标价。编排系统一次答案可能烧掉多个模型的 token,标价便宜不等于总账便宜。
三、具身智能深度动态
4. Skild AI 发布 S1:看一段视频就能学会长程操作,并交出 1 亿美元 ARR
事件: 9 月 10 日,匹兹堡机器人公司 Skild AI(2023 年由 CMU 教授 Deepak Pathak、Abhinav Gupta 创立)发布机器人基础模型 S1,基于英伟达 Physical AI 栈训练,核心能力是仅凭一段人类演示视频学会训练集中从未出现过的长程任务,不更新权重、不做任务后训练。
核心能力:
- 上下文学习(in-context learning):从录屏到硬件自主执行最快 11 分钟;官方称 1 段视频的示范价值约等于 380 次人工遥操作采集。
- 成功率对照:未见任务上每步成功率约 66%,语言提示的 VLA 基线仅 9%(相差 7 倍以上);10 万小时预训练数据下,已见任务 ICL 96%、语言提示 89%。数据量低时语言提示反而更好,规模上来后 ICL 才反超——这是一条很关键的缩放曲线。
- 任务长度:单任务最长约 10 分钟(换盆、煎饼、冲咖啡),已在富士康基于 Blackwell 的产线上完成双臂母线/限位块装配、拧 16 颗螺丝并中途适应物理扰动。
- 商业化:首次商业部署后约 10 个月达到 1 亿美元年营收运行率,已建立 60 余家部署合作,覆盖制造、物流、巡检、安防与食品加工;公司累计融资超 20 亿美元(含软银领投 14 亿美元 C 轮,投后估值 140 亿美元)。
值得关注的原因:
- 它动的是"每上一个新任务就要重新采数据"的成本结构。 遥操作数据采集是学习型机器人最大的隐性成本之一;如果 380:1 的样本效率在非演示场景下站得住,那么"值得自动化的任务清单"会被直接改写。
- "一次示范即部署"正在成为共同方向。 同一周里 Generalist AI 的 GEN-1.5 与 RoboTTT 也分别在单次示范适应、上下文长度扩展上给出结果,说明行业已经从"比谁发模型"转向"比谁在真实工位跑通"。
- 英伟达的物理 AI 栈拿到了最好的样板间。 合成数据(Cosmos)、仿真训练(Isaac Lab / Newton)、部署优化(TensorRT)四段全包,硬件+软件+客户案例一起成立,这会进一步抬高具身模型创业的门槛。
5. 京东 JDD 开源 JoyAI-EchoWM,并启动"物理 AI 加速计划":一条覆盖机器人全生命周期的链条
事件: 9 月 11–13 日,京东在 JDD 大会发布并开源 JoyAI-EchoWM 世界模型,同时宣布启动"物理 AI 加速计划",配套六项"全球领先"目标。
产品细节:
- JoyAI-EchoWM:实时可交互世界模型,在同一框架内联合生成 720p 视频与环境音、音乐、语音,并实时响应用户操作;采用统一的"相机意图"表示,把离散键盘操作映射为连续的 6-DoF 轨迹,第一人称与第三人称视角共用同一套控制接口;通过持续缓存支持多轮继续(代码开源于 GitHub
jd-opensource/JoyAI-Echo)。 - JoyAI 基础模型矩阵:覆盖多模态模型、世界模型与具身模型三条线。
"物理 AI 加速计划"六项:
- 建成具身智能数据采集中心,两年内采集超 1000 万小时真实场景视频数据(首批数据已对外开放,超 8 个国家、上百所高校与科研机构申请使用);
- 未来 5 年在全国布局80 余个 RoboBase 机器人产业基地,首个已在广州开工;
- 发起"机器人零部件产业发展联盟",3 年内助力 100 家本体厂商降本、100 家零部件供应商业绩倍增;
- 2028 年前投入百亿零售资源,助力 100 个品牌独立销售额破 10 亿元;
- 京东物流 5 年内采购 300 万台机器人等设备;
- 京东物流构建国内 8 大机器人维修中心,5 年售后覆盖 100 多个国家,创造超 10 万个机器人售后工程师岗位。
值得关注的原因:
- 叙事从"造本体"切到"数据 + 渠道 + 售后"。 数据(1000 万小时)、基地(80+)、零部件(产业联盟)、零售(百亿资源)、采购(300 万台)、维修(8 大中心)——这条链上本体只是一个环节,京东押的是机器人行业的"基础设施 + 分销"位置,而不是硬件毛利。
- "环境音 + 语音"进入世界模型是有辨识度的选择。 此前世界模型多生成静音视觉轨迹或绑定特定游戏动作空间;把声音纳入"可继续的世界",对需要脚步、碰撞、环境声同时变化的真实导航场景更有意义。
- 要留意边界。 该模型的交互目前主要是相机导航,不含任意角色动作、游戏规则或确定碰撞,也没有持久 3D 记忆;"enterable"的宣传词与证据支撑之间仍有距离。
6. 高德发布 ABot-Earth 0.7:把"看地图"变成"进地图"
事件: 9 月 10 日,高德发布全球首个"全模态、可预测、3D 原生"城市世界模型 ABot-Earth 0.7,同日上线依托该模型的飞行街景 2.0。
核心能力:
- 3D 原生而非 2D 蒸馏:不走"从 2D 图像蒸馏 3D 结构"的传统路径,而是直接用海量 3DGS(三维高斯泼溅)数据训练;首创在 3DGS 表示上直接操作的压缩–生成框架,解决了 3DGS 无法直接用于训练的问题。
- 效率与成本:从一张卫星图或一段文字出发,单块消费级 GPU 约 10 分钟生成公里级 3D 城市场景,相当于多卡集群数小时的工作量——以约百分之一的成本实现千倍提效。
- 可用性:输出为可编辑的 3DGS 格式,可直接导入 Unity、Unreal 等主流引擎;同一套模型覆盖从星球、城市到街景地标的连续尺度,已覆盖 196 个以上国家和地区。
- 落地:飞行街景 2.0 支持用户自由调整位置、角度与高度(购票前先看座位真实视野);扫街榜用户 8.8 亿、260 万商家入驻、年度导航到店里程 366 亿公里、单周最高 7500 万公里(吉尼斯纪录);智能眼镜、手表、电动车与车机相继接入"扫街榜 Inside",奔驰为首个汽车合作伙伴。
值得关注的原因:
- 与谷歌 Genie、英伟达 Cosmos 的路线差异很清晰:前者聚焦虚拟环境生成,高德以真实世界时空数据为底座,把地图从"连接世界"升级为"理解世界"。
- "真实数据闭环"是它最难被复制的地方:近 10 亿月活、近万亿次北斗定位调用峰值,每一次导航、避堵、纠错都回流成时空样本,直接喂养世界模型。这是纯模型公司拿不到的资产。
- 它同时是具身智能的入口。 高德的规划是把世界模型 + 导航模型 + 操作模型组合成具身智能基座——机器人理解车流、人流、楼层空间关系需要的前置能力,与手机端是同一套。
7. 优必选柳州万台级工业人形超级工厂投产:具身智能从"千台量产"迈入"万台产能"
事件: 9 月 12 日,柳州优必选万台级工业人形机器人超级智慧工厂投产(广西首个"用机器人造机器人"闭环工厂)。
核心参数: 占地 1.4 万平方米、楼高 13.8 米;主要生产 Walker S 系列与 Cruzr 系列;产线节拍每 10 分钟下线 1 台,年规划产能超万台;优必选联合西门子打造人形机器人专属数字化智造底座,分装与总装线部署自研智能拧紧系统。物料环节由 Cruzr 系列承担拆垛、码垛、上料、搬运,总装采用协作机器人 + 助力机械手 + 无人物流车 + 360° 旋转工装台。时间线上,2025 年 6 月广西首台工业人形机器人在柳州车企下线,半年后 1000 台量产,如今跨到万台产能。同期优必选还以 1.508 亿元中标乐山商用服务人形机器人项目。
值得关注的原因: 万台产能意味着工业人形机器人的竞争开始从"能不能造出来"转向"能不能稳定完成高价值工作",真实工位持续沉淀的具身数据将成为下一阶段的护城河;柳州"北上广研发 + 广西集成 + 东盟应用"的路径也给出了一个可复制的区域产业样本。
8. 智元确认启动赴港上市:上半年出货 8400 台,拿下全球四成份额
事件: 9 月 12 日,智元机器人确认已启动赴港上市流程;据《财经》报道,基石投资人给出的目标估值区间为 400 亿至 500 亿港元。同期智元在全国 20 多所高校启动大规模校招(9 月 7 日首站电子科技大学,为两位创始人邓泰华、彭志辉的母校)。
关键数据: 一季度营收 10 亿元(追平去年全年),2027 年目标收入破百亿;今年 3 月下线刚过万台,6 月累计达 1.5 万台;上半年出货 8400 台、占全球约四成份额并反超宇树。产品线覆盖远征、灵犀、精灵、商清、酷拓;已控股上市公司上纬新材(21 亿元取得 63.6% 股权,其市值从 31 亿元升至 565 亿元),孵化租赁平台擎天租(估值约 70 亿元)。创始人给出 X/Y/Z 三条曲线:2022–2025 开发尝鲜期、2026–2030 部署成长期(万台部署、百亿营收)、2030 之后部署普及期(千亿营收)。
值得关注的原因: 与宇树上市后市值从高点腰斩形成对照,赛道估值逻辑正在从"看概念、看 Demo"转向"看出货、看工业落地、看回款";智元能否上市、以及一级市场对"低复杂度场景量级增长"的兑现节奏,会是接下来两个月的关键观察点。

四、产业趋势总结
- "编排规模"成为独立的能力维度:从单模型跑分到组织 1 万个 Agent 分头攻坚,Agent 系统的组织能力本身开始被当作可宣传、可比较的指标。
- 成本–质量帕累托前沿取代单点跑分:Sakana 的 $2/$6、Devin Fusion 的"旗舰 + 低价副驾"、GitHub 的 HyDRA 打分,都指向同一判断——未来竞争在路由层,不在模型层。
- AI 与科学共同体的"错位"浮出水面:发布流程、署名归属、训练数据来源三条质疑,从数学界开始,会依次传导到其他学科与创意行业。
- 开放模型的分发入口被资本重新定价:英伟达以 129 亿美元买下 Hugging Face,"平台中立"的承诺能否顶住商业激励,将决定开源生态 2027 年之后的形状。
- 具身智能"能造"之后开始比"能干活":万台产能、66% 的未见任务成功率、1000 万小时数据池——供给端的三个瓶颈同时被推高,接下来比的是稳定完成高价值工作的能力。
- 世界模型成为物理 AI 的公共底座:京东(数据 + 渠道)、高德(真实时空)、Skild(英伟达栈)、魔芯(国产 NPU)从四个不同入口指向同一个判断——世界模型是具身智能的基础设施,而中国的差异化优势在场景与国产算力。
五、值得持续关注的信号
- DeepSeek Code 2.0 是否真的在 9 月发布、参数量与开源许可是否如爆料所述——目前仅有媒体转述,官方未确认,需等正式发布交叉验证;
- OpenAI 与数学界的优先权争议 后续走向,以及克雷数学研究所是否会对 C、D 情形的证明作出正式表态;OpenAI 计划 9 月 29 日 DevDay 上线的 Managed Agents,与本次万级 Agent 编排很可能同源;
- Anthropic 的 IPO 进程:据路透报道其拟募资最高 1000 亿美元、估值或达约 2 万亿美元,英伟达考虑作为基石投资者投资最多 100 亿美元,并计划在 11 月美国中期选举前完成上市;
- Sakana Fugu 系列的限制条件(欧盟不可用、无权重、路由不透明)是否松动,以及是否会引发 Anthropic / OpenAI 把路由层收进自家产品;
- Skild AI S1 的 380:1 样本效率能否在非演示、开放工况下复现——这是具身模型从"实验室结果"变成"可下单系统"的分水岭;
- 魔芯科技新一轮融资(或达 10 亿元、估值近 100 亿元,一个月内估值涨约 2.5 倍)与 MoWorld 4D(全国产 NPU、50fps、推理成本较同规模 GPU 方案降约 70%)的产业化落地节奏;
- AI 助手入口之争:谷歌已推出 Windows 桌面应用(Alt+Space 唤起 + Gemini Spark 24/7 个人 Agent,9 月 10 日上线),微软 Copilot 与 ChatGPT / Claude 桌面端的竞争会直接决定"下一代工作入口"归谁。
本日报基于公开报道整理,仅供参考。爆料类信息已在正文标注可信度,不作为事实陈述。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)