【阅读笔记】超越GPT-6 Astra登顶RoboDojo:成立3个月的Simate与Physical RSI
阅读笔记 · 2026-09-24 | 第 5 篇(本批第 1 篇)| 原文约 7400 字 | 收藏理由:把"AI 造 AI"从数字世界推进到物理世界的完整工程样本
一、亮点速读(一段话看懂这篇)
这篇的主线是一句很硬的判断:RSI(让 AI 参与造下一代 AI)在数字世界已经跑出阶段性数据——Anthropic 自己披露截至今年 8 月内部 26% 的 AI 研发工作由 Claude 主导推进、超过 90% 的研发流程进入"AI 深度协作"阶段——但把它搬到物理世界,账立刻算不过来:软件里改代码几秒就有反馈,机器人一次失败抓取就意味着重新采集数据、动辄数天重训与重新部署。于是问题被重新定义为 Physical RSI:能不能让机器人不再完全依附于工程师的疲劳战术,拥有"自主发现能力瓶颈、主动生成并验证假设、持续迭代自身物理智能"的闭环能力。给出答案样本的是成立仅三个月的初创公司 Simate(Silicon Mate,硅基伙伴)——它的自动研究系统 AutoResearch 登顶了机器人智能评测榜单 RoboDojo,而它走的不是"全自动科学家"路线,而是很务实的"人机共驾的弱 RSI"(Human-in-the-loop):人类研究员守住方向、目标、边界条件与安全物理约束,Agent 负责方案改进、生成代码修改、下发分布式实验、调用评测工具并完成多轮迭代。全文最有工程含量的部分是其底层五件套:可插拔模型底座 SiPAI(一套框架统一支持 WM / WAM / VLA / VLM)、同构 UMI 数据采集体系(明确"不单纯追求小时数",改按时序对齐·轨迹质量·任务覆盖·训练配比四维治理)、真机失败结构化回灌的反馈飞轮、面向数十个 Agent 并行试错的 AI-native Infra,以及"研究谱系 + 运行时间线"的可观察性。最终目标也很聚焦:以 4D 物理感知与记忆为核心,做一个能端侧实时部署的"物理原生快系统",并给出弱 RSI → 强 RSI → 完全自治 RSI 的三阶段路线图。
二、阅读笔记
2.1 开头铺垫:RSI 为什么已经不算小众话题了
作者先给的是一条"共识形成时间线",四个信号:
-
Anthropic 发布引起行业热议的《When AI Builds Itself》;
-
前 Thinking Machines Lab 联合创始人翁荔重回 OpenAI,牵头推进 RSI 相关技术探索;
-
Google 前首席科学家 Jeff Dean 投身相关创新;
-
Anthropic 的自报数据:截至今年 8 月,内部已有 26% 的 AI 研发工作由 Claude 主导推进,超过 90% 的研发流程迈入"AI 深度协作"阶段。
作者的推论很克制:"这似乎意味着,在数字世界中,AI 参与自身改进已经取得了阶段性成果。" 注意这两个"似乎"——这两个百分比都是厂商内部口径,不是可验证指标。
2.2 全文的问题起点:为什么数字世界的结论搬不到物理世界
原文这段对比是理解整篇文章的钥匙:
| 软件 / 数字世界的 AI | 机器人 / 物理世界的 AI | |
|---|---|---|
| 反馈来源 | 代码、实验环境、模拟系统 | 真实环境交互、物理数据采集 |
| 反馈速度 | 快速获得 | 训练→部署→失败分析→再优化,一整圈很慢 |
| 失败代价 | 低(重跑一次) | 高:一次失败的抓取、一个错误的动作规划,都可能意味着重新采集数据,以及动辄数天的大规模模型重训与重新部署 |
| 谁在推动 | 可自动化 | 大量环节仍依赖人类:提出假设、设计实验方案、采集数据、训练、部署测试、分析失败 |
于是真正的瓶颈被点出来:
机器人智能的提升速度,很大程度上受到人类研究效率限制。 当每一次算法改进、数据调整和实验验证都需要研究人员亲自推动时,物理智能的进化周期很难快速缩短。
由此得出全文最重要的那句需求判断:
Physical AI 需要的已经不仅是一个参数量更大、架构更精巧的单点模型,而是一套能够把"做研究"这一行为本身系统化、代码化和自动化的进化框架。
Physical RSI 的定义(原文原话,可直接引用):能否让机器人智能不再完全依附于人类工程师的疲劳战术,拥有自主发现能力瓶颈、主动生成验证假设并持续迭代自身物理智能的闭环能力。
2.3 主角登场:Simate 是谁,做出了什么
| 项 | 内容 |
|---|---|
| 公司名 | Simate = Silicon Mate(硅基伙伴),愿景取自"Silicon evolving with humanity" |
| 成立时间 | 三个月 |
| 创始人 | 张颖,曾任头部自动驾驶公司核心技术负责人,推动一段式端到端智驾方案达到国内领先水平 |
| 核心成果 | AutoResearch 自动研究系统在机器人智能评测榜单 RoboDojo 取得第一名,并通过真机展示记忆、高精度操作、复杂长程执行与泛化能力 |
| 榜单地址 | |
| 官网 | Simate — Intelligence, in motion (可申请试用) |
作者对这件事的定性:这是 Simate 围绕"AI for Physical AI"构建的 Physical RSI 研发体系的一次工程验证,探索的是"人机共驾弱 RSI"的实现路径。
一条来自自动驾驶的背景逻辑值得单独记:自动驾驶是目前最接近大规模真实世界部署的 Physical AI 场景之一,其积累的数据闭环、高频迭代和工程验证经验,正好是探索机器人智能进化的底座。这也是全文为"智驾团队做机器人"提供的合理性论证。
2.4 弱 RSI 的人机分工边界(这套范式真正新在哪里)
原文给出的分工很清楚:
-
人类研究员仍掌握研究方向:提出研究假设、设定目标、划定边界条件与安全物理约束;
-
AutoResearch 负责自动化研究环节:在统一体系内,Agent 自主推进具体的方案改进、生成代码修改、下发分布式实验、调用评测工具并完成多轮反馈迭代。
关键机制:研究不是一串预先写好的死板任务,而是一个根据实验反馈不断调整的动态过程。运转循环是四步:
提出假设 → 规划实验 → 执行验证 → 分析迭代
研究员给出目标与约束,研究 Agent 结合已有知识提出假设、规划实验,通过模型框架修改配置并执行验证,再根据结果决定继续、调整还是终止当前方向。
风险分级的处理是这套范式最"成年人"的地方:低风险、易验证的实验由 Agent 持续推进;遇到高风险或需要资深专业判断的节点,系统主动把方案交回研究者裁决;人类可随时介入并调整约束。原文的口号是"系统持续推进,研究者始终掌握方向"。
作者点出的核心变化:让研究者从大量重复性的实验执行中解放出来,将更多精力投入到问题定义和方向判断,而 AI 成为研究能力的延伸。
2.5 登顶 RoboDojo 为什么算"注脚"而不是"冠军奖杯"
原文对榜单性质的描述很关键——RoboDojo 综合考察:长程规划、空间泛化、记忆、亚毫米级接触精度。
也就是说它考的不是单一任务成功率,而是几项最难的通用能力。作者的结论句是:
在极度依赖物理直觉与工程经验的机器人智能研发中,"做研究"的能力本身同样可以被标准化与自动化运转。
(注意:这是全文真正的论点——榜单验证的对象是"研究流程",不只是"模型"。)
2.6 Physical RSI 的底层基础设施(全文干货密度最高的部分)
作者先给了一句很清醒的警告:自动科研系统要避免沦为"纸上谈兵的代码生成玩具",必须具备扎实的物理数据输入、模块化的算法底座、强大的工程基础设施。然后展开五层:
① 顶层牵引:人机共驾的弱 RSI 范式(见 2.4)。
② 可插拔模型底座 SiPAI——让研究想法真正落实为模型变化。
前提判断很精辟:要让 Agent 真正参与模型研究,模型本身必须能够被系统理解、修改和验证。
-
SiPAI 采用高度解耦的可插拔设计,统一支持 世界模型(WM)、世界动作模型(WAM)、视觉语言动作模型(VLA)与视觉语言模型(VLM) 等多种主流前沿架构;
-
已接入的模型组件可通过配置文件选择、组合和调整,并沿用统一训练与评测流程。
这第二条是"可被 Agent 改"的技术前提:参数化、声明式的实验接口,而不是要人手工改一堆散落的脚本。
基于 SiPAI 与 AutoResearch,系统已在攻四个关键问题(这四个都是具身智能当前最实际的工程矛盾):
| 探索方向 | 原文内容 | 为什么这件事值得做 |
|---|---|---|
| 训练与推理效率优化 | 围绕计算合并、训练推理加速、分布式加载展开,改进成果反哺框架本身,让后续实验跑得更快 | 研究系统自身成为被优化的对象,这是 RSI 的字面含义 |
| 历史信息的记忆平衡 | 面对长程任务,模型并非保留越多上下文越好;通过实验寻找"关键记忆选择"与"运行开销"之间的最佳平衡点 | 直接对抗第 4 篇那个"记忆"关键词的实现难题:记住什么,比记住多少难 |
| 训练 Recipe 与精准配比 | 围绕关键动作、容易失败的动作、不同难度样本做动态配比实验,直接回答"接下来该用什么数据、怎样训练" | 把"数据配比"从手艺活变成可搜索的变量 |
| 动作执行与闭环部署策略 | 预测出的连续动作并不一定要全部执行;实际执行多长的 Action Chunk 直接影响物理反馈频率。围绕执行长度、动态调整策略与动作补偿共同实验 | 这一条最见功力:执行长度 = 反馈频率 = 学得快的速度,是纯仿真团队想不到的变量 |
③ 大规模真实物理数据体系。
-
思路上借鉴 Generalist(以规模化真实物理交互驱动预训练);
-
采集手段:基于同构 UMI 的数据采集体系,以统一的观测与动作接口承载多样化的任务、物体和场景;
-
数据治理上,团队并未单纯追求小时数,而是贯彻四个维度:时序对齐、轨迹质量、任务覆盖、训练配比;
-
目标是推动高质量数据、模型容量和训练计算的协同扩展,进而激发三类高阶涌现能力:新任务适应、技能组合、意外恢复。
这一句与第 2 篇的判断高度同向:第 2 篇说"行业把数据当成答案,而数据只是症状";Simate 的做法是不去堆小时数,而是把数据的四个质量维度变成可调参数。
④ 闭环机制:研究与数据在同一体系内互相反馈。
原文的前提声明很重要:对于 Physical AI 而言,真实部署并不是研发结束,而是下一轮研究开始。 多层级评估与反馈飞轮:
-
Agent 通过模型与数据配比实验自主验证假设;
-
世界模型评测与仿真闭环提供高频即时信号,帮助系统快速定位能力断点;
-
最终模型被下发至真实物理机器人执行任务,在真实物理世界中遭遇的接触打滑、轨迹卡顿或任务失败案例被结构化沉淀,重新作为下一轮 Agent 提出研究假设与调整数据配比的依据。
原文的收束句可以当金句用:物理世界暴露的问题,在此转化为了算力与算法自我改进的「燃料」。 并且它明确说了"最终模型下发真机"——这一点恰好回应了第 2 篇对世界模型路线的核心批评(不能只拿生成环境里的成绩证明真机可靠性),见 2.9。
⑤ 为自动试错定制的 AI-native Infra。
-
触发条件被说得很具体:当多位研究员与数十个 Agent 在同一个集群内并行发起实验,传统基于调度脚本的深度学习基础设施显然已不足以支撑。
-
提供的能力:多 Agent 编排、多卡算力统一调度、实验环境管理、故障恢复、统一实验资产记录;
-
保障效果:即便在极高并发的自动化试错中,集群也不会因个别崩溃而中断,所有失败与成功的先验经验都能在不同 Agent 与模型版本间沉淀复用;
-
研究过程的可观察能力(这块常被忽略,但恰恰是"人还在环里"的必要条件):
-
研究谱系:记录不同研究方向、方案分支和评估状态;
-
运行时间线:展示训练、评测、诊断任务之间的关系;
-
目的:让研究者能理解哪些方向被延续、哪些方案被淘汰、为什么系统进入下一步探索。
-
2.7 最终目标:4D 物理感知与记忆,打造"通用物理快系统"
原文给出的产品级目标链:
以 4D 物理感知与记忆机制为核心,构建大规模、可端侧实时部署的物理原生快系统,提升对复杂任务的连续执行能力,并通过与慢系统协同,向少样本乃至零样本的通用操作推进。
-
具体模型规模将在后续技术报告中披露(即目前无参数数字);
-
手段:通过视觉编码、时空建模和特征压缩等设计,让"更大的模型容量"与"实时物理交互"相互兼容;
-
4D 物理感知关注空间结构及其随时间发生的变化,让深度、几何、运动与接触信息直接服务于动作理解和生成;
-
记忆机制围绕任务进展、连续状态与即时反馈组织历史信息,使模型能利用过去观察持续行动,同时兼顾长程任务与实时响应;
-
真机展示呈现了:基于演示的任务适应、记忆、复杂长程执行、精细操作;
-
商业判断收得很实在:最终要检验的是——当任务、物体或环境发生变化,机器人能否以更少的适配,保持可靠的任务完成能力。这也决定了模型进步能否转化为实际商用价值。
-
文中嵌入一段 04:25 的真机展示视频(本地笔记无画面)。
2.8 三阶段路线图:从"人机共驾"通向"完全自治"
| 阶段 | 做什么 | 当前状态 | 核心命题 |
|---|---|---|---|
| 第一阶段:弱 RSI(人机共驾,Human-in-the-loop) | 人类提假设、定目标与约束;Agent 自主推进方案改进、实验执行、评测与反馈迭代 | 已通过 AutoResearch 登顶 RoboDojo 得到工程验证 | 证明 AI 能够进入机器人研究流程 |
| 第二阶段:强 RSI(进一步减少人工参与) | Agent 尝试自主提出研究假设、规划实验路径、评估研究方向;人类转向目标治理与关键决策监督 | Simate 的攻坚方向,持续探索中 | 把"提出问题"也交出去 |
| 第三阶段:完全自治 RSI(Fully Autonomous) | 研究、数据、模型与真实部署的完整闭环由系统自主运转,物理智能在持续运行中自我进化 | 长期目标 | 无人类参与的递归自我改进 |
作者对研发人员角色的判断,是全文最适合做传播点的一句:随着系统自治权重逐步递增,研发人员的角色将从繁重的实验配置与调参中解放出来,成为定义系统价值与安全边界的顶层架构师。
2.9 团队与开放策略(判断可信度时要看这两段)
团队构成:"顶尖智驾工程能力 + 年轻研究者的创造力"。
-
智驾背景:从有图、无图到一段式端到端三代技术范式,核心团队站在第三代路线上,交出国内顶级成果,原文称"也是国内极少数和 Tesla FSD 可比较的智驾系统";一段式端到端把大模型的数据、训练与迭代能力,同真实物理世界的感知、决策和连续行动结合,让团队积累了从模型突破到实际部署的完整经验;
-
新增研究力量:占方能(香港科技大学助理教授、World Mind Lab 负责人)、季马泽宇(具北美机器人研究与创业经历),带来世界模型、三维视觉、灵巧操作与人形控制方面的研究积累。
开放策略(作者自己给出的论证框架很好):一项技术范式若想真正形成行业影响力,除了技术突破,还需要从少数团队的内部能力,走向更多研究者可以使用的基础设施。而机器人智能研究长期门槛高:昂贵的机器人硬件、复杂的真机维护、高额算力需求、长期数据积累。
-
现状:AutoResearch 已向清华、北大、MIT、加州理工、哈佛、哥大等海内外高校师生开放内测,并已有研究者使用;
-
后续:计划逐步向业界开放覆盖数据、训练与评测全流程的基础设施工具;
-
待发布:模型与自动化研究相关技术报告,以及三篇研究文章——围绕物理原生表征与泛化、记忆与长程操作、自动化研究与效率;
-
作者押的判断:如果科研自动化能力能平台化普惠到高校实验室与独立开发者,整个机器人智能赛道的创新周期或将被极大压缩。
结尾一句是全文最有画面感的表达:当冰冷的机械手臂与算力集群不仅能执行任务,还能在物理世界真实的碰壁与磨损中学会自主研究,物理智能的进化速度,或许正在挣脱人类肉身所设定的时钟限制。
2.10 重点名词解析
每个词先大白话,再准确口径。带 ⚠️ 的是原文未展开、需要你自己核实的。
RSI(Recursive Self-Improvement,递归自我改进) 大白话:让 AI 参加造下一代 AI,新 AI 更强之后接着参与造更新的 AI,滚雪球。 准确说:把模型自身纳入研发工具链(设计实验、改代码、分析结果)以压缩研发周期。与第 1 篇(云栖大会)里的 RSI 是同一个概念——阿里那条线做的是数字侧 RSI(自己设计芯片、自己改推理框架、自己做训练实验),本篇做的是物理侧 RSI。
Physical RSI 大白话:数字世界的 AI 改自己只要重跑一遍代码;机器人改自己得真的去摔、去抓、去撞,成本高得多。所以"AI 造 AI"要落地到机器人,必须先解决"试错太贵"这件事。 准确说:让机器人智能具备自主发现能力瓶颈、生成并验证假设、持续迭代自身物理智能的闭环能力,把人从研究流程的执行环节里腾出来。
弱 RSI / 强 RSI / 完全自治 RSI 大白话:三档"放权程度"。弱 RSI 是人出题、AI 做实验;强 RSI 是AI 也自己出题,人只把关方向和风险;完全自治是连人把关都省了。 准确说:对应 Human-in-the-loop → 人类转向目标治理与关键决策监督 → Fully Autonomous。判断一家公司说得实不实,别看它说第几阶段,看它现在实际跑在哪一档——Simate 明确承认自己处于第一档。
Human-in-the-loop(人在环) 大白话:AI 自动驾驶,但方向盘后面还坐着人,遇到危险人要能立刻接管。 准确说:人类决策被嵌入自动化流程的关键节点。本篇的具体实现是"风险分级 + 主动上报裁决 + 研究谱系可观察",可观察性(研究谱系、运行时间线)是人在环的前提:看不见 Agent 为什么这么做,就谈不上在环。
AutoResearch / 自动科研系统 / AI for Physical AI 大白话:一个会自己做研究的系统。"AI for Physical AI"是把它的作用对象说清楚——用 AI 研发能力,去研发物理 AI(机器人)。 准确说:Simate 的研究自动化系统,承担方案改进、代码修改生成、分布式实验下发、评测调用与多轮反馈迭代。
⚠️ RoboDojo 大白话:机器人能力的一张公开考卷。 准确说:原文把它描述为综合考察长程规划、空间泛化、记忆、亚毫米级接触精度的公开评测榜单,并给出网址(robodojo-benchmark.com/leaderboard)。但原文没有给出分数、第二名差距、评测由谁执行、任务集规模——引用"登顶第一"前建议自己去榜单页核一次。同理,标题里的 "GPT-6 Astra" 在正文中一次都没有展开解释,这是本篇最大的信息缺口(见 2.11)。
VLA / WM / VLM(以及本篇新出现的 WAM) 大白话:VLM 是"看懂并说清",VLA 是"看懂之后直接动手",WM 是"先在脑子里推演一下"。WAM(世界动作模型)是把"推演"和"动手"缝成一个模型。 准确说:SiPAI 同时支持 WM / WAM / VLA / VLM 四类架构。⚠️ WAM 未展开定义,需核实其与"Unified VLA""Latent World Modeling"(第 2 篇提过)的关系。注意一个有意思的差异:第 3 篇的五类模型谱系里有 VLN(导航),没有 WAM;本篇的清单里有 WAM,没有 VLN——两份"行业标准分类"互相都对不上,说明这个领域的术语表还在被各家自己写。
可插拔架构 / 配置文件驱动的实验 大白话:像换相机镜头一样换模型模块,而且换哪个镜头是写在一页配置清单上的,不是靠工程师口口相传。 准确说:高度解耦 + 声明式配置 + 统一训练评测流程。这是 Agent 能改模型的根本前提:只有当"改什么"能被结构化描述时,才谈得上让程序去自动尝试。
Action Chunk(动作分块)与执行长度 大白话:模型一口气预测出未来 30 步动作,机器人不一定要全做完。可以做 5 步就停下来看一眼、再重新预测。做的步数越长越流畅,但错了要很久才发现;做的步数越短,反馈越快但动作越抖。 准确说:连续动作分块的执行长度直接决定物理反馈频率与闭环延迟,是在"流畅性"与"可纠错性"之间做权衡。Simate 把它列为可自动搜索的变量,并同时做动态调整策略与动作补偿——这条是全文最"真机派"的细节,纯仿真背景团队通常不会把它单列。
⚠️ 同构 UMI 的数据采集体系 大白话:用一批长得一样的采集装置去采数据,保证"观测方式"和"动作定义"在不同任务、不同物体、不同场景下是同一套接口。 准确说:UMI 在具身领域通常指 Universal Manipulation Interface 一类的低成本手持采集方案,"同构"指设备与接口统一。原文未展开,具体形态需核实。
⚠️ Generalist 大白话:另一家做通用机器人模型的公司/路线,主张用规模化的真实物理交互数据来做预训练。 准确说:原文两次"借鉴/呼应 Generalist",均未给出具体指向与出处,若对外引用请先确认是哪家公司及其观点。
数据治理四维度:时序对齐 / 轨迹质量 / 任务覆盖 / 训练配比 大白话:判断一批数据好不好,不看总时长,而看四件事——传感与动作的时间戳对得上吗、轨迹干净吗、任务种类够广吗、各类样本的比例合适吗。 准确说:把"数据质量"从形容词变成可度量、可调参的四个变量,与"不单纯追求小时数"配套。这是本篇数据观的核心。
高阶涌现能力:新任务适应 / 技能组合 / 意外恢复 大白话:没教过的活儿也能上手;会的几个动作能拼成新任务;做砸了一半还能自己救回来。 准确说:第三项"意外恢复(recovery)"最被低估也最值钱——它直接决定真机可用性,因为真实世界必然出错,不能自愈的机器人在产线上就是事故源。
4D 物理感知 大白话:3D(长宽高)+ 时间 = 4D。不只是"东西在哪",而是"东西在哪、怎么摆、正在怎么动、碰上去会怎样"。 准确说:让深度、几何、运动、接触四类信息直接进入动作理解与生成,而不是只走"图像看起来像"这一层。
快系统 / 慢系统 大白话:快系统是"反射弧"——毫秒级决定手往哪伸;慢系统是"深思"——想清楚这单活分几步。 准确说:快系统承担高频实时控制,慢系统承担任务分解与规划;其分层思想源头即第 2 篇讲的层次化强化学习。Simate 的目标是先把快系统做出来并跑在端侧,再与慢系统协同。
端侧实时部署 大白话:模型跑在机器人自己身上,不靠云端,断网也能干活。 准确说:受算力、功耗、内存限制,需要靠视觉编码、时空建模、特征压缩来让"更大模型容量"与"实时物理交互"共存。第 1 篇里阿里的 Qwen3.8-Flash"只激活 6B"是同一类矛盾在语言模型侧的解法。
研究谱系 / 运行时间线 大白话:前一个是"这棵树是怎么分叉的"——哪些方向被延续、哪些被剪掉;后一个是"这些实验谁先谁后、谁在等谁"。 准确说:自动化科研系统的可观察层。它的意义不只是调试,而是让人的判断力能够持续介入——弱 RSI 之所以是弱 RSI,靠的就是这一层。
《When AI Builds Itself》/ 翁荔 / Jeff Dean 准确说:三者都是原文用来标注"RSI 已成全球共识"的信号。翁荔即 Lilian Weng,曾任 OpenAI 安全与研究相关职务、后为 Thinking Machines Lab 联合创始人,原文称其重回 OpenAI 牵头推进 RSI;Jeff Dean 为 Google 前首席科学家。⚠️ 具体任职表述以官方公告为准。
2.11 数字速查(含口径标注)
| 数字 | 含义 | 口径 |
|---|---|---|
| 26% | 截至今年 8 月,Anthropic 内部 AI 研发工作由 Claude 主导推进的比例 | 厂商自述,"主导推进"无量化定义 |
| 超过 90% | Anthropic 研发流程已进入"AI 深度协作"阶段 | 厂商自述,同上 |
| 3 个月 | Simate 成立到登顶榜单的时间 | 公司披露 |
| 第一名 | AutoResearch 驱动模型在 RoboDojo 的排名 | 官方披露;分数与基线未给出 |
| 亚毫米级 | 榜单考察的接触精度维度 | 榜单维度描述 |
| 04:25 | 文中真机展示视频时长 | 页面元信息 |
| 4 个 / 5 层 / 3 阶段 | 数据治理四维度;基础设施五层;RSI 三阶段路线图 | 原文结构 |
| 6 所高校 | 清华、北大、MIT、加州理工、哈佛、哥大已开放内测 | 公司披露 |
| 三篇研究文章 | 物理原生表征与泛化 / 记忆与长程操作 / 自动化研究与效率 | 待发布 |
| (无) | 模型参数量、数据小时数、具体成功率均未披露 | 原文称"将在后续技术报告中披露" |
2.12 我的追问(这篇最需要带着怀疑读)
-
最大的信息缺口在标题。 "超越 GPT-6 Astra"是标题的钩子,但正文里 "Astra" 一次都没有再出现,没有说明它是什么模型、出自哪家、在榜单上的分数是多少。任何对外引用都不能沿用这个对比,除非自己去榜单页核实。这是典型的"标题给出比较级、正文不提供证据"。
-
"成立三个月就登顶"该怎么解读? 两种解释同时成立:一是团队方法确实有效且有智驾工程积累;二是新榜单的参与者与基线尚有限,登顶的信息量比成熟榜单(如 GLUE/SWE-bench 那类)小得多。判断依据应该是"榜单被多少人认真打过",而不是"我们排第一"。
-
关键量化指标一个都没有:没有参数量、没有数据小时数、没有具体任务成功率、没有与第二名差距。原文对此很坦白("具体模型规模将在后续技术报告中披露"),那就意味着现阶段它是一篇融资/招聘向的公司叙事稿,不是技术评审材料。这也是机器之心此类稿件的通用属性,读的时候要在心里打标。
-
但工程细节的可信度反而不低。 尤其是"Action Chunk 执行长度直接影响物理反馈频率""模型并非保留越多上下文越好""不单纯追求小时数"这三条——都是只有真跑过机器人才会写进路线图的约束。判断一篇 PR 稿有多少真货,看的就是这类不体面的细节。
-
与第 2 篇的正面呼应,值得单独记一条:第 2 篇警告"世界模型充当 Learned Simulator 时,不能单靠生成环境中的成绩证明真机可靠性";本篇的设计是"世界模型评测与仿真闭环提供高频即时信号用来快速定位能力断点,但最终模型下发真机,真机失败案例结构化回灌"。这套写法在纸面上恰好把第 2 篇的批评接住了。 后续要盯的是:真机回灌的数据占比与失败样本量,等他们的技术报告。
-
与第 1 篇(阿里)对照可以提炼出一条行业共识:两家做 RSI 的公司都主动声称自己还在"人机共驾/人在环"这一档(阿里说"离模型自主造出下一代模型还有距离",Simate 直接把它命名为"弱 RSI")。越靠近一线的团队,越不敢宣称已实现自治——这个"集体保守"本身就是判断 RSI 真实进度最可靠的信号。
-
待核实的名单:占方能 / World Mind Lab、季马泽宇、Simate 的融资与工商信息(原文均未提,通常这类稿件会在别处发布)。要写进对外材料前需要另找信源。
三、原文
标题:超越GPT-6 Astra登顶RoboDojo,成立3个月的Simate让机器人学会「设计下一个自己」 公众号:机器之心 | 编辑:Youli | 发布时间:2026年9月23日 20:30 原文链接:https://mp.weixin.qq.com/s/fMbm9PqjABhFGOJfeCO5eQ
版权提示:原文末尾标注"转载请联系本公众号获得授权"。本节全文仅作个人学习存档,不得对外转载或改写发布。文中所嵌 04:25 真机展示视频本地无法保留,仅存文字说明。
编辑|Youli
今年以来,RSI(Recursive Self-Improvement,递归自我改进)逐渐从硅谷前沿话题,演变为全球共识。
从 Anthropic 发布引起行业热议的《When AI Builds Itself》,到前 Thinking Machines Lab 联合创始人翁荔重回 OpenAI,牵头推进 RSI 相关技术探索,再到 Google 前首席科学家 Jeff Dean 投身相关创新…… 顶尖团队的视线几乎在同一时间锚定了同一个命题:AI 应当如何参与创造下一代 AI?
具体的数据让这场范式转换变得具象。近日 Anthropic 公布,截至今年 8 月,Anthropic 内部已有 26% 的 AI 研发工作由 Claude 主导推进,超过 90% 的研发流程已经迈入「AI 深度协作」阶段。
这似乎意味着,在数字世界中,AI 参与自身改进已经取得了阶段性成果。
但如果将这一问题从数字世界延伸到物理世界,事情显然没这么简单。
软件世界中的 AI,可以通过代码、实验环境和模拟系统快速获得反馈。而机器人面对的是一个连续、动态、且处处充满物理规律严苛制约的真实世界,一次失败的抓取、错误的动作规划、都可能意味着重新采集数据,以及动辄数天的大规模模型重训与重新部署。
因此,Physical RSI 面临的核心问题是:能否让机器人智能不再完全依附于人类工程师的疲劳战术,拥有自主发现能力瓶颈、主动生成验证假设并持续迭代自身物理智能的闭环能力?
围绕这一命题,各路玩家开始寻找破局点,成立不久的初创团队 Simate(Silicon Mate,硅基伙伴)便是其中一家。正如其名字所寄托的愿景 ——「Silicon evolving with humanity」,Simate 希望让硅基智能成为与人类共同探索、共同演进的伙伴。
Simate 创始人张颖曾任头部自动驾驶公司的核心技术负责人,推动一段式端到端智驾方案达到国内领先水平。
自动驾驶作为目前最接近大规模真实世界部署的 Physical AI 场景之一,其积累的数据闭环、高频迭代和工程验证经验,也成为探索机器人智能进化的重要基础。
近日官方披露,成立仅三个月,Simate 的 AutoResearch 自动研究系统在机器人智能评测榜单 RoboDojo 取得第一名,并通过真机展示记忆、高精度操作、复杂长程执行与泛化能力。
这一成绩背后,是 Simate 围绕 AI for Physical AI 构建的 Physical RSI 研发体系的一次工程验证。通过 AutoResearch,Simate 探索了「人机共驾弱 RSI」的实现路径:由人类研究者定义目标和约束,Agent 参与实验探索、方案优化和反馈迭代。
这似乎释放出一个信号:RSI 的探索正在从数字智能进一步延伸至物理智能,AI 不再只是帮助机器人执行任务,也开始尝试参与推动机器人能力本身的提升……
从数字智能到物理智能:Physical RSI 为何成为下一步探索方向?
过去几年,大模型的发展让 AI 逐渐具备更强的推理和生成能力,与此同时,机器人领域也开始进入基础模型时代:VLA 架构的普及、大规模机器人数据集开源,以及世界模型的逐步演进,让机器人开始具备更加通用的感知和行动能力。
但机器人仍然面临一个核心挑战:如何持续提升自身能力。
相比数字世界,机器人无法通过简单修改代码获得反馈,它需要真实环境交互、物理数据采集、模型训练、机器人部署、失败分析、再次优化。而在传统机器人研发流程中,大量工作依然依赖人类:研究人员提出假设、设计实验方案、采集训练数据、训练模型、部署测试、分析失败。
这一流程的问题在于:机器人智能的提升速度,很大程度上受到人类研究效率限制。当每一次算法改进、数据调整和实验验证,都需要研究人员亲自推动时,物理智能的进化周期很难快速缩短。
因此,Physical AI 需要的已经不仅是一个参数量更大、架构更精巧的单点模型,而是一套能够把「做研究」这一行为本身系统化、代码化和自动化的进化框架。
这也是 Physical RSI 提出的背景:让 AI 参与物理智能研究过程,让机器人能力提升从一次次人工迭代,走向持续进化闭环。
AutoResearch 登顶 RoboDojo:弱 RSI 阶段的工程验证
面对物理世界的复杂性,Simate 并没有直接提出完全脱离现实的全自动化研究系统,而是选择从更现实的路径开始:人机共驾的弱 RSI(Human-in-the-loop RSI)。
在这一设定中,人类研究员与自动化系统确立了全新的协作边界:
人类研究员仍然掌握研究方向,负责提出研究假设、设定目标,划定边界条件与安全物理约束;
AutoResearch 则负责自动化研究环节,在统一体系内,Agent 自主推进具体的方案改进、生成代码修改、下发分布式实验、调用评测工具并完成多轮反馈迭代。
在这一体系中,研究不是一串预先写好的死板任务,而是一个根据实验反馈不断调整的动态过程。
研究员给出目标与约束,研究 Agent 结合已有知识提出假设、规划实验,通过模型框架修改配置并执行验证,再根据结果决定继续、调整还是终止当前方向。「提出假设 — 规划实验 — 执行验证 — 分析迭代」,构成了其核心的运转循环。
此次在机器人智能公开评测榜单 RoboDojo 上的登顶,正是这套范式的第一个工程注脚。
作为一个综合考察长程规划、空间泛化、记忆以及亚毫米级接触精度等维度的机器人智能基准榜单,AutoResearch 驱动的模型拿下第一,更是在向行业验证一个核心事实:在极度依赖物理直觉与工程经验的机器人智能研发中,「做研究」的能力本身同样可以被标准化与自动化运转。
网址链接:https://robodojo-benchmark.com/leaderboard#news
Physical RSI 背后的自主研究基础设施:让「做研究」成为可持续运行的系统
自动科研系统要避免沦为纸上谈兵的代码生成玩具,必须具备扎实的物理数据输入、模块化的算法底座,以及强大的工程基础设施支撑。
围绕这一目标,Simate 正在构建一套自主研究基础设施,将模型、数据、实验和反馈连接起来,让研究者与 Agent 能够在同一套系统中:提出问题、执行实验、分析结果、将获得的经验带入下一轮研究。
Physical RSI 需要 AI-native 的模型框架、研究员友好的研究记忆与协作系统,以及 AI-native 的数据和基础设施共同支撑。其背后的工程设计,让模型修改、云端实验、结果反馈与人的判断持续衔接,再将有效方法与经验用于下一轮研究。
从研究目标、模型修改、云端实验到评测反馈与人工决策的关系。
1. 首先是「人机共驾的弱 RSI」的研究范式
作为整套系统的顶层牵引,弱 RSI 范式界定了人机协同的协作方式。低风险、易验证的实验由 Agent 持续推进;遇到高风险或需要资深专业判断的节点,系统则主动将方案交回研究者裁决。人类研究员可以随时介入并调整约束,真正做到了「系统持续推进,研究者始终掌握方向」。
这种模式的核心变化在于让研究者从大量重复性的实验执行中解放出来,将更多精力投入到问题定义和方向判断,而 AI 则成为研究能力的延伸。
2. 可插拔模型底座 SiPAI:让研究想法真正落实为模型变化
要让 Agent 真正参与模型研究,模型本身必须能够被系统理解、修改和验证。Simate 构建了模块化模型开发基础 ——SiPAI。
SiPAI 采用高度解耦的可插拔设计,统一支持了包括世界模型(WM)、世界动作模型(WAM)、视觉语言动作模型(VLA)与视觉语言模型(VLM)在内的多种主流前沿架构。对于已经接入的模型组件,研究者可以通过配置文件选择、组合和调整,并沿用统一训练与评测流程。
基于 SiPAI 与 AutoResearch,系统已经开始探索多个机器人智能研究中的关键问题:
训练与推理效率优化:系统围绕计算合并、训练推理加速以及分布式加载展开优化,改进成果反哺框架本身,让后续实验运行得更快;
历史信息的记忆平衡:面对长程任务,模型并非保留越多上下文越好,系统通过实验寻找关键记忆选择与运行开销之间的最佳平衡点;
训练 Recipe 与精准配比:围绕关键动作、容易失败的动作以及不同难度的样本进行动态配比实验,直接回答「接下来该用什么数据、怎样训练」;
动作执行与闭环部署策略:预测出的连续动作并不一定要全部执行,实际执行多长的 Action Chunk 会直接影响物理反馈频率;系统围绕执行长度、动态调整策略与动作补偿共同实验,让预测与部署在同一流程中协同改进。
3. 大规模真实物理数据体系:让机器人从真实世界获得持续经验
机器人智能提升依赖真实世界经验,在借鉴 Generalist 以规模化真实物理交互驱动预训练的技术思路,Simate 使用基于同构 UMI 的数据采集体系,以统一的观测与动作接口承载多样化的任务、物体和场景。
在数据治理上,团队并未单纯追求小时数,而是贯彻时序对齐、轨迹质量、任务覆盖与训练配比四个维度,推动高质量数据、模型容量和训练计算的协同扩展,进而激发新任务适应、技能组合以及意外恢复等高阶涌现能力。
基于此,团队探索可迁移的感知与动作表征,以及更稳定地激发新任务适应、技能组合以及意外恢复等高阶涌现能力。
4. 闭环机制:研究与数据在同一体系内互相反馈
对于 Physical AI 而言,真实部署并不是研发结束,而是下一轮研究开始。机器人在真实环境中遇到的各种问题本身就是重要反馈。
为此,Simate 建立了一套多层级的评估与反馈飞轮:
Agent 通过模型与数据配比实验自主验证假设;
世界模型评测与仿真闭环提供高频即时信号,帮助系统快速定位能力断点;
最终的模型被下发至真实物理机器人上执行任务,在真实物理世界中遭遇的接触打滑、轨迹卡顿或任务失败案例,会被系统结构化沉淀,重新作为下一轮 Agent 提出研究假设与调整数据配比的依据。最终,物理世界暴露的问题,在此转化为了算力与算法自我改进的「燃料」。
在这一过程中,物理世界不再只是模型部署场景,它同时成为推动模型进化的重要来源。
5. 为自动试错定制的 AI-native Infra
当多位研究员与数十个 Agent 在同一个集群内并行发起实验,传统基于调度脚本的深度学习基础设施显然已不足以支撑,需要面向 Agent 研究的新型基础设施。
为此,Simate 构建的 AI-native Infra 提供了包括多 Agent 编排、多卡算力统一调度、实验环境管理、故障恢复,以及统一实验资产记录的能力。
这保证了即便在极高并发的自动化试错中,集群也不会因个别崩溃而中断,所有失败与成功的先验经验都能在不同的 Agent 与模型版本间沉淀复用。
此外,系统还提供研究过程的可观察能力。例如研究谱系可以记录不同研究方向、方案分支和评估状态;运行时间线可以展示训练、评测、诊断任务之间的关系等,从而让研究者能够理解哪些方向被延续、哪些方案被淘汰、为什么系统进入下一步探索……
据公司介绍,研究者目前可以通过 SiMate 官网了解相关系统并申请试用。系统图解释各环节如何连接,真实案例说明改进如何产生,开放入口则让外部研究者进一步了解工具的实际使用方式。
官网链接:https://simate.ai
以 4D 物理感知与记忆,打造通用物理快系统
AutoResearch 服务于 Simate 的一个明确目标:以 4D 物理感知与记忆机制为核心,构建大规模、可端侧实时部署的物理原生快系统,提升对复杂任务的连续执行能力,并通过与慢系统协同,向少样本乃至零样本的通用操作推进。
这一目标也与 Generalist 等前沿公司对通用机器人模型和新任务适应的探索形成呼应,具体模型规模将在后续技术报告中披露。Simate 希望通过视觉编码、时空建模和特征压缩等设计,让更大的模型容量与实时物理交互相互兼容。
4D 物理感知关注空间结构及其随时间发生的变化,让深度、几何、运动与接触信息直接服务于动作理解和生成。记忆机制则围绕任务进展、连续状态与即时反馈组织历史信息,使模型能够利用过去的观察持续行动,并兼顾长程任务与实时响应。
此次真机展示进一步呈现了基于演示的任务适应、记忆、复杂长程执行和精细操作等能力。从理解示范中的任务线索,到保留必要信息、衔接多个动作,Simate 希望让模型已经获得的能力在更多新任务和新场景中复用,减少专门采集、训练与工程调试的投入。
最终要检验的是:当任务、物体或环境发生变化,机器人能否以更少的适配,保持可靠的任务完成能力。这也决定了模型进步能否转化为实际商用价值。
[文中嵌入一段真机展示视频,时长 04:25]
从「人机共驾」通向「完全自治」:Physical RSI 的三阶段路线图
AutoResearch 拿下 RoboDojo 榜单第一名的成绩固然证明了 Simate 当前这套「弱 RSI」研究范式的工程可行性,但对于 Simate 而言,这只是起点,团队为 Physical RSI 划定了清晰的三阶段演进路径。
第一阶段,弱 RSI(人机共驾,Human-in-the-loop):人类研究员提出假设、设定目标与约束,Agent 自主推进方案改进、实验执行、评测与反馈迭代。
这一阶段的核心,是证明 AI 能够进入机器人研究流程。
目前,这一点,Simate 已通过 AutoResearch 登顶 RoboDojo 得到了坚实的工程验证。
第二阶段,强 RSI(进一步减少人工参与):Agent 开始承担更多研究工作,包括尝试自主提出研究假设、规划实验路径,并评估研究方向,而人类转向目标治理与关键决策监督。
目前,这一点是 Simate 的攻坚方向,正持续探索中。
第三阶段:完全自治 RSI(Fully Autonomous,无人类参与的递归自我改进):研究、数据、模型与真实部署的完整闭环由系统自主运转,物理智能在持续运行中自我进化。
其实,可以看出,随着系统自治权重的逐步递增,研发人员的角色也将迎来深刻蜕变:从繁重的实验配置与调参中解放出来,成为定义系统价值与安全边界的顶层架构师。当然,这仍然是一条长期探索路线,而这也正是 Simate 的长期目标。
从顶尖智驾快系统,到世界模型与机器人研究力量的汇合
同样来自智驾,团队的技术积累可以很不一样。从有图、无图到一段式端到端,代表不同技术范式,Simate 核心团队站在第三代技术路线上,并在这一方向交出了国内顶级成果,也是国内极少数和 tesla fsd 可比较的智驾系统。一段式端到端将大模型的数据、训练与迭代能力,同真实物理世界中的感知、决策和连续行动结合,也让团队积累了从模型突破到实际部署的完整经验。
与此同时,香港科技大学助理教授、World Mind Lab 负责人占方能,以及具有北美机器人研究与创业经历的季马泽宇等人才加入,带来世界模型、三维视觉、灵巧操作与人形控制方面的研究积累。
顶尖智驾工程能力与年轻研究者的创造力汇合,使团队能够从零到一推进模型与系统,并将长期积累转化为进入新领域后的研发速度。
写在最后
一项技术范式若想真正形成行业影响力,除了技术突破,也需要从少数团队的内部能力,走向更多研究者可以使用的基础设施。
长期以来,机器人智能研究往往面临较高门槛:昂贵的机器人硬件、复杂的真机维护、高额的算力需求、长期的数据积累,等等,这些因素限制了大量研究团队参与。
换句话说,Physical RSI 想要进一步发展,也需要降低研究门槛。
基于此,Simate 已将其自动化研究系统向清华、北大、MIT、加州理工、哈佛、哥大等海内外高校师生开放内测,并已有研究者使用。后续,Simate 也计划逐步向业界开放覆盖数据、训练与评测全流程的基础设施工具,让支撑其研发的顶级工程能力服务于更广泛的研究与应用。模型与自动化研究相关技术报告,以及围绕物理原生表征与泛化、记忆与长程操作、自动化研究与效率的三篇研究文章,也将陆续发布。
Simate 认为,如果 AutoResearch 所代表的科研自动化能力能够通过平台化的方式普惠至高校实验室与独立开发者,整个机器人智能赛道的创新周期或将被极大压缩。未来,随着自动化科研基础设施进一步开放,更多研究者可能参与机器人智能探索。
拿下 RoboDojo 榜单第一名,固然为 Simate 赢得了一个漂亮的登场切片,但更具行业启示意义的,是它展现出的那种可能性:当冰冷的机械手臂与算力集群不仅能执行任务,还能在物理世界真实的碰壁与磨损中学会自主研究,物理智能的进化速度,或许正在挣脱人类肉身所设定的时钟限制……
最后,目前「AutoResearch 科研平台内测」正在火热招募中,欢迎感兴趣的朋友们踊跃报名参与!
© THE END
转载请联系本公众号获得授权
(原文完)
四、与本批前四篇的横向关系
| 关联对象 | 关系 |
|---|---|
| 第 1 篇(云栖大会) | 同一概念的两条战线。第 1 篇是数字侧 RSI(Qwen 自己设计 NoC 芯片、自己改 SGLang、自主跑一个多月训练实验),本篇是物理侧 RSI。两家还都主动声明自己在"人在环"这一档——越靠近一线越不敢宣称自治,这条共性比任何单项成果更能说明 RSI 的真实进度。另外本篇的"端侧实时部署 vs 更大模型容量"矛盾,与第 1 篇 Qwen3.8-Flash"只激活 6B"是同一个矛盾在不同模态上的解法。 |
| 第 2 篇(六大具身路线) | 被检验与回应批评的关系。第 2 篇警告"世界模型当 Learned Simulator 时,不能单靠生成环境里的成绩证明真机可靠性";本篇的设计是"仿真闭环提供高频即时信号定位能力断点 + 最终下发真机 + 真机失败结构化回灌",纸面上恰好把这条批评接住了。同时本篇"不单纯追求小时数、改看时序对齐·轨迹质量·任务覆盖·训练配比四维",也呼应第 2 篇"数据只是症状,不是答案"的判断。 |
| 第 3 篇(五大具身模型) | 术语表对不上。第 3 篇的谱系是 VLM / VLN / VLA / VLX / WM;本篇 SiPAI 的清单是 WM / WAM / VLA / VLM——有 WAM 没有 VLN,也没有 VLX。两边都自称"主流前沿架构"。说明这个领域的分类法还在被各家自行书写,引用任何一个缩写前先确认它出自谁的表。 |
| 第 4 篇(陈博远·世界模型四关键词) | 本篇把四关键词做成了工程清单:记忆 → "关键记忆选择与运行开销的平衡";Action → Action Chunk 执行长度与物理反馈频率;因果 → 世界模型 + 仿真推演用于定位能力断点;验证 → 真机执行与失败案例回灌。四关键词从一个口号变成了一套可核对的实现项,这也是本篇最有参考价值的地方。 |
给下一步的阅读建议:原文说技术报告与三篇研究文章(物理原生表征与泛化 / 记忆与长程操作 / 自动化研究与效率)陆续发布——盯住技术报告里的参数规模、数据小时数、真机任务成功率与榜单分数,那才是可以把本篇从"公司叙事"升级为"可验证结论"的东西。在它出来之前,本篇的对外引用等级建议标为"厂商披露,未独立核实"。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)