PhysBrain 1.5 物理基座模型横评:开源 72.5 分逼近 GPT-6 Astra,28 项基准 5 维实测
先把一个数据摆出来。Robocurve 团队把 GPT-6 Astra 部署到真实机械臂上做"积木放进碗里",20 次尝试成了 19 次,成功率 95%;但换成"蓝色拼图块对位插入凹槽"这种毫米级精细装配任务,它的成功率直接从 95% 掉到 10%。同一个模型,粗活能打满,细活就现原形。
这不是某个模型的翻车,而是大模型走进物理世界时绕不开的那道坎:语言模型能把"会说话、会思考、会写代码"刷到极致,但从"看懂画面"到"手不抖地把它插进凹槽",中间还隔着一层物理常识。这层东西,靠通用大模型硬补太贵,得靠专为物理交互训练的基础模型来填。
9 月 9 日,北京海淀的深度机智(DeepCybo)发布了物理基座模型 PhysBrain 1.5,在 28 项具身智能公开基准上拿到 72.5 的综合均分,把开源阵营的纪录从 66.0 一口气抬高了 6.5 分。更值得留意的是它和闭源旗舰的距离:GPT-6 Astra 73.3、Gemini 3.6 Flash 73.0,全都被它追到了 1 分以内。一家成立才一年多的公司,用一条"人类学习"的技术路线,把"理解、动作、预测"塞进了同一个模型。
这篇文章我把 PhysBrain 1.5 和 GPT-6 Astra、Gemini 3.6 Flash 以及几款开源对手摆在一起,从 5 个能力维度逐项拆,看"开源逼近闭源"这个说法有多少水分,以及你现在到底该不该上手。
一张表看清格局
先把 28 项基准的综合均分排成一列,6 个参评模型一眼看尽:
| 模型 | 综合均分 | 阵营 | 参数规模 |
|---|---|---|---|
| GPT-6 Astra | 73.3 | 闭源 | 未公开 |
| Gemini 3.6 Flash | 73.0 | 闭源 | 未公开 |
| PhysBrain 1.5-8B | 72.5 | 开源 | 8B |
| Hy-Embodied-VLM-1.0 | 66.0 | 开源 | 30A3B |
| Embodied-R1.5 | 64.9 | 开源 | 8B |
| RynnBrain 1.1 | 63.1 | 开源 | 9B |
几个数字单独拎出来讲。头两名都是闭源,PhysBrain 1.5-8B 用 8B 的规模挤到第 3 位,和头两名闭源旗舰的差距都不到 1 分;而它的头部开源对手 Hy-Embodied-VLM-1.0 堆到了 30A3B 的 MoE 规模,分数反而低了 6.5 分。更有意思的是 PhysBrain 还有一个 2B 版本,官方规则里不参与排名,但它 66.6 的分数已经超过除 PhysBrain 之外的所有开源模型——包括那个 30A3B 的对手。
翻译一下:它不是靠某个单项刷分,而是在 28 项基准里拿了 14 项开源榜首、10 项开源第二。感知、空间、推理、规划、定位,几乎全线压过同阵营。这种"全面领先"比"单项冒尖"要硬得多。
维度一:空间感知与具身理解——"看懂"只是起点
通用 VLM 也能"看图说话",但它输出的是语言描述;物理模型要输出的是"这个物体在哪、哪部分是能抓的、怎么到那儿"。这中间隔着的,是结构化空间输出。
PhysBrain 1.5 在空间感知这条线路上有三个特别能打的分项:
| 基准 | 分数 | 测的是什么 |
|---|---|---|
| RoboSpatial-Home | 73.9 | 真实场景里物体的空间关系 |
| Part-Affordance | 84.0 | 识别物体上"能操作的部位" |
| RoboRefit | 89.8 | 复杂场景里精准锁定目标物体 |
我特别想强调 Part-Affordance 这 84.0 分——它的含义是从"识别"迈到"交互"。模型看到的不是一个杯子,而是"杯柄这个部位可以抓"。这一步看起来小,实际上是机器人从"看得懂"到"干得了"的分水岭。RoboRefit 的 89.8 分则说明它在遮挡、堆叠这种真实场景里定位目标的能力已经接近实用水位。
它的具身理解模块是在保留 VLM 图像/视频接口的前提下,额外注入了物理感知监督,输出不只是自然语言,还带结构化空间坐标和轨迹目标。换句话说,它天生就知道自己"看到的东西在空间里的哪、该往哪个方向动"。
维度二:动作生成与未来状态预测——Physical Loop 的闭环
PhysBrain 1.5 的整套设计围绕一个理念:物理智能是一个"观察 → 理解空间与任务 → 判断动作后果 → 执行 → 反馈修正"的循环(他们把这一步叫 Physical Loop)。过去做物理 AI,普遍是"理解模型 + 动作模型 + 预测模型"三块拼接,每个子模型单独训练、单独调优;PhysBrain 1.5 把这三块能力收敛进同一个自回归主干。
落到工程上,它是以 Qwen3-VL-8B-Instruct 为基座,扩展出专用的 action token 和 visual-state token,把语言回答、结构化空间输出、末端执行器轨迹、未来状态预测全部表达成离散 token,在单一 next-token prediction 目标下联合训练,不挂任何任务专属头。
这样设计的直接收益是三个能力咬合在一起:
- 具身理解——判断"此刻发生了什么"。
- 动作生成——判断"接下来该怎么做",给定画面 + 任务指令 + 动作历史,直接生成下一步动作序列,而且不绑定特定机器人本体。
- 未来状态预测——判断"做完之后会发生什么",预测 1 秒后的物理状态,同时输出 RGB、深度图、机器人掩码三种空间对齐模态。
第 3 点我认为是整篇最被低估的地方。"先想象结果、再采取行动"是闭环控制能纠错的前提。一个只会执行、不会预测的模型,撞墙之前是不会知道自己要撞墙的。
动作生成这条线还有个配套框架叫 Human-as-Humanoid:从人类主视角(ego-centric)视频里学习手腕运动方式,把它转成机器人可执行的轨迹。官方数据显示,这套方式在自研的 60 自由度拟人机器人 Prime U 上真机验证,原始示范吞吐是传统遥操作的 4.8 到 7.2 倍,部分任务能做到零样本迁移——模型没看过特定机器人本体的示范,直接就能执行。
补充维度:架构与部署门槛
闭源旗舰的问题永远是"你不能碰它"。GPT-6 Astra、Gemini 3.6 Flash 的物理能力再强,也只能走 API,本体适配、数据回灌、二次训练全在别人手里。PhysBrain 1.5 把技术报告、2B 和 8B 两档权重、评测工具包全部开源,这是它和闭源对手在这张表之外更本质的差距。
上手入口我列在这里:
- 模型主页:
https://huggingface.co/DeepCybo/PhysBrain1.5-8B(另有PhysBrain1.5-2B) - 在线 Demo:
https://huggingface.co/spaces/hugging-apps/physbrain1-5-8b-demo - 评测工具包:
https://github.com/DeepCybo-PhysAI/PhysBrainEvalKit - 项目页:
https://deepcybo-physai.github.io/PhysBrain-1.5
一个很直观的信号是:上线 3 天,两个权重拿到了 3k+ 下载。对一个偏研究向的具身模型来说,这个数字不低了。2B 版本的定位尤其聪明——8B 的完整能力在 2B 上保留了大半(66.6 vs 72.5),但显存和部署门槛砍掉一大截,等于把"试用和二次开发的门票"降到了很多人能负担的程度。
如果你只是想先跑通看效果,通用的 VLM 加载方式就能把它拉起来(这是 Qwen3-VL 系的标准姿势,PhysBrain 在此基础上扩了 token,接口保持一致):
from transformers import AutoModelForCausalLM, AutoProcessor
model_id = "DeepCybo/PhysBrain1.5-8B"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, dtype="auto", device_map="auto", trust_remote_code=True
)
# 输入一帧观测画面 + 一条任务指令,输出结构化空间坐标与动作序列
text = "把蓝色的积木放进碗里"
image = load_image("observation.png")
inputs = processor(text=text, images=[image], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=256)
print(processor.decode(out[0], skip_special_tokens=True))
要跑全套 28 项评测、复现 72.5 这个分数,直接用官方 Eval Kit 更省事,别自己手搓数据管线。
Robocurve 实验:通用大模型的物理天花板
回到开头的那个实验,它其实是对"通用大模型 + 具身"路线最诚实的一次体检。Robocurve 把 GPT-6 Astra 和 Claude Fable 5.1 放进同样的机械臂任务:
- “积木放进碗”:GPT-6 Astra 20 次成 19 次,Claude Fable 5.1 只成 8 次。
- “蓝色拼图对位插入凹槽”:GPT-6 Astra 成功率从 95% 跌到 10%。
两次结果指向同一件事:顶尖大语言模型有不错的通用空间认知,但一到需要毫米级精细动作的场合就露怯。这不是提示词能救的,是底层动作生成和未来状态预测能力没到位。PhysBrain 1.5 的意义就在于把这层能力单独拎出来做扎实——它不需要在"会聊天"上赢过 GPT-6 Astra,只需要在"会动手"这件事上把开源阵营的水位整体抬高。
选型建议 + 趋势观察
按场景给结论,别指望一个模型通吃:
- 要做具身智能研究、机器人本体开发:直接上 PhysBrain 1.5,开源权重 + 评测工具包,能做数据回灌和二次训练,这是闭源给不了的。
- 要省资源先验证可行性:用 2B 版,显存友好,能力保留大半,跑通再上 8B。
- 要做通用 Agent、电脑操作、纯语言任务:GPT-6 Astra 这类闭源旗舰仍然领先,物理短板不影响它们在软件层的统治力。
- 两者都想要、预算有限:语言/软件层用闭源,物理交互层用 PhysBrain,各取所长,比押注单一模型划算。
最后几条趋势,我个人的判断:
- 物理智能是下一阶段的硬仗。大模型的语言能力已经见顶了,头部机构(Gemini Robotics、Physical Intelligence 的 π 系列、PhysBrain 们的路线)都在往"能动手"上堆资源。
- “统一基座"会取代"模型拼接”。把理解、动作、预测收敛进一个主干,比三个子模型拼接更好维护、更好对齐,这是架构层面的确定性方向。
- 开源在物理 AI 的追赶速度会很快。72.5 vs 73.3,1 分以内的差距在语言模型领域要追很久,在具身领域可能也就一两个版本的事。
- "人类经验数据"正在成为新护城河。Ego360、Human-as-Humanoid 这种把人类主视角视频变成训练资源的路线,数据采集成本高、壁垒厚,比堆 GPU 更难复制。
一句话总结:物理智能的终局,不是一个"会回答"的模型,而是一个能在真实世界里感知、行动、并不断自我修正的闭环。PhysBrain 1.5 是开源阵营在这条路上交出的、值得认真对待的一张牌。
延伸阅读:
MCP vs MHS:5 个维度看懂 Claude 控制机械臂的新协议,Agent 正走进物理世界
GPT-6 Astra 电脑操作实测:OSWorld 72.6 与 2.5 倍定价背后,3 个场景能替你干多少活
MiniCPM5-2B 开源实测:2B 反超 12B 领跑 Agent 榜,3 个短板也要看清
测了 6 款模型才发现差距这么大。关注我 👆 第一时间获取更多 AI 模型深度横评。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)