今年世界机器人大会(WRC)现场,弥漫着一种微妙的“审美疲劳”。

过去,观众会为机器人翻一个跟头、跳一段舞而欢呼;但现在,大家的目光更多停留在机器人如何精准抓取一件件形态各异的物料,或者如何在嘈杂的工业环境中稳定作业。

这种转变背后,是具身智能行业评价标准的剧烈切换:Demo 够不够惊艳、融资额够不够大,不再是衡量一家公司的唯一尺度。真正决定企业能否穿越周期的,是其模型能力能否被低成本复制、高效率部署,并在真实场景中持续迭代。

图片

场景化应用将先于“ChatGPT时刻”到来

在讨论具身智能时,市场总在期待一个像 GPT-4 那样“无所不知”的通用物理大脑瞬间诞生。但残酷的现实是:互联网文本数据是现成的,而物理世界的交互数据——尤其是包含动作、力反馈、非标环境的优质数据——极度稀缺且碎片化。

由此,我们认为:具身智能的演进逻辑,绝非“先做出一个完美的通用大脑,再去找场景”,而是“在真实场景的应用与打磨中,喂养出一个通用的物理大脑”。

图片

原力灵机创始人兼CEO 唐文斌

这意味着,场景化应用会比具身智能的“ChatGPT时刻”更早到来。谁能让模型先在物理世界“跑起来、干起活”,谁就掌握了通往通用人工智能(AGI)的原始数据积累。原力灵机发布的通用具身基础模型 DM0.5,正是这一逻辑的坚定践行者。

图片

从单项特长生到“全科全能”

为了验证“通用性”,原力灵机摒弃了单一的炫技,而是通过三组物理逻辑截然不同的场景,展示了 DM0.5 作为“物理底座”的成色:

  • 工业场景的“高节拍”——物流分拣

面对成百上千种 SKU 的混合堆放,机器人不仅要看得见,更要在 3 秒内的工业节拍下完成“意图理解—路径规划—精准抓取”的闭环。这考验的是模型对未见过物料的 Zero-Shot 跨品类泛化能力。

  • 开放世界的“柔性力控”——削皮与切菜

削黄瓜与切菜对应着完全不同的力学交互:削皮需要毫秒级的柔性力反馈以保证刚柔并济,切菜则涉及更精密的轨迹规划。DM0.5 证明了其能够适配不同工具的物理特性,实现在非标环境下的柔性操作——这是机器人从工厂走进家庭等开放场景的核心技术入场券。

  • 多智能体的“高可靠”——亚毫米级积木搭建

多台机器人在极小空间内协同拼装,不仅是对亚毫米级精度的极致压榨,更是对长时作业稳定性的考验。多机间的空间避让与时序配合,把考核标准从“单次成功”拉升到了“高强度连续运转无差错”。

图片

这三类任务涵盖了具身智能最难攻克的三大瓶颈:泛化性、精细感官与多机协同。DM0.5 证明了同一个通用基模可以驾驭异构任务,终结了过去“一场景一算法”的打补丁时代。

图片

为什么 DM0.5 能成为“全科生”

DM0.5 的能力并非偶然,而是源于原力灵机在技术路径上的两个核心坚持:

  • 具身原生(Embodied Native)

行业常见做法是在现成的视觉模型上强行挂载动作层,类似于给“盲人”安上一双“假手”。而 DM0.5 是从零开始为机器人原生训练的,其 4B 参数规模由 15 万小时高质量数据喂养——其中包含 5 万小时极其珍贵的真机高精度操作数据,让模型原生具备了对物理世界的感官直觉。

  • 架构的系统级创新

为了解决机器人“走一步看一步”的短视问题,DM0.5 引入了上下文抽象层,支持长达 60 秒的时序记忆,使长程复杂任务成为可能;同时通过轨迹对齐层提升动作平滑度,让机器人的物理执行达到工业级流畅度。

这种系统级设计,让 DM0.5 在公开 Benchmark LIBERO 综合评测中达到了 99.0% 的高分;并在真机评测 RoboChallenge Table30 V2 中,实现了跨四种机器人平台的榜单第一。

图片

图片

终结昂贵资产,让规模化工程落地

具身智能要大规模落地,最大的敌人是“贵”——不仅是硬件贵,更是训练与部署的算力成本高昂。如果模型的部署依赖顶级实验室配置,那它永远只是观赏性资产。

DM0.5 第一次把具身模型的部署成本拉到了工程可接受的区间:

  • 算力平民化:开发者只需一张 4090 消费级显卡即可完成下游任务微调,部署时间最快缩短至 18 小时,算力成本直降 60%。

  • 实时交互的“生死线”:通过系统级推理优化,DM0.5 将单卡推理延迟从 534ms 压缩至 57ms。

图片

在具身智能领域,速度不只是指标,更是安全的保障。当响应进入 60 毫秒以内,机器人才能真正实现在线避障和实时自纠错,完成从“PPT 机器人”到“真实生产力”的质变。

图片

规模化的入场券,握在工程实干者手中

原力灵机 DM0.5 的全面开源,释放了一个强烈的行业信号:具身智能正在从“仰望星空”转向“脚踏实地”。

行业不再需要更多精美的 Demo 来证明潜力,而是需要一个开发者用得起、能托底的开放基座。规模化不会在实验室里自然长出来,它长在 15 万小时的真机数据里,长在 4090 显卡的微调逻辑里,长在每一个真实作业场景的 60 毫秒响应里。

先让模型用起来,让数据流转起来,把成本降下来。DM0.5 的发布,正是具身智能穿越周期、从表演赛走向大生产时代的第一级台阶。

END

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐