8月22日, 《科创板日报》有讯传来, 记者是李佳怡, 8月19日至23日这个时间段, 2026世界机器人大会于北京亦庄举行, 展馆那里人头攒动, 观众们所追逐的并非在于能走能跳的这种“炫技”表演, 其实是一台台具体来说能够拧螺丝, 能够拣货, 还能够执勤的机器人。

但是, 就是在那些能够被看见的产品的背后, 一场围绕着大脑、数据、灵巧手这三大环节所展开的产业链暗战, 已经悄然无声地开始了, 而这场暗战, 它成为了决定具身智能能不能够走出实验室的关键变量。

大脑:从VLA到世界模型,谁在构建机器人的“思考中枢”?

在本届WRC期间, 《科创板日报》的记者察觉到一种明显的趋向, 电机、关节模组以及传感器等关键零部件的供应链已然迈向成熟阶段, 硬件方面的差距正被迅速消除。当“躯壳”不再成为阻碍时, 竞争自然而然地朝着上游转移, 今年众多参展商纷纷展示出模型、算力与泛化能力的新举措。

全栈认知负荷_具身智能大脑模型_具身智能数据采集方案

在北京人形机器人创新中心于展会期间发布大一统模型-Unify之际, 其集成包括VLM视觉理解、Model动作操控、WFM世界模型的三重能力, 这一举动打通了理解、推理、预演、执行的全智能闭环, 并且实现了天轶真机部署操作全流程的跑通。

同一时期, 北京人形正式进行宣告, VL 2.0投入商用阶段, 它是国内首个经由网信办备案得以通过的具身大模型, 能够支持任务规划, 能够支持意图理解, 还能够支持人机交互。

走出另一条技术路线的星海图则, 其首席科学家赵行在论坛上拆解了VLA模型G0.5, 视觉观测、语言指令以及动作都各自被离散化为Token, 然后像GPT那样逐个输出。

有记者从《科创板日报》那儿了解到, 在八月底之时, 星海图就要推出G0.5模型的Max版本了, 而到那个时候, 这个版本会进行全面的开源。

赵行表示, 虽说大家都满心期待着具身智能的时代究竟何时降临, 然而我们认为存在这样一条极为平常的便捷路径, 即如同打造GPT那般的自回归模型, 先是逐个输出Token再对训练模型予以训练。

具身智能大脑模型_全栈认知负荷_具身智能数据采集方案

全栈大脑2.0的蚂蚁灵波, 呈现出“一脑多机”的产业化路径。得到证实的是, -VLA 2.0于预训练阶段纳入6万小时高质量真实物理数据, 涵盖17个主流机器人品牌的20种机器人构型。

其展台里最为核心的展项乃一间按照1:1比例复刻的智慧药房, 《科创板日报》的记者于现场见到, 当观众下单之后, 机器人能够有条不紊地从货架之上取下对应的物品, 当前, 蚂蚁灵波机器人已经在上海国大药房正式开始上班承担夜晚的分拣工作。

具身智能大脑模型_具身智能数据采集方案_全栈认知负荷

具身原生世界基础模型, 被章鱼动力正式发布, 它承担着机器人的认知职能, 承担着机器人的推演职能, 承担着机器人的决策职能, 能使机器人理解不同任务背后共同的那些物理规律。据了解, V0.5采用了MoT架构, 其参数规模为10+B, 训练数据累计到了30+万小时, 涵盖大规模异构图像, 涵盖视频, 涵盖带动作标注的机器人动作轨迹。

具身智能竞争发生升级, 从大一统模型迈向自回归VLA, 从“一脑多机”步入世界模型, 已由“有没有模型”这一方面, 转变为“模型能不能规模化、能不能进行泛化”这等方面。

数据:物理AI的“燃料”之争与“数据荒漠”破局

大语言模型的兴起已然充分证实, 数据规模对模型上限起着决定性作用。然而, 一旦将相同的逻辑应用于物理世界, 问题便开始变得棘手起来, 机器人所需的数据, 其采集难度远超文字, 成本更为高昂, 且噪声也更大。

觅蜂科技方向有关记者表明, 主流大语言模型的预训练数据达到了100万亿token, 这等同于100亿小时的数据。然而, 物理AI所需的数据有效信息密度是更低的, 噪声是更高的, 其对数据的需求量是更大的。

全栈认知负荷_具身智能数据采集方案_具身智能大脑模型

觅蜂科技在此次WRC中, 带出了完整的MEgo系列无本体采集产品, 其中, MEgo整机重量仅有560克, 它能支持毫米级空间轨迹定位以及亚毫秒级全局同步, MEgo View采用了“头部300°全景 + 腕部细节双视角”架构, 凭借该架构一人就能够独立完成全场景分布式数据采集。

有工作人员告知《科创板日报》的记者, 当下MEgo系列产品达成了量产并完成发放, 于诸多真实场景里采集数据, 这些场景涵盖工厂、物流、超市以及家庭等。

全栈认知负荷_具身智能大脑模型_具身智能数据采集方案

光轮智能发布了全球首个全模态人类开源数据集, 这个数据集达到了十万小时级, 它覆盖了7大类环境, 涵盖128类场景, 有15000余个采集场景, 还包含15000余项任务, 采用头部与腕部双视角采集, 首批数据将在Face和同步开源, 可面向学术研究与商业训练被使用。

由光轮智能联合创始人兼总裁杨海波讲出, 当下具身智能亟待高质量的数据支持, 还急需多样性的数据提供, 更需要大规模的数据供给。并且, 光轮智能同时推出了5年规模达100亿数量的具身智能数据共建计划。

京东云展台针对京东“两年1000万小时高质量数据采集计划”里的家政服务场景进行了一比一还原。其中, 可以见到《科创板日报》的记者于现场, 看到有家政阿姨佩戴着京东云自行研制开发的头戴式数据采集设备, 向观众展现人类实操数据是怎样进行采集的。

灵巧手:从“能抓取”到“会干活”的最后一厘米

哪怕一台机器人有着最为聪慧的“大脑”, 也有着最为灵敏的“小脑”, 然而要是其末端执行器连螺丝都捏不稳呢, 并且连鸡蛋都拎不住, 那么所有的感知以及决策最终都没办法转化成生产力。所以, 灵巧手可以说是机器人从“能看会动手”跨越至“能干又会做”的最后一厘米。曾经身为机器人“顺便配备”的灵巧手, 也渐渐迈向具身智能赛道最重要的位置。

具身智能大脑模型_全栈认知负荷_具身智能数据采集方案

灵心巧手所展出的, 乃是灵心巧匠全自动机械臂产线, 它是由众多台工作台集群建造而成, 这些工作台中的每一个, 都在双臂双手的形态下, 运载着 Hand 系列灵巧手。它可以自行完成从零部件抓取, 延伸到装配, 最后直至成品下线的整个完整流程。在此之中, 拥有 20 个全体完全独立活动关节的直驱型 Hand O30, 达到并实现了从手指根部一路走来, 再朝着指尖方向前行最终实现全程链路直驱控制的目标。

以此同时, 面向大模型训练的数据需要, 灵心巧手展露出了Open数据收集体系。Open含有支持众多外连器械、众多机械臂、众多灵敏手的开放式硬件系统布设架构, 能够与此同时收集视觉、触觉、本体感知三种模态数据。

全栈认知负荷_具身智能大脑模型_具身智能数据采集方案

章鱼动力构建了完整的技术体系, 该体系为“脑-手-数据”。它发布的OctoH-Hand高自由度仿生灵巧手, 采用的是腱绳+小臂电机直驱混合驱动方案, 有着23个主动自由度, 还搭载了超1900个触觉传感单元, 能够完成夹花生、拧瓶盖等精细操作。

具身智能数据采集方案_具身智能大脑模型_全栈认知负荷

由禾赛科技三位联合创始人李一帆、向少卿、孙恺一同创立的AI机器人公司, 在此次活动中带来了Wave系列灵巧手, 该系列采用类人构型且尺寸与人手相同, 集成了22个主动自由度以及高分辨率自研视触传感器, 针对开发者、科研机构以及机器人公司的各异需求, 还同步发布了特别版本Wave SE, 提供了更具灵活性的选择。

有工作人员, 向《科创板日报》的记者去介绍, Wave的核心创新当中的一个, 是在于视触觉技术路线, 和传统压力传感器方案不一样, 它的指尖内壁嵌入像素网格, 内置微型摄像头, 通过观察接触形变来感知物体, 实现视觉与触觉的双模态融合, 进而避免单一感知路径可能会带来的判断误差。

WRC这一届, 自大脑起始, 历经数据阶段, 直至灵巧手, 明确地描绘出了具身智能此三大核心环节竞争的图谱, 当硬件躯壳朝着同质化方向发展时, 真正的壁垒正朝着上游移动, 模型是否可以泛化, 数据能不能够规模化, 灵巧手可不可以在真实场景里稳定地开展作业, 这三者紧密相连, 构建起了从实验室到生产力整体的闭环。

(科创板日报记者 李佳怡)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐