春天的 2026 年, 具身智能赛道迎来了狂热浪潮。这浪潮是前所未有的, 在短短两个月内, 全行业实现了近 150 亿元的惊人融资。

当众多创业者穿梭于各门投资机构的会议室, 滔滔不绝讲述通用智能巨大场面时, 有人或许正留在实验室, 和由代码与硬件组成的机器人顽强较劲呢。

黄岩属于其中之一, 在堆满线缆以及测试道具的实验台前, 他跟学生为了弄明白机械臂于抓取复杂零件之际因何老是出现微小的物理偏差, 常常一待便是十几个小时, 他们会注视着屏幕上动态刷新的三维热力图, 反复去拆解并重新构建底层的感知代码, 直至那条机械手臂在真实的物理空间里达成一次精准贴合这一情况能出现。

黄岩有着, 这么两个身份, 它们截然不同, 却又紧密咬合。在学术界里, 他身为中科院自动化所的研究员, 还是博士生导师, 于各大国际计算机视觉顶级会议里担任领域主席。在工业界中, 他兼职具身智能新锐企业中科第五纪的青年首席科学家, 并且是一位深度参与商业落地的技术实干派。

更为关键之处在于, 他身为具身智能全栈技术的代表人物当中的一员个体, 其技术背景达成了多模态感认知技术、具身世界模型技术和强化学习技术的全方位完整覆盖。他所首要主导的模型领域创新, 深深扎根于真实的工业场景所带有的需求, 全力来解决数据短缺的困扰并且以最为极致的状态去提升数据的利用率这么一个情况。他尝试想要在这个喧嚣热闹的 2026 年这个年份当中, 运用一种近乎极客般的表现为狂热且又有着适当克制的方式, 去给复杂的 AI 算法想方设法寻找到一个能够在真实物理世界里稳健正常运行的躯体。

全栈架构师_具身智能全栈技术_具身大模型真实场景应用

近日, 机器之心对这位多模态和具身智能研究者作了独家专访, 其引用量已超1.2万。在此次专访里, 黄岩撇开热闹的行业表象, 给我们讲了讲他跟团队于具身大模型领域里探索的过程。当时行业里都讲数据量、算力问题, 他们却另觅途径, 自真实场景痛点着手, 开展了全栈式架构的重新构建, 靠一场技术实战, 把行业中的数据利用效率瓶颈给解决了。

前瞻性的技术直觉

成就国内具身智能「拓疆者」

在2013年, 将时间指针拨回到那个时候, 深度学习则才刚刚开始在计算机视觉领域突破一条路径;于当时, 学术界的主流依旧是在追寻仅仅是文本的自然语言处理、或者单单唯图像的的识别技术。

黄岩则选择了一条跨界的冷门路线:将视觉与语言进行结合。

黄岩在采访中向机器之心回忆起当初的决定, 当初决定选择视觉-语言, 往深处思量是基于对这项技术个人层面的喜好, 他觉得将这视为任务来讲其想象空间会稍大些许, 它可不是单纯去领会语言, 也并非只是专注于视觉范畴的某些所要关注的内容。

这种前瞻性的技术直觉,为他日后进军具身智能埋下了伏笔。

多模态技术飞速发展着, 到了 2019 年, 纯软件层面的算法研究缓缓地朝走向大一统的状态迈进, 并在这一年内, 为打破常规的算力堆叠, 黄岩早就对强化学习算法展开研究与创新(此算法先前在围棋 AI 里大放异彩), 还在语言驱动的视频行为定位任务上获取了当时国际领先的精度, 标点符号。

他们借助强化学习, 达成了视觉 - 语言模型类人时空选择性注意等认知机制的增强, 模型仅需动态跳转五至八次就能快速捕捉视频里的关键行为信息, 全然无需耗费时间与精力去提取时空目标框, 这使得执行效率显著提高至七倍, 此项具有开创性的工作也顺利入选计算机视觉顶级会议 CVPR 的 Oral 论文, 进入前百分之三顶尖行列有了一席之地。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

有一位作者, 在2019年, 发表了一篇CVPR方面的论文。这篇论文, 它非常具有开创性地, 针对「通过句子查询来定位活动」这个问题, 展开了探索研究, 不仅取得了成果, 还由此提出了一种语义强化学习模型, 最终获得的成绩实现了SOTA。

在多模态大模型时代, 那种强化学习基因, 结出了新的成果。此成果针对现今多模态大语言模型也就是 MLLM, 在跟人类偏好对齐层面有的显著短板, 中科第五纪团队里多名成员投身其中, 推出代表物 MM-RLHF。其不但构建了彼时规模大、覆盖场景广的, 多模态偏好数据集, 还提出一种能解释为何回答有好有差的新型奖励模型架构, 并且用 MM-DPO 算法辅助, 成功避开传统强化学习训练不稳定以及超参数敏感的问题。多模态领域里有着这样一项工作, 它在首个系统性方式上, 把强化学习技术扩展到了全方位人类偏好对齐方向, 这一工作使得大模型从能力构建阶段, 步入到了价值对齐的阶段, 而此即一个标志。

但是, 不管是多模态感知, 还是价值对齐, 要是不和真实的物理世界产生物理接触, 算法的潜力终究会受到限制。黄岩察觉到, 得给这些算法配备物理躯壳, 因而他最开始选取把视觉 - 语言算法直接应用到机器人导航上。

当从静谧的服务器云端踏入满是杂物且存在摩擦力的真实物理世界之际, 现实迅速给他上了极为残酷的一课, 在早期的真机部署尝试当中, 团队遭遇了极其致命的虚实迁移难题。

黄岩指出了其中残酷的现实, 他强调模拟器数据与真实数据差异极大, 在模拟器里有80%的准确率, 拿到真机上可能连10%都没有, 这种极端落差极有可能发生, 而最大的问题在于, 我们在虚拟空间或者模拟器中训练出的一个非常出色的导航模型, 是无法直接部署到真机上的。

模拟器数据跟真实数据间存在着巨大的分布差异, 这使得黄岩深切体会到物理世界具有不可预测性, 在这场从零点启动的探索里, 他没有选择退缩, 而是被激发起了技术狂热者所拥有的斗志, 他清楚, 若想要切实驯服机器人的物理躯体, 那就必须摒弃对仿真数据的完全依赖, 再度回归到真实世界当中, 于底层架构方面寻觅提升真实数据利用率的解决办法, 这还为后来中科第五纪一系列全然围绕真实场景痛点而展开的架构创新奠定了基调。

全栈技术硬核「实干派」代表

对抗算力与数据的狂热

在当下这个具身智能赛道之中, 把处于大语言模型领域的那个Law给平移过来, 好像已然变成了一种行业内的共识。众多的初创企业以及头部大厂, 尝试借助搭建起庞大的数据工厂, 采用以暴力堆叠算力以及海量数据这样的方式, 来促使具身大脑成熟。

面对这种对算力与数据的狂热迷信,黄岩保持着冷静的审视。

其实,早在行业喜好沉浸于数据堆砌的起始阶段之时, 黄岩便具备先导性地预料到了这条途径所存在的极强程度的挑战。然而, 他始终坚定不移所秉持的这条有着极少样本以及新架构特征的冷门道路, 在较早时期也曾遭遇过来自外界一方的质疑。

黄岩在采访里回忆起了那段时期, 那时的环境状况下, 大家都聚焦于具身大模型的通用性以及泛化性, 甚至还宣称要在两三年的时间之内训练出一个可进入家庭的具身大模型, 走那样一种高举高打的路线。

面对这般狂热的行业情绪, 黄岩从纯粹讲究技术的角度, 给出了冷静的判断, 他觉得在短期内, 真正去做出一个通用的具身大模型, 并且进入家庭, 这是极具挑战性的, 而且时间很可能远远不够。

黄岩表示, 我们历经很长时段的讨论, 最终选定了一条较为务实的路线。他引领团队毅然舍弃了追逐短期的通用神话的行为, 而是转向聚焦真实的工业场景, 有目的地去处理样本量少 、可靠性低等最为核心的产业痛点。黄岩在采访里道出了自己的判断, 想要达成具身领域的Law, 它的数据量必须提升得极为迅速, 数量要特别特别多。仅仅在数据量十分充足的情形下, 我们再去提高算力和参数量才是具有意义的。他持有这样的看法, 依据当下物理世界交互数据所拥有的积累速度, 要是一味地去提升参数量, 那么极有可能需要耗费很长的时间才能抵达引发智能涌现的那个时间点句号。

行业首创超少样本大模型,拒绝暴力堆叠

作为一名务实的全栈技术代表人物, 他不去等待那种虚无且飘忽、极其渺茫的海量数据大批量出现。凭借针对数据瓶颈做出的精准预判, 黄岩跟中科第五纪共同联合中科院自动化所团队, 用心、专注地进行打磨, 依据在更早之前就已开发的, 进而推出了在行业当中首个超少样本大模型FAM系列。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

这称得上是一回极客美学的底层重新构建, 并且是难得的、全然围绕着解决具身智能场景痛点去设计的专属架构。

当我们实实在在存在海量数据之际, 直接借助数据开展暴力拟合或许是最为简单、直接且迅速有效的办法。黄岩一下子就点明了当下主流视觉 - 语言 - 动作(VLA)架构的痛点所在: 然而现有的架构丢弃了极多的高维空间结构信息。

他向我们诠释了传统架构里那致使的维度阻碍因素, 模型的输入常常是二维乃至三维的视觉信息, 输出同样是三维的动作, 然而在模型内部进行处理之际, 却被生硬地压缩成了一维的呈现形式。

「于这一压缩进程之中, 诸多跟空间结构关联紧密的信息被舍弃掉了, 留存下来的大多乃是偏向语义层面的内容, 像物体名称、属性、颜色诸如此类。」黄岩作出解释, 「这些语义信息对于精准的动作生成虽说有所助益, 然而不会格外显著。」。

中科第五纪同在中科院自动化所团队, 为把丢失的三维空间给找回来, 去解决工业现场数据匮乏方面的难题, 于FAM模型之中引入了全局跟局部协同的那种精妙设计。

具身大模型真实场景应用_具身智能全栈技术_全栈架构师

是一款新型的 3D VLA 模型范畴, 其处于统一的 2D 图像空间当中, 将输入与输出予以对齐, 运用 2D 热力图在对象定位这项任务之上展开预训练, 并且在 3D 操作的动作预测任务里进行微调, 于仿真以及真实世界内的实验成果表明, 其能够富于成效且高效地学会 3D 操作。arXiv:2506.07961。

黄岩揭示了其中的核心原理, 那就是, 我们主要是把模型中间层, 从一维特征拉高到三维的热力图, 以便让整个空间结构建模能力能够在模型中间流动起来, 这种无损传递空间信息的设计, 让模型在很大程度上摆脱了对庞大数据量死记硬背的依赖。

与此同时, 有这样一种为具身场景专门设计的架构, 它给中科第五纪所拥有的具身机器人赋予了一种十分罕见的认知能力。这种认知能力是「既可看到森林, 也能瞧见树木」, 其中的「能看到森林」是指它能够借助三维热力图来开展全局的空间结构建模,「能瞧见树木」则是说它还可以凭借独创的局部注意力机制, 精确且准确地锁定料箱把手、零件边缘等关键的操作点。

具身智能全栈技术_全栈架构师_具身大模型真实场景应用

那个「既见森林, 又见树木」的比喻, 是源自一篇 CVPR 2017 的论文, 而这篇论文的参与者是黄岩。

这种全局跟局部的毫无缝隙的协同, 再加上针对真实场景痛点的有方向的攻坚, 成就了中科第五纪在全球范围内有极强统治力的小样本技术表现。

在实际的工业落地情形里, 这样的架构创新转变而成了一种强大的实战能力, 面对全新的任务时, FAM模型在达到极限情形下, 仅仅只需要3至5条真机演示数据, 就能够达成非常可靠的部署, 基础任务成功率能接近97%。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

中科第五纪凭借这般冠绝行业的数据利用效率开展行动, 此行动定向进行, 成功击穿了那长期困扰具身智能落地的「数据荒」壁垒, 是这样的情况啦。

与此同时, 模型的泛化能力会获得极大程度的提升, 哪怕面对的是光照出现变化、环境背景复杂、存在干扰物体等极具挑战性的泛化场景态势, 这个模型依旧能够维持高度的稳定状态, 这种具备极其低廉成本的部署能力, 正是达成工业场景商业闭环的关键要点所在。

具身智能全栈技术_具身大模型真实场景应用_全栈架构师

利用世界模型,做具身安全的守卫者

要是在操作层面所进行的创新是旨在「能够干活」, 那么把世界模型引入到执行端, 这便是黄岩为了「安全地干活」而设置的一道保险措施。

对于那些期望跑通商业闭环的企业来讲, 工业安全是一条不能避开的红线。黄岩于采访里列举了极为具体的落地痛点, 比如说, 在进行产品出厂前的质检时, 有时操作施加的力相对较大, 致使东西被拉坏了, 又或者是操作半径过大, 碰到了周边的其他物体, 而这些情况都会产生潜在的安全隐患。

他最开始的出发点极为径直: 要借助世界模型去看出未来的那种能力, 使得大模型在感应发觉到是未来的情形状况之时, 创造出更精准确凿的行为表现。

然而, 使机器人切实学会预演未来存在着一条极大的鸿沟, 视频生成模型看懂的是像素, 机器人输出的动作是坐标系当中的位姿。为了跨过这道坎, 中科第五纪联合中科院自动化所团队推出了世界模型, 当中引入了极富巧思的本体掩码(Mask)设计。

具身智能全栈技术_具身大模型真实场景应用_全栈架构师

流程进行概述,将动作借助URDF以及相机参数投影到像素空间掩码里, 开始的图像与掩码序列被VAE来编码, 靠分支把掩码特征注入到DiT主干当中, 此模型去生成跟动作相符的视频, 训练期间采用扩散、动态一致性以及基于流的目标函数, arXiv:2602.03793。

黄岩作出解释, 说道, 我们主要是想要去规避那种直接从坐标点映射到视频像素的困难, 从本质上来说, 此举是把不同的行为序列, 直接转化到像素的层面之上。通过把抽象的坐标实时渲染成为二维图像上的动作剪影, 预训练的视频大模型瞬间就能够看懂机器人的动作意图, 进而真正打通视频生成与具身世界模型之间的桥梁。

全栈架构师_具身智能全栈技术_具身大模型真实场景应用

于DROID数据集之上的单臂操作展开预测, 特别是在「未见视角」的测试里, 对比的方法时常会出现画面崩塌以及肢体错位状况, 然而其依旧能够生成物理上合理且视觉连贯的未来视频, 这充分地验证了它那视角的鲁棒性, 在「未见场景」(全新的桌面布局、背景)情形下, 其泛化能力同样表现得出色。

探索具身强化学习前沿的架构师

在多模态感知跟着世界模型之外, 黄岩朝着技术追求的方向还延伸到了强化学习这一领域。为了能进一步把跨场景的泛化所能具备的能力予以提升, 并且将交付层面的成本降下, 团队开启了具身强化学习接着进行的训练, 且完成了一项有着 E-TTS 名称的「在具身测试这个时段所作拓展」前期相关工作。

当下存在的VLA强化学习办法, 一般先是去生成中间推理情况, 之后再去生成动作, 这样的一种方式常常只是对动作空间进行强化学习, 然而却将推理质量对于动作的决定性作用给忽略掉了。

其一, E-TTS 框架解决这一痛点借助三个核心机制, 首先是推理与动作的联合扩展, 此扩展是同时对推理轨迹以及动作候选进行扩展, 其二, 并且是历史感知的闭环验证, 该验证是相结合已然过去的历史推理以及动作对从而得以捕捉长程依赖, 其三, 最后是自适应在线选择策略, 这一策略是凭借动态分配计算资源以防止陷入局部最优。

这项工作呈现出了非常高的工程实用价值, 它不像传统的PPO算法那样去更新模型权重, 也不像传统的DPO算法那样去做, 它不需要收集额外的专家数据, 也不需要进行微调, 极大地降低了落地的门槛, 在这一框架里, 验证器充当了过程奖励模型的角色, 在每一步对推理以及动作的质量去进行打分, 实现方式格外轻量、灵活。

更关键的是, 此项研究给整个行业证实了一项极具启发意义的结论, 在机器人这个范畴, 仅仅凭扩充模型的大小或者数据集大小, 这比不上在进行推理的时候去引入那种被叫做「慢思考」的机制来得有成效, 这给计算资源受限制的情景里的机器人智能水平提升开拓出了一条全新的途径。

这种全栈式架构重构, 不卷算力, 专注数据利用率, 完全围绕真实场景痛点展开, 正是黄岩及中科第五纪能否在商业化大考中崭露头角的核心底牌。

探寻本源,将「人类认知」刻入机器大脑

拨开FAM模型的技术外衣, 拨开世界模型的技术外衣, 拨开E-TTS强化学习框架的技术外衣, 黄岩及其团队所有架构创新存在深层驱动力, 这种深层驱动力源于一种极客执念, 而这种极客执念是试图在硅基芯片上复现碳基智慧。

于学术界之中, 黄岩出版了一本专著《Deep 》, 该专著探讨的是深度认知网络。这部著作的核心思路乃是, 借助模拟人类的认知机制的方式, 以此来增强深度学习的能力, 并且相关成果还荣获了 2024 年北京市自然科学一等奖。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

中科第五纪与中科院自动化所共同合作研发出了许多的技术创新, 而当中那种对于人类认知机制有着深度拆解行为, 构成了其理论性质的基础依托 , 此基础乃合作生成众多技术新意所倚仗的根本。

黄岩向机器之心概括了他历经十余年所开展研究的一条潜藏的主线, 那就是, 我们致力于关注人脑的注意机制, 关注人脑的记忆机制, 关注人脑的推理机制, 关注人脑的决策等认知机制, 进而去达成它的信息选择性过滤这一认知功能, 达成它的知识存储复用这一认知功能, 达成它的动态推理这一认知功能, 达成它的主动决策等认知功能。

是 FAM 模型如同人类双眼那般开展局部注意力聚焦, 还是 世界 模型好似人类大脑一样针对未来物理操作开展安全预判, 又或是 E-TTS 框架之中引入的「慢思考」推理机制, 其核心机制都在试着构建一套契合具身认知规律的智能系统。

鉴于这一套模拟人类认知的「大脑框架」已然有了初步的形态, 它急切地需要海量的数据资源来开启运行。真实的物理交互数据极为昂贵, 而黄岩早就把眼光投放到了另外一座庞大的宝藏之地: 互联网上数量众多的人类操作视频。

将机器人直接弄明白以使得其看懂人类的教学视频, 并且能够学会进行操作, 这属于具身智能这个领域里被大家所公认的圣杯当中的一个, 在这其中存在的阻力明显能够见到。

网络之上实际上是存有诸多操作视频的, 然而它们缺少动作标注, 黄岩点明了直接借助这些数据的最大痛点, 要是我们径直让人工去做动作标注, 事实上极为困难。

为绕开麻烦的人工标注步骤, 切实把那些沉睡的视频资产激活, 中科第五纪连通中科院自动化所提出了一种叫 EC-Flow 的流预测框架。极具前瞻性的此项研究成果已被计算机视觉顶级会议 ICCV 2025 接纳。

具身大模型真实场景应用_具身智能全栈技术_全栈架构师

EC - Flow, 也就是以本体()作为中心的流预测网络架构。分支(a)是本体流的预测分支, 分支(b)是目标图像的预测, 而这一预测作为辅助任务, 其作用是用于把流与对象交互以及语言指令对齐。arXiv:2507.06224。

黄岩阐释方案精妙解题思路时称: “我们试着留意其处于中间层面的运动情形, 像图像里机械臂关键点的特定运动轨迹。在获取这些运动轨迹之后, 借助机器人本体的配置文件, 从中解算出它精确无误的行为。”。

全栈架构师_具身智能全栈技术_具身大模型真实场景应用

在真实世界的开冰箱任务上的流预测和实际任务执行示例。

经过这样的途径, 机器人好像具备了「看视频自学」的本领。当面对像被遮挡物体, 可变形物体操作这类很有难度的任务之际, 它的成功率相较于那个时候的最佳方案, 分别提高了62%以及45%。

具身大模型真实场景应用_全栈架构师_具身智能全栈技术

Meta-World 基准测试上的模拟结果。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

在真实世界操作任务上的结果。

这项技术具备的巨大潜力, 也致使国际顶级学者予以了关注, 在斯坦福大学李飞飞团队于近期所发布的研究里, 就引用了这篇论文。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

论文中引用 EC-Flow 的内容。

先将这种提升数据利用率的巧思应用到数据合成领域, 是中科第五纪联合中科院自动化所做的事, 除了挖掘现有视频还有此行动, 并且还研发了一键生成多视角数据的技术, 有这样的成果产出。

在实际场景的采集当中, 多个摄像头的布置花费很高昂, 并且单个视角经常容易遭遇视觉被遮挡的风险。黄岩表明, 这种具身跨视角数据增广办法的关键优势在于, 可依赖单一视角的演示数据, 自动形成多角度且高保真的机器人训练数据。这一套办法结合了动作重定向以及生成式视频修复技术, 借助自监督学习达成, 整个流程完全不需要人工进行标注。该方法生成的数据被用于训练后, 模型在已知视角里的任务成功率提升了 18.3%, 在全新视角下的任务成功率提升了 25.8% , 且提升比率处于最高程度。

全栈架构师_具身智能全栈技术_具身大模型真实场景应用

具身大模型真实场景应用_全栈架构师_具身智能全栈技术

在二零二六年, 这是以落地变现作为主旋律的年份里, 黄岩仍旧保留着, 对于技术本源存有纯粹好奇。他身处于追求务实的商业战场上, 小心翼翼地守护着, 那份属于极客的终极浪漫。

双线作战,迎接 2026 年的商业大考

假设, 在顶级会议发表论文、探索认知机理属于极客的那种终极浪漫, 那么, 2026年具身智能赛道的商业化现实, 便是一场冷酷的生存淘汰赛。

如同中科第五纪创始人兼CEO刘年丰所察觉到的那般, 一级市场对于机器人的认知已然变得极其务实。比如说, 去年的时候投资人更倾向于通用的具有身体智能方面的叙事, 可是现在人们更加看重的是能不能率先一头钻进一个具体的场景之中, 并且把相关的工作给做好圆满完成。投资人以及客户已经跳过了那些花里胡哨的演示视频, 他们当下仅仅重视一点, 亦即机器人于真实场景里能不能创造出实实在在的复购率。

这场务实的商业大考里, 中科第五纪交出了答卷, 这份答卷极具说服力。2026年初的时候, 公司在短短一个月内, 接连完成了融资, 这轮融资规模达数亿元 , 属于Pre - A及Pre - A+轮融资, 而这恰恰是对中科第五纪技术路线的直接背书, 该技术路线从真实工业痛点出发、脚踏实地。

没有凭空出现的, 是资本的看重以及坚实的技术屏障。中科第五纪背后核心研发团队, 来自中科院自动化所, 还来自清华大学, 这是一支有着长达十余年技术潜藏的科研团队。

回溯团队的发展进程, 他们身为国内较早投身多模态研发的先驱者一员, 还在学术跟工程的交汇之处留下了诸多具有开创性的里程碑。早在2013年, 他们发表了视觉——语言理解领域的第一篇ICCV论文;2016年把注意力机制引入多模态匹配任务且达到国际领先水平;2019 年率先开展视觉——语言——导航(VLN)模型的研究, 并且在较之于2023年在全球率先达成了这个模型的真机部署。

全栈架构师_具身大模型真实场景应用_具身智能全栈技术

中科第五纪的发展历程。

2016 年, 该团队斩获 IROS 机械手抓取与操作冠军, 这是在实战对抗中取得的成绩。到 2024 年, 其研发出业内首个世界模型的 VLA 大模型。再到 2025 年, 该团队接连夺得 CVPR 通用操作泛化性挑战赛冠军与 ICRA 机器人虚实迁移冠军。在具身智能的演进之路上, 这支队伍始终展现着硬核的集体作战能力。

于这样一支, 兼备学术深度以及工程落地能力的队伍之内, 在这个, 要求颇为严苛的商业考场上, 黄岩务必, 在两种身份之间, 维持精准的平衡。

身处学术界时,他得引领学生去探索前沿领域, 即便要面对极高的失败概率;置身工业界里, 他要从实际场景当中提炼出关键的科学问题, 随后据此展开模型算法的研发工作。

为把领先的技术壁垒转变成真实的产业生产力, 中科第五纪构建了完整的交付能力, 这个能力涵盖从底层架构到软硬协同, 它面向客户直接交付具身大脑和具身机器人, 这些具有通用泛化能力。

在硬件实体的层面上, 团队推出了自行研发的轻量化轮式具身的机器人, 这款机器人身高是187厘米, 它的全身具备着28个自由度, 它那种仿人形的手臂把高负载以及高精度力控集中于一体, 具备着亚毫米级的装配以及作业的能力, 能够满足全天候的连续作业的需求。

具身智能全栈技术_具身大模型真实场景应用_全栈架构师

处于生态赋能维度之下, 身为具身大脑供应一方的中科第五纪, 正朝着广大得多的众多行业进行渗入。当下, 这家公司已先后和好些出名的大型央企开展合作。

这种商业落地的策略, 黄岩对此有着鲜明的定位: 「具身智能的真正阻碍之处在于大脑所具备的通用性以及泛化能力。我们借助将模型大脑提供达成赋予各式繁杂硬件本体的能力, 如此在能以使机器人更快速地切入现实使用作业场景的同时, 亦能够凭借具有规模性质化的产品的销售, 来对我们已然存在的数据体系进行反向给予支持。」。

中科第五纪, 伴随商业版图持续扩展, 凭借过硬落地能力, 正朝着「让百万机器人服务于人类」的愿景, 稳步向前迈进。

具身智能全栈技术_全栈架构师_具身大模型真实场景应用

结语

临近采访结束之际, 我们的谈话内容转回到那条真实的产线, 此产线布满了杂物, 并且光线变幻莫测。

行业客户们抛出那个常被提及的, 极为严苛的「适应新场景需要多久」的问题时, 中科第五纪的机器人已做好准备, 它们无需在模拟器里跑几万次, 也不依赖大量服务器集群去强记每个像素的改变, 只要人类工程师带它们在现场做3到5次示范, 它们就能凭借内部流动的空间热力图, 瞬间领悟操作的物理真谛。

这份底气, 是中科第五纪团队换来的, 也是中科院自动化所团队换来的, 是经过13年技术蛰伏而得的。

在时代、这个算力焦虑正蔓延的, 这位年轻技术狂热者、还有实干家证明了一件事, 想要驯服庞大、复杂的物理世界, 靠的绝对不能是盲目的、算力堆叠。只有怀揣着对底层认知的敬畏, 在每一次代码重构中, 将数据的利用率推向极致, 具身智能的齿轮, 才能真正与人类社会的工业齿轮、完美咬合。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐