机器人看29s视频学会一个新技能,自变量开源HOST框架
最近有小伙伴跟我吐槽:做 Agent 最崩溃的,每遇到一个新任务,还是得重写 Prompt、改 Workflow、重新调试。
他说这话的时候,我刚看完自变量机器人开源的新项目HOST,让机器人只看一段人类示范视频,就能获取新技能,原技能也几乎不受影响。
我们聊完一致认为:这不就是 Agent 该有的样子吗?

这个项目全称叫 Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取。
论文给出的数字更直接:HOST让机器人看一段平均29s的人类视频,就能学会一个新技能,成功率 62%,比花 4个多小时后训练微调的模型还高。相比微调模型的方案,HOST让新技能学习提速了500倍,数据却只需 1/50。

接下来我们详细聊一聊,它是怎么做到的。
01 HOST凭什么看视频学会技能
之前也不是没人试过让机器人看视频学技能,但效果一直不理想。
原因有两个。
第一,人和机器人动作节奏不一样。 人倒杯水可能用3秒,机器人执行同样的动作可能需要5秒。如果按时间对齐,机器人看到的人类动作和它当前正在做的动作完全对不上。
第二,人和机器人身体结构不同。 人类的手臂和六轴机械臂完全不同,直接模仿动作根本行不通。
之前的方法基本就是硬学——把视频帧压缩成特征,直接映射到机器人动作。结果就是效果差、成功率低。

HOST换了个思路。
它先不管时间,而是管进度。
什么意思?就是把倒水这个任务抽象成一系列进度状态:开始→拿杯子→倾斜→水流出→停止→放回。不管你是人还是机器人,只要在完成同一个任务,你们就在同一个进度标尺上。
HOST用一个自监督学习的对齐模块,把人类视频和机器人轨迹映射到这个共享的任务进度流形上。
然后,视频不再是旁观者,而是领航员。
机器人当前执行到任务进度的哪个阶段,HOST就去视频里找对应阶段的下一帧,然后让机器人跟上视频的进度。

更进一步,HOST不直接学从视频到动作的映射,而是拆成三步:
- 机器人先找到,现在做的事情对应任务视频中的哪个位置?
- 根据人类做任务的视频画面,想象如果是机器人自己做动作,接下来应该看到什么画面?这一步,视角、本体构型都要转换过来,是最难的一步。
- 从想象出的机器人视角画面,推导出要实现这个画面需要做出的具体动作。
这个过程叫做自定位级联预测。
说白了就是:先搞清楚自己到哪儿了,再想象这个动作如果是自己做,应该看到什么,将结果反推出动作,最后指挥自己的手去做。
这套逻辑,跟人类“观察学习”的方式非常接近:不是模仿动作本身,而是从看到的结果,依照经验想象哪些动作能实现。
02 三个“惊喜数字”,碾压主流微调方案
HOST在50个全新的操作任务上做了测试——这些任务的技能在训练数据里完全没出现过,涵盖不同物体、不同工具、不同操作方式。
结果有三个数字让我印象深刻。
第一个数字:62%。
HOST从一段人类视频学会新技能,平均成功率62%。而同类从视频学习的最强模型AWDA(也是不微调、直接推理),成功率只有19%。HOST直接提升了43个百分点。

更狠的是第二个数字:507倍。
主流的模型Pi-0.5+SFT用50条遥操作演示做微调,成功率只有38%,还需要4小时才能完成。
HOST用一段29秒人类视频演示,无需针对新任务重新微调模型权重,学会技能的成功率就达到62%。

数据效率提升了50倍,时间效率提升了507倍。
你能想象这意味着什么吗?以前教机器人学一个技能的时间,现在够HOST学500多个技能。
第三个数字:99%。
HOST学会新技能后,在之前已经掌握的任务上保持了99%的原始成功率。
而最强的微调基线呢?学完新技能后,之前技能的保留率只有40%,一路学一路忘。

为什么?因为HOST整个技能获取过程不更新任何模型参数,完全是在推理过程中进行的。机器人只要看到任务视频,就能非常低成本地学习、复现技能。
视频本身就是技能的“存储介质”。
这意味着什么?意味着机器人可以持续累积技能,同时避免因反复更新模型参数而造成传统的灾难性遗忘。
03 机器人进家庭,最缺的就是“现学现做”
讲真,HOST最让我兴奋的不是那些数字,而是它对机器人进入家庭这件事的推动。
你想,一个家庭机器人要面对的场景有多复杂?
今天你可能让它帮忙叠衣服,明天可能是摆餐具,后天也许是收拾玩具。这些任务听起来一样,但实际面对的细节、做法可能都有不同。同样是叠衣服,你可能想让机器人叠出你习惯的做法。你不可能为每一个新任务都采集几十条遥操作数据、花几个小时微调。
家庭环境里,最自然的学习方式是什么?
就是人类演示。
你直接在机器人面前演示一遍:“看,这样收拾。”
机器人看完,很快就会了。
这才是普通家庭能接受的交互方式。不需要编程知识,不需要遥操作设备,像人与人交流一样传递技能。
写在最后
回过头看,HOST做的事,本质上是范式跃迁:从训练时微调循环,走向推理时技能获取。
在自变量机器人团队看来,具身智能想要真正走出实验室、进入普通家庭,就不能一直依赖专业人员采集数据、反复训练模型。人与人之间传递技能,最自然的方式就是做一遍给对方看;机器人也应该如此——把原本属于少数工程师的专业流程,变成普通人用一段视频就能完成的教学。
目前,团队已经公开了HOST的论文和核心代码,包含了完整的模型训练和离线数据处理组件,如果感兴趣的可以去看看。让机器人落地迈上下一个台阶的,可能就是这些技术。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)