具身智能的常识难题:机器人为什么读不懂生活

一、常识为什么难住机器
1、 人从小在物理世界里摔打,知道杯子满了会洒、门要从这边推。这些没写进说明书的"默认知识",机器人并没有,它得被一条条显式教,而人类自己都未必意识得到这些"默认"的存在,教的人先得发现自己知道。
2、 大模型有书本常识,却缺身体常识。它知道"水会洒",但不知道机械臂该以多慢接近杯沿才不会碰倒,书里不会写这种手感数字,身体记住的东西文字描述不出来,机器自然没有,认知和身体是两套。
3、 这类默认知识很难写成规则。你以为"显而易见"的动作,对机器而言每一步都要被显式教,缺口比想象中宽得多,教一条漏十条是常态,规则写得越细越发现自己根本没意识到还有那条规则,越补越发现自己无知。

二、缺常识会出什么洋相
1、 在实验室走得好好的机器人,进到杂乱客厅可能卡住:地上有拖鞋、沙发会塌、孩子会突然冲过来,它没预案,当场死机或乱动,训练场里的干净和家里的乱完全是两个世界,泛化在长尾处崩塌。
2、 更隐蔽的是"过度执行"。你让它"把碗收了",它连灶台上的热汤一起端走,因为它分不清哪些能动、哪些有危险,只认字面指令,把"碗"理解成了"碗及其附近一切",好心办坏事,听话听成了盲从。
3、 更麻烦的是长尾。绝大多数时候正常,偏偏某次环境异常就犯傻,而这次恰好代价最高。鲁棒性最怕的,就是这种"平时都好、出事要命",一次失误抵消一百次顺利,却最难提前测出来,风险藏在概率最小的角落。

三、怎么补这块短板
1、 一条路是让机器人在仿真里大量试错,把"碰倒杯子""烫到手"的代价提前付掉,再迁移到真实身体,出丑不出在真现场,试错成本被压到几乎为零,敢放手让它摔,摔够了才敢让它真上手干活。
2、 另一条路是给任务加约束语言。用自然语言把"别动热源""先让路"说清楚,把常识转成可执行边界条件,让模型知道哪里不能越,用规则补上它缺的那块默认知识,话说在前头它才不会做在险处。
3、 还有一条路是让人示范。你做一遍它看一遍,把"怎么拿碗不碎"的动作序列直接学去,比纯语言描述更准,因为示范里带着人自己都没说清的分寸,那是身体记忆,旁观者学不会只能做给看,示范胜过千言。

四、身体经验无法全靠文本
1、 纯靠互联网文本训练,永远补不上"手感"。力度、平衡、触感这类信号,必须来自真实或高保真模拟的交互,文字描述到不了肌肉层面,模型能说出"轻拿轻放"却不知道"轻"是多大,知道和做到隔着一层皮。
2、 这也是为什么很多团队把采集真实交互数据当成核心资产。手感数据越厚,机器人越不像"第一次上门的陌生人",面对新物体时更敢下手,数据厚度直接换算成它干活时的从容度,老手和新手差的就是这层厚度。
3、 所以数据闭环很重要。真实交互越攒越多,模型对"手感"的估计越稳,泛化到新物体时才少出洋相,补数据的节奏决定它变聪明的快慢,闭环转得勤,它长本领就快,慢了就一直像新手,数据不生本领不涨。

五、给用户的正确预期
1、 别期待机器人一上来就懂全家。先把它圈在固定动作里,比如叠同款衣服、收同款碗,范围越小越稳,成功率才上得去,贪多让它同时面对十种不确定,只会处处露怯,小步快跑比大步摔跤强。
2、 把常识当成渐进获得的能力。每多跑一个月、多纠一次错,它才慢慢从"照做"走向"会看场合地做",急不来,也不该一次到位,常识是攒出来的不是装进去的,耐心换稳定,按月看它才看得出长进。
3、 验收也要换标准。别问"会不会做",要问"在多少种乱法下还做得对",鲁棒比一次成功更说明问题,也更能预测你家里的真实日子,一次漂亮不如百次不翻车,稳定才是能托付的指标。
六、常识也能被评测吗
1、 常识不是不能测,只是难测。给它一个"杯满会洒"的情境,看它是否主动放慢动作,比考它背定义更能暴露真实理解,考行为而非考知识,才能分清它是真懂还是背过,纸面满分不代表手上稳。
2、 评测要进真实或仿真环境。光在文本里问答,模型能编出漂亮答案,但手会不会抖、步子会不会停,只有动起来才看得出来,纸面考不出身体,环境才是最诚实的考官,动起来才露真本事。
3、 企业可自建常识题库。把你家场景里那些"理所当然"的动作列成小题,定期让机器人过一遍,哪里犯傻补哪里,把常识缺口变成可跟踪的清单,补常识也成了有节奏的运营,清单越厚它越像自己人。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)