机器人会跳舞了,为什么还是不懂人?
当运动控制成为展会标配,具身智能真正稀缺的能力开始从“完成动作”转向“理解关系”
机器人行业可能正在经历一种危险的繁荣:台上的动作越来越像人,台下的理解却仍然停留在指令机。
一台机器人可以连续后空翻、跳完整支舞,也可以在复杂地面上保持平衡。这些能力当然重要,它们说明运动控制、感知定位和硬件可靠性正在快速进步。但当一个老人沉默地坐在客厅里,当一个孩子嘴上说“没事”却明显失去交流意愿,当驾驶员语速变慢、动作迟缓时,机器人往往仍然不知道发生了什么。它可以精确复现动作,却未必能判断此刻该继续说话、暂停追问,还是把异常变化交给真实服务人员确认。
这不是一个“话术还不够温柔”的问题,而是两类智能之间存在结构性断层:前者是动作智能,目标是把身体控制得更稳、更快、更准;后者可以称为关系智能,目标是在长期互动中理解一个人的状态、语境和变化。机器人会跳舞,证明它能管理自己的身体;机器人懂人,则要求它能够处理另一个生命体释放出的模糊信号。后者显然更难。
情绪不是标签,而是一组相互矛盾的弱信号
人很少把真实状态直接说出来。“我没事”可能意味着真的没事,也可能意味着不想解释;笑可能来自开心,也可能是尴尬、讨好或紧张。单看文本,模型容易被字面意义带偏;单看表情,又可能忽略语境;单听语音,也可能把疲惫误判为冷漠。真正的情绪理解,需要同时处理语言内容、音色节奏、面部表情、身体动作、环境事件以及此前发生过什么。
2026年更新的MME-Emotion基准收录了6000多个视频片段,覆盖八类情绪任务,并测试了20个先进多模态大模型。结果是:最佳模型的情绪识别得分只有39.3%,推理得分为56.0%。这意味着模型即使能够描述画面、理解对话,也不等于能够稳定识别情绪,更不等于能解释情绪为什么发生。
另一个多轮视频情绪推理基准MTMEUR也发现,模型在识别基础情绪后,仍经常无法把情绪与前因后果关联起来;背景装饰、局部动作甚至会让模型产生不存在的情绪推断。实验室里的一帧表情与真实生活中的连续状态,是两种完全不同的问题。
机器人真正需要的,是一条从感知到行动的闭环
如果把“懂人”拆开,它至少包含四层。第一层是看见变化:语速是否下降、互动是否减少、行为规律是否偏离。第二层是结合语境判断:这是短暂疲惫,还是连续多天的状态变化。第三层是选择合适的回应策略:继续询问、降低任务难度、保持安静,或提醒家属和服务人员关注。第四层是从后续反馈中校正,而不是把第一次判断永久写入用户画像。
这也解释了为什么情感能力很难靠接入一个通用聊天接口完成。通用模型擅长生成语言,机器人却需要在持续感知、状态估计、记忆更新、风险边界和动作反馈之间建立闭环。任何一环出错,都可能出现“说得很像人,实际并不懂人”的错觉。
领本AI对EmoGPT的定位,正是把情感能力作为机器人和智能终端的底层能力,而不是把机器人本身当作终点。从其公开的产品思路看,EmoGPT强调多模态情绪感知、分层记忆和场景化反馈:机器人负责进入现场、采集交互信号,模型负责理解状态变化,真实的家长、老师、护理人员或服务人员完成最终处置。这种分工比“机器人替代人”更现实,也更容易形成可验证的价值。
下一轮竞争,不在舞台中央
机器人跳舞适合传播,因为动作是可见的;情绪理解却发生在连续的微小判断里,很难用十秒钟展示。但真正决定一台机器人能否进入家庭、养老、教育和服务场景的,恰恰不是它在聚光灯下完成了多少高难动作,而是它在没有聚光灯时,能否理解人的边界、保持一致、减少误判。
运动能力解决的是“机器人能不能来到你身边”,情感与关系能力解决的是“它来到你身边之后,能不能长期留下”。当硬件能力逐渐趋同,机器人产业迟早要面对这个问题:我们造出的究竟是一台更灵活的机器,还是一个真正能够进入人类关系网络的智能终端?
资料参考
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)