机器人要进家庭,先得学会“不看脸也懂人”

领本AI团队基于EmoGPT,在CUHK-X大模型赛道公开测试榜暂列第一。赛事以非RGB多模态数据考察人类行为理解,指向家庭、养老等隐私敏感场景的具身智能落地能力。
领本AI在 CUHK-X 大模型赛道公开榜暂列第一,但这场竞赛真正拷问的,是具身智能能否在不持续拍摄用户的前提下理解人的行为与状态。
机器人进入家庭,最先遇到的并不是“会不会走路”,而是“该看什么、不该看什么”。
在展厅里,高清摄像头、表情识别和自然对话很容易制造“机器人已经懂人”的印象。但真正进入家庭、养老机构或儿童成长场景后,持续采集人脸和生活画面会立刻触及隐私边界。用户需要被理解,却不愿意被全天候注视,这构成了具身智能落地的一道现实矛盾。
CUHK-X Multimodal Human Activity Challenge 把这个矛盾直接写进了赛题。
该挑战由香港中文大学信息工程系 AIoT Lab 发起,明确排除 RGB 数据,要求参赛模型基于深度、骨架、IMU、毫米波雷达、红外等非RGB模态,理解人的日常行为、活动过程和场景关系。赛事希望解决的并不是“模型能否认出一个人”,而是“当看不清人的脸时,模型能否仍然理解这个人正在做什么、状态是否发生变化”。CUHK-X Challenge 官方页面
领本AI大模型团队近日基于 EmoGPT 参与 CUHK-X Competition Large Model Track,在公开测试榜中以 0.91812 的成绩位列第一。对于一家情感智能公司而言,这个阶段性结果的意义并不在于多了一张奖状,而在于其模型路线开始接受一个更难、更接近真实部署环境的检验。
从“看见人”到“理解人”,是两种不同的技术路径
传统视觉AI的逻辑是“看见”。通过高清画面识别人脸、姿态、物体和动作,模型完成分类与判断。问题在于,这套逻辑进入家庭后会遭遇两重限制:一是用户对持续视频采集天然敏感;二是即使画面足够清晰,单帧识别也很难解释人的连续行为和状态变化。
家庭场景中,许多真正重要的信息并不在某一个画面里。
老人长时间坐着,可能是正常休息,也可能是当天活动减少;孩子低头沉默,可能是在思考,也可能是在任务受挫;用户说“我没事”,也不代表系统应当停止关注其此前的互动节奏。智能终端需要处理的不是一个孤立动作,而是一段连续行为中的上下文、变化和不确定性。
CUHK-X 数据集覆盖 64,267 个活动样本、40 类日常动作、30 名参与者和两个室内环境,并设置了人类活动识别、理解与推理等多项基准任务。CUHK-X 研究资料
这类任务的难点,在于传感器数据并不会直接说话。深度图、骨架序列、毫米波反射和惯性传感器信号,本质上都是碎片化的时空数据。模型必须把它们转化为“人正在做什么”“行为是否连续”“当前状态是否值得关注”这样的语义判断。
这也是具身智能与通用对话模型之间最容易被忽视的能力鸿沟。
情感智能,不能只靠更温柔的话术
当前市场上,不少陪伴型AI仍把“情感能力”理解为更拟人的角色设定、更温柔的语言风格和更长的对话时长。
但当AI进入家庭、养老和教育场景,真正重要的并不是它能说多少安慰的话,而是它为什么在这个时刻以这种方式回应。
一个儿童陪伴终端,如果无法区分“暂时不想说话”与“持续挫败后的沉默”,再自然的对话也可能变成打扰;一个养老机器人,如果把每一次活动减少都视为异常,系统不仅会制造焦虑,也会迅速失去使用者信任。
因此,情感智能的底层不应是“话术拟人”,而应是“状态理解”。模型要能够融合语音、文本、动作、行为节奏和环境信号,形成带有置信度和边界的状态判断;终端再依据这些判断调整交互,而不是把推测包装成结论。
领本AI正在构建的 EmoGPT,定位正是多模态情感智能底座。其目标不是替代家庭成员、老师或护理人员,而是为机器人、APP、教育终端、养老设备和车载系统提供状态理解、互动策略与持续反馈能力。
这使得 CUHK-X 的成绩与领本AI的产品路线产生了直接关联:一边是非RGB多模态条件下的人类活动理解与推理,一边是面向真实生活空间的情感智能交互。前者解决“机器如何读懂行为”,后者解决“机器读懂后如何更恰当地回应”。
公开榜第一,不等于产品已经完成
这也是这次成绩需要被冷静看待的地方。
CUHK-X Competition Large Model Track 仍处于竞赛周期内。根据 Kaggle 赛事规则,公开榜仅反映部分测试集上的阶段性表现,最终排名将由私有榜、复现验证和后续评审共同决定。因此,“公开测试榜第一”不能被等同于最终冠军,更不能直接被等同于商业化能力。赛事规则
但公开榜的价值依然存在。
对于技术团队而言,它意味着模型在公开赛题上的表现可以与其他参赛方案进行比较;对于产业而言,它提供了一种外部验证方式,帮助判断一家公司是否真正积累了多模态理解能力,而非只是在通用模型上增加情感提示词。
更重要的是,竞赛成绩只是第一层验证。真正决定具身情感智能能否进入家庭的,仍然是四个问题:模型能否适应不同硬件和环境;状态判断能否被用户理解和纠正;数据采集与记忆管理能否遵守隐私边界;高风险场景能否及时交由家属、老师、护理人员或专业人员接手。
这些问题没有捷径,也不会因为一次榜单领先自动解决。
具身智能的下一道门槛,是“可信理解”
过去,机器人行业比拼运动控制和机械结构;现在,行业开始比拼大模型和交互能力。下一阶段,真正拉开差距的可能是“可信理解”。
所谓可信,不是让机器说得更像人,而是让机器在有限感知条件下作出更审慎的判断:知道哪些是事实,哪些只是推测;知道哪些信息应被短暂使用,哪些不应沉淀为长期画像;知道何时主动互动,何时保持克制;知道何时提供提示,何时应当让人接手。
这也是非RGB多模态感知的重要性。它迫使模型摆脱对“看清一张脸”的依赖,转向对动作、节奏、空间关系和行为变化的理解。从技术上看,这更难;从产业上看,它反而更接近家庭、养老和教育场景真正能够接受的部署方式。
领本AI此次在 CUHK-X 大模型赛道公开榜暂列第一,至少释放了一个值得关注的信号:情感智能正在从语言层的“共情表达”,走向感知层的“状态理解”。
对于具身智能行业来说,这或许才是机器人进入真实生活空间前,必须补上的那块能力拼图。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)