一、人形机器人共情算法设计

让人形机器人具备共情能力,是一个融合了心理学、计算机科学、机械工程学的跨领域挑战。其核心目标是让机器人不仅能识别和理解人类的情感,还能做出恰当、自然的情感反馈,从而实现真正有“温度”的互动。

(一)共情算法设计中的关键技术与核心考量

共情算法设计中的关键技术与核心考量

(二)核心设计思想与未来方向

要让共情算法真正有效,除了技术实现,还需要关注以下理念:

  1. 情感作为必选项:不应将情感交互视为任务完成后的附加功能,而应将其作为机器人底层设计的核心。超过一半的人类沟通依赖于非语言模态,因此机器人需要从底层架构就具备情感传递的能力。

  2. 从“工具”到“伙伴”的定位转变:共情算法设计的最终目的,是让机器人从完成命令的“工具”,转变为一个能够融入人类生活、提供情绪价值的“伙伴”。这要求算法设计不仅关注“效率”,更要关注“体验”和“信任”。

  3. 人机协同进化:在工业等协作场景中,共情算法有助于构建更高效、更安全的人机协作环境。通过引入人在回路的学习,可以让人和机器人相互适应,共同进化。

(三)应用场景

具备共情能力的人形机器人拥有广阔的应用前景:

  1. 养老服务与陪伴:理解和回应老人的情感需求,提供温情陪伴。

  2. 教育与心理辅导:作为耐心的伙伴,进行个性化教学或心理引导。

  3. 医疗康复辅助:在康复训练中鼓励患者,并观察其情绪状态。

  4. 智能制造业:在强调人本主义的智能制造中,实现更高效、安全的人机协作。

二、心理理论(ToM)模型的数学表达

心理理论的核心是推断他人的信念、欲望、意图等心理状态,并理解这些状态如何影响其行为。其数学表达的目标是为这些心理概念建立可计算的模型。

(一)基于贝叶斯推理的“信念-欲望-意图”模型

这是最经典、最成熟的数学表达,将机器人的心智建模为一个贝叶斯观察者。

1. 核心思想:我(机器人)通过观察你的行为,来逆向推断你最可能拥有的、导致该行为的心理状态(信念和欲望)。

2. 数学要素:意图: I; 欲望/目标:G; 信念: B (关于世界状态 S 的信念); 行动:A; 世界状态:S;

3. 关键公式:机器人通过观察到的行动 A_obs 和世界状态 S,来推断人的目标 G 和信念B:

这个公式可以进一步分解:

1) 逆规划/目标推理:

假设行为者是理性的,其行为会最大化某个与目标相关的效用。这通常用逆强化学习 或基于效用的规划 来建模。

这里:

U 是一个效用函数,衡量在信念 B 下,行动A 对于实现目标G 有多“好”。

λ 是一个理性参数,表示行为者遵循最优策略的严格程度。

2) 信念推理:

这是ToM更高级的部分,即推断“你认为世界是什么样子”。这包括推断他人的错误信念。

我的信念关于你的信念:P(B_other∣A_obs,S,M_y Beliefs);这通常通过心智模拟来实现。机器人会在自己的世界模型中,模拟一个具有不同初始信息或不同认知能力的“代理”,然后看这个模拟代理会形成什么样的信念 B_other。

举例说明:机器人看到一个人在一个空盒子前寻找糖果(行动A_obs)。欲望 G:想吃糖果。信念 B:(机器人推断)这个人错误地相信糖果还在盒子里(尽管机器人知道糖果已经被拿走了)。

计算:机器人通过模拟推断出,如果这个人没有看到糖果被拿走,他就会形成“糖果在盒子里”的信念。在这个信念下,他的“寻找”行为就是理性的。因此,机器人通过贝叶斯推理,得出了这个人拥有“错误信念”的结论。

(二) 基于递归信念的层次化模型

心理理论的一个关键特征是它的递归性(我能思考你在思考什么,你也在思考我在思考什么...)。这可以用层次化的贝叶斯模型来表达。

  1. 0阶信念: 我对世界状态的信念P_I(S)

  2. 1阶信念: 我对你的信念的信念P_I(P_You(S))

  3. 2阶信念: 我对“你对我信念的信念”的信念P_I(P_You(P_I(S)))

在博弈论和多智能体系统中,这可以形式化为一个部分可观测马尔可夫决策过程的一部分。

数学表达:在一个交互中,每个智能体 i 都在维护一个不断更新的信念状态,这个状态包含了:对物理世界状态的估计。对其他智能体信念 的估计。对其他智能体策略 π_j 的估计。整个系统的互动就是一个递归的信念更新过程:

其中,更新函数 τ 内部就包含了对其他智能体信念更新的模型。

(三)基于机器学习的“端到端”模型

近年来,深度学习提供了一种不同的思路:不显式地对信念、欲望进行建模,而是用神经网络直接从观察中学习ToM能力。

1. 核心思想: 将ToM作为一个表示学习问题。

2. 模型结构:

1)编码器:将观察到的行为序列(视频、对话等)编码为一个潜向量z。

2)心智状态解码器:从这个潜向量 z 中解码出我们关心的心理状态:

  • 信念预测:预测行为者下一步会去哪里/做什么(这隐含了对其信念和目标的预测)。

  • 错误信念分类:直接输出“行为者是否拥有错误信念”的概率。

  • 视觉感知推理:从第一人称视角预测行为者看到了什么。

3. 数学表达:

对于一个预测任务,如预测行为者的下一个行动A^_t+1

其中 O_1:t 是从时间1到t的观察序列,f_NN 是神经网络,θ 是参数。通过在海量人类互动数据上训练,网络被迫在内部潜空间 z 中学习到与信念、欲望等心理状态相关的表征,尽管这些变量可能没有显式的标签。

(四)小总结与对比

心理理论(ToM)模型

(未完待续)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐