从 Jarvis 到 Vision Pro:空间计算时代的 Agent 交互新范式

1. 标题选项

  1. 《从 Jarvis 到 Vision Pro:空间计算时代,如何重新定义 Agent 的交互范式?》
  2. 《跨越虚拟与现实:Vision Pro 开启的空间计算 Agent 交互革命》
  3. 《告别“屏幕囚笼”:空间计算时代,Agent 如何像 Jarvis 一样“懂”你?》
  4. 《全息交互不再是科幻:Vision Pro + Agent,打造下一代人机交互新体验》
  5. 《从语音指令到空间共生:空间计算 Agent 的设计逻辑与技术实践》

2. 引言

2.1 痛点引入

你是否还记得《钢铁侠》中托尼·斯塔克的智能助手 Jarvis?
当托尼在实验室里挥手调整全息投影的反应堆模型,Jarvis 能瞬间理解他的意图,自动计算参数、模拟实验结果;当托尼穿着战甲在空中飞行,Jarvis 会实时扫描周围环境,提醒障碍物、规划航线;甚至当托尼只是随口一句“帮我泡杯咖啡”,Jarvis 也能结合他的日程安排,判断他现在需要的是浓缩咖啡还是拿铁,并自动启动厨房的咖啡机。

这种“无缝、自然、情境化”的交互,曾是我们对未来智能助手的全部想象。但回到现实,我们现在的智能助手是什么样的?

  • 你对着手机喊“小爱同学,打开空调”,它可能会反问你“你想打开哪个房间的空调?”——因为它不知道你现在在客厅还是卧室;
  • 你用 AR 滤镜拍照时,滤镜只能简单地贴在你的脸上,无法根据你周围的环境(比如你在海边还是在办公室)调整风格;
  • 你在工作时用 Siri 设定提醒,它不会结合你眼前的屏幕内容(比如你正在看一封紧急邮件)判断是否应该推迟提醒。

这些“笨拙”的交互,本质上是因为我们的智能助手仍然被困在“二维屏幕”和“单一模态”的囚笼里:它们看不到你周围的空间,听不懂你话语背后的情境,更无法像 Jarvis 那样“融入”你的生活场景。

而 2023 年苹果 Vision Pro 的发布,终于让我们看到了打破这个囚笼的可能——空间计算时代的到来,为 Agent(智能体)的交互带来了全新的范式。

2.2 文章内容概述

本文将带你从科幻想象的 Jarvis 出发,一路走到现实的 Vision Pro,深入探讨空间计算时代 Agent 交互的新变化:

  • 我们会先回顾从 Jarvis 到现在的智能助手交互演变,分析传统交互的局限;
  • 接着拆解 Vision Pro 带来的空间计算核心特征,以及这些特征如何重新定义 Agent 的“能力边界”;
  • 然后我们会重点讲解空间计算 Agent 的核心交互范式——从“指令驱动”到“情境共生”,从“单一模态”到“多模态融合”,从“被动响应”到“主动预判”;
  • 此外,我们还会深入技术底层,讲解实现空间计算 Agent 需要的关键技术(SLAM、眼球追踪、LLM、具身智能等);
  • 最后,我们会通过一个概念性实战案例,展示如何用 Vision Pro 的开发工具和 Agent 框架,打造一个简单的“空间助手”。

2.3 读者收益

读完本文,你将:

  • 理解空间计算时代 Agent 交互的核心逻辑,不再对“全息交互”“具身智能”等概念感到陌生;
  • 掌握空间计算 Agent 的设计原则,能够从产品角度思考如何打造“像 Jarvis 一样自然”的交互;
  • 了解实现空间计算 Agent 的关键技术栈,为后续的技术实践打下基础;
  • 获得一个概念性的实战案例,能够直观感受到空间计算 Agent 的开发流程。

3. 准备工作

在开始阅读本文之前,你需要具备以下基础:

3.1 技术栈/知识

  1. 基础 AI 概念:了解 Agent(智能体)、LLM(大语言模型)、多模态交互的基本定义(如果不熟悉也没关系,本文会在核心概念部分详细解释);
  2. AR/VR 基础认知:知道 AR(增强现实)、VR(虚拟现实)、MR(混合现实)的区别,对 Vision Pro 这类空间计算设备有初步了解;
  3. 前端/3D 开发基础(可选):如果你想动手实践,了解 Swift(Vision Pro 开发语言)、RealityKit(苹果 3D 交互框架)或 LangChain(Agent 开发框架)会有帮助,但本文会尽量用通俗易懂的方式讲解,没有开发基础也能理解核心逻辑。

3.2 环境/工具

  1. Vision Pro 开发环境(可选):如果你想动手实践,需要一台 Mac(Apple Silicon 芯片最佳),安装 Xcode 15 及以上版本,以及 Reality Composer Pro(苹果的 3D 内容创作工具);
  2. Agent 开发环境(可选):如果你想体验 Agent 逻辑的实现,需要安装 Python 3.9 及以上版本,以及 LangChain、OpenAI API(或其他 LLM API);
  3. 学习资源(推荐):可以先观看苹果 Vision Pro 的官方发布会视频,了解设备的基本功能;也可以阅读 LangChain 的官方文档,了解 Agent 的基本开发流程。

4. 核心内容:从科幻到现实,空间计算 Agent 的交互革命

为了让大家更系统地理解空间计算时代的 Agent 交互,我们将核心内容分为以下 5 个模块:

  • 模块一:回顾——从 Jarvis 到传统智能助手,交互的“变”与“不变”;
  • 模块二:破局——Vision Pro 带来的空间计算,如何重新定义 Agent 的能力;
  • 模块三:新范式——空间计算 Agent 的 4 大核心交互特征;
  • 模块四:技术拆解——实现空间计算 Agent 的 5 大关键技术;
  • 模块五:概念实战——用 Vision Pro + LangChain 打造一个简单的空间助手。

模块一:回顾——从 Jarvis 到传统智能助手,交互的“变”与“不变”

在讲空间计算 Agent 之前,我们先回过头来看看:Jarvis 到底“厉害”在哪里?我们现在的智能助手又“差”在哪里?

4.1.1 科幻中的 Jarvis:交互的“理想型”

我们来拆解一下《钢铁侠》中 Jarvis 的几个经典交互场景,看看它具备哪些特征:

场景 1:实验室的全息交互

托尼站在实验室里,看着眼前的全息反应堆模型,皱了皱眉头:“Jarvis,把反应堆的功率输出提高 20%,模拟一下在高空环境下的稳定性。”
话音刚落,全息模型立刻开始变化,红色的能量波动在模型中流动,Jarvis 的声音响起:“先生,功率提高 20% 后,反应堆在 30000 英尺高空的稳定性为 87%,建议增加钛合金外壳的厚度 0.5 毫米。”
托尼点了点头,挥手将模型中的外壳部分放大:“帮我把这个区域的应力分布数据调出来。”
Jarvis 立刻在模型旁边生成了一张三维应力图,并用红色标注出了薄弱环节。

在这个场景中,Jarvis 具备以下特征:

  1. 多模态融合:既能听懂托尼的自然语言,又能识别托尼的手势(挥手放大模型),还能通过全息投影展示三维数据;
  2. 空间感知:知道全息模型在实验室中的位置,能将应力图“放置”在模型旁边的合适位置,不会挡住托尼的视线;
  3. 专业知识与工具调用:具备核物理、材料学的专业知识,能调用模拟工具计算反应堆的稳定性,还能调取应力分布数据;
  4. 上下文理解:记得托尼之前的指令(提高功率 20%),后续的应力图展示是基于之前的模拟结果。
场景 2:飞行中的情境响应

托尼穿着 Mark 战甲在空中飞行,突然 Jarvis 的声音响起:“先生,前方 5 英里处有一片雷雨云,建议绕飞。另外,佩珀刚刚发来了一条消息,问你晚上要不要一起吃饭。”
托尼一边调整战甲的方向,一边说:“告诉佩珀我今晚有空,另外,扫描一下雷雨云里有没有可用的雷电能量。”
Jarvis 立刻在战甲的抬头显示(HUD)上标注出绕飞路线,同时回复佩珀的消息,还开始扫描雷雨云的能量分布:“先生,雷雨云中有较强的负电荷聚集,是否启动能量吸收装置?”

在这个场景中,Jarvis 又多了两个特征:

  1. 主动感知与预判:不需要托尼指令,主动扫描前方的环境,发现雷雨云并建议绕飞;还主动提醒托尼佩珀的消息;
  2. 情境优先级判断:知道托尼现在在飞行,所以先提醒安全问题(雷雨云),再提私人消息(佩珀的约会);
  3. 具身交互:和战甲“绑定”在一起,能直接控制战甲的功能(绕飞、能量吸收),HUD 的信息也是直接展示在托尼的眼前,不需要额外的屏幕。
场景 3:日常生活的无缝融入

托尼早上起床,走进客厅,Jarvis 的声音响起:“先生,早上好。今天的日程是:上午 10 点和斯塔克工业的董事会开会,下午 2 点测试新的战甲推进器。另外,天气预报说今天下午有雨,你昨天让我帮你修的车已经修好了。”
托尼走到冰箱前,打开门:“帮我拿杯牛奶,另外,把董事会的会议资料投到墙上。”
Jarvis 立刻控制机械臂从冰箱里拿出牛奶,同时在客厅的墙上投影出会议资料:“先生,会议资料已经准备好了,需要我帮你摘要一下重点吗?”

这个场景中,Jarvis 更进一步:

  1. 环境融合:能控制家里的机械臂、冰箱、投影设备,和家居环境无缝集成;
  2. 长期记忆与个性化:记得托尼昨天让他修车,知道托尼的日程安排,了解托尼的日常习惯(早上喝牛奶);
  3. 自然语言的模糊理解:托尼说“把会议资料投到墙上”,Jarvis 不需要问“投到哪面墙”,因为它知道客厅的哪面墙适合投影,也知道托尼习惯用哪面墙。
4.1.2 现实中的传统智能助手:交互的“现实骨感”

看完 Jarvis 的“理想型”,我们再看看现实中的传统智能助手(比如 Siri、小爱同学、Alexa),它们的交互是什么样的?

我们以一个常见的场景为例:“你在客厅里,想打开空调,同时想知道今天的天气。”

传统智能助手的交互流程
  1. 触发:你需要先说出唤醒词(比如“小爱同学”);
  2. 指令:你说“打开客厅的空调”——注意,你必须明确说“客厅的”,因为小爱同学不知道你现在在哪个房间;
  3. 执行:小爱同学打开客厅的空调,然后说“已为你打开客厅的空调”;
  4. 再次触发:你需要再次说“小爱同学”;
  5. 再次指令:你说“今天的天气怎么样”;
  6. 执行:小爱同学告诉你今天的天气。
传统智能助手的局限

对比 Jarvis,传统智能助手的局限非常明显:

  1. 模态单一:几乎只依赖语音交互,无法识别手势、眼球动作,也无法通过全息投影展示信息(只能用手机屏幕或音箱声音);
  2. 无空间感知:不知道你在哪个房间,不知道你周围有什么设备,更不知道你眼前的东西是什么;
  3. 无情境理解:不知道你现在是在休息还是在工作,不知道你之前的指令是什么(每次都需要重新唤醒),也无法预判你的需求;
  4. 被动响应:只有你主动发出指令,它才会行动,不会主动提醒你任何事情(除非你提前设定了提醒);
  5. 无具身交互:没有“身体”,无法和你在空间里互动,也无法直接控制物理设备(需要通过智能家居平台间接控制);
  6. 记忆短暂:只有短期对话记忆,没有长期的个性化记忆(比如不记得你昨天让它修过车)。
4.1.3 交互演变的“变”与“不变”

从 2011 年 Siri 发布,到现在已经 13 年了,我们的智能助手到底“变”了什么?又有什么“没变”?

变的地方:
  1. 语音识别准确率提高了:从之前的“听不懂人话”,到现在能识别大部分日常用语;
  2. 支持的功能变多了:从之前的“设定提醒、打电话”,到现在能“点外卖、打车、控制智能家居”;
  3. 接入的设备变多了:从手机,到音箱、电视、手表,甚至汽车。
不变的地方:
  1. 交互的核心逻辑没变:仍然是“唤醒→指令→执行”的被动响应模式;
  2. 模态的局限没变:仍然以语音为主,触屏为辅,没有真正的多模态融合;
  3. 空间与情境的缺失没变:仍然不知道你在哪里,不知道你在做什么,无法理解你的真实意图。

为什么“变”了这么多,我们还是觉得智能助手“不够聪明”?因为这些“变”都是功能的叠加,而不是交互范式的变革。传统智能助手就像是一个“功能更强的遥控器”,而 Jarvis 则是一个“能和你一起生活的伙伴”——这就是本质的区别。

模块二:破局——Vision Pro 带来的空间计算,如何重新定义 Agent 的能力

2023 年 6 月,苹果发布了 Vision Pro,并称其为“空间计算设备”(Spatial Computing Device)。很多人觉得 Vision Pro 只是一个“更高级的 AR/VR 头显”,但实际上,它带来的是人机交互的第三次革命——从“键盘鼠标”(第一次)到“触屏”(第二次),再到“空间计算”(第三次)。

那么,空间计算到底是什么?它又如何重新定义 Agent 的能力?

4.2.1 空间计算的核心定义

苹果对空间计算的定义是:“让数字内容与你的物理世界无缝融合,让你用自然的方式(眼睛、手势、声音)与数字内容交互,而不需要任何控制器。”

我们可以把空间计算的核心特征拆解为以下 4 点:

1. 数字内容的“空间化”

在空间计算中,数字内容不再是“贴在屏幕上的平面图片”,而是“存在于物理空间中的三维物体”。比如:

  • 你可以把一个虚拟的电视“放在”客厅的墙上,它的大小和真实的电视一样,你可以走近它、远离它,甚至绕到它后面;
  • 你可以把一个虚拟的会议桌“放在”你的书房里,你的同事的虚拟形象会坐在桌子旁边,就像他们真的在你面前一样;
  • 你可以把一个虚拟的太阳系模型“放在”你的卧室里,你可以用手拨动地球,看它绕着太阳转。
2. 交互方式的“自然化”

空间计算不再依赖键盘、鼠标或触屏控制器,而是用你最自然的方式交互:

  • 眼睛:你看着哪个虚拟物体,哪个物体就会被选中(就像你用鼠标点击一样);
  • 手势:你可以用手捏合来“点击”物体,用手拖动来“移动”物体,用手放大缩小来“调整”物体的大小;
  • 声音:你可以用自然语言和虚拟物体对话,就像和真人对话一样。
3. 物理环境的“感知化”

空间计算设备能“看到”你的物理环境,知道:

  • 你所在的房间的大小、形状、布局;
  • 房间里的物体(比如桌子、椅子、电视)的位置、大小、材质;
  • 你的位置、姿势、眼球动作、面部表情;
  • 周围的光线、声音、温度。
4. 体验的“沉浸化”与“隔离化”的平衡

空间计算不是完全的“虚拟现实”(把你和物理世界完全隔离开),也不是完全的“增强现实”(只是把数字内容贴在物理世界上),而是两者的平衡——你可以根据需要调整“沉浸度”:

  • 增强现实模式:你能看到物理世界,同时数字内容叠加在物理世界上(比如把虚拟电视放在客厅墙上);
  • 混合现实模式:数字内容能和物理世界互动(比如虚拟的球能从你的物理桌子上弹起来);
  • 虚拟现实模式:你完全沉浸在数字世界里(比如坐在虚拟的电影院里看电影)。
4.2.2 空间计算如何重新定义 Agent 的能力

空间计算的这 4 个核心特征,刚好解决了传统智能助手的所有局限——它为 Agent 提供了一个“全新的舞台”,让 Agent 能真正像 Jarvis 一样“融入”你的生活。

我们来具体看看空间计算给 Agent 带来了哪些新能力:

1. 空间感知能力:Agent 终于“知道你在哪里”

传统 Agent 不知道你在哪个房间,不知道你周围有什么,但空间计算 Agent 能通过设备的 SLAM 技术(同时定位与地图构建)和传感器,“看到”你的物理环境。比如:

  • 当你说“打开空调”时,Agent 知道你现在在客厅,所以自动打开客厅的空调,不需要你说“客厅的”;
  • 当你看着一个虚拟的台灯说“把这个灯调亮一点”时,Agent 知道你看的是哪个台灯,直接调整它的亮度;
  • 当你在厨房里做饭,说“帮我找一下盐”时,Agent 能扫描厨房的布局,告诉你盐在哪个柜子里(甚至能在柜子上投影一个箭头)。
2. 多模态交互能力:Agent 终于“能看、能听、能动手”

传统 Agent 几乎只依赖语音,但空间计算 Agent 能融合眼睛、手势、声音、物理环境等多种模态。比如:

  • 你可以用眼睛看着一个虚拟的文件,用手势捏合来“打开”它,同时用声音说“帮我摘要一下这个文件的重点”——Agent 会同时理解这三个模态的指令,完成任务;
  • 你可以用手拖动一个虚拟的地球模型,同时问“中国在哪里”——Agent 会在地球模型上用高亮标注出中国的位置,同时用声音介绍中国的基本情况;
  • 你可以皱眉看着一个虚拟的图表,Agent 会通过你的面部表情知道你“看不懂”,主动问“需要我帮你解释一下这个图表吗?”。
3. 情境理解能力:Agent 终于“懂你在做什么”

传统 Agent 不知道你的情境,但空间计算 Agent 能通过你的位置、姿势、眼球动作、日程安排、物理环境等信息,理解你的情境。比如:

  • 当你在卧室里,躺在床上,看着天花板(Agent 通过你的姿势和眼球动作判断你在休息),这时你的老板发来了一条消息——Agent 不会主动提醒你,而是问“你现在在休息,需要我把这条消息推迟到明天早上吗?”;
  • 当你在书房里,坐在桌子前,看着一个虚拟的代码编辑器(Agent 通过你的位置和眼前的内容判断你在工作),这时你的朋友发来了一条游戏邀请——Agent 会问“你现在在工作,需要我帮你回复朋友说你稍后有空吗?”;
  • 当你在厨房里,看着一个虚拟的菜谱(Agent 通过你的物理环境判断你在做饭),菜谱上写着“加 5 克盐”——Agent 会主动在你的虚拟秤上显示“5 克盐”的刻度,不需要你问。
4. 具身交互能力:Agent 终于“有了身体”

传统 Agent 没有“身体”,但空间计算 Agent 能以虚拟形象的形式存在于你的物理空间里,甚至能和物理设备互动。比如:

  • Agent 可以是一个虚拟的“小助手”形象,站在你的桌子旁边,你可以和它握手、拥抱,它会通过面部表情和手势回应你;
  • 当你说“帮我泡杯咖啡”时,Agent 可以控制厨房里的机械臂(就像 Jarvis 一样),帮你泡一杯咖啡;
  • 当你在玩虚拟游戏时,Agent 可以成为你的“队友”,和你一起在虚拟空间里战斗,它的动作会根据游戏的情境变化。
5. 长期记忆与个性化能力:Agent 终于“记得你是谁”

传统 Agent 只有短期记忆,但空间计算 Agent 能结合你的长期使用数据、日程安排、偏好设置,形成长期的个性化记忆。比如:

  • Agent 记得你每天早上 8 点起床,喜欢喝热牛奶,所以每天早上 8 点会自动在你的餐桌上放一个虚拟的热牛奶形象,同时问“需要我帮你热一杯真实的牛奶吗?”;
  • Agent 记得你对花粉过敏,所以当天气预报说今天花粉浓度很高时,会主动提醒你“今天花粉浓度很高,出门记得戴口罩”,同时帮你关闭家里的窗户;
  • Agent 记得你上次看电影看到一半,所以当你再次坐在虚拟电影院里时,会主动问“需要我继续播放上次的电影吗?”。
4.2.3 从“工具”到“伙伴”:Agent 角色的转变

因为空间计算给 Agent 带来了这些新能力,Agent 的角色也发生了本质的转变:

  • 传统 Agent:是一个“工具”,你需要用指令“控制”它,它的作用是“帮你完成特定的任务”;
  • 空间计算 Agent:是一个“伙伴”,它能“理解”你的意图,“预判”你的需求,“融入”你的生活,它的作用是“和你一起生活、工作、娱乐”。

这就像从“遥控器”到“朋友”的转变——你不需要对“朋友”说“请帮我打开电视”,朋友会根据你的情境(比如你坐在沙发上,看着电视的位置)主动问“要不要打开电视?”;你不需要对“朋友”说“请提醒我明天开会”,朋友会记得你的日程,主动提醒你。

模块三:新范式——空间计算 Agent 的 4 大核心交互特征

现在我们知道了空间计算能给 Agent 带来什么能力,接下来我们要重点讲解:空间计算 Agent 的核心交互范式到底是什么?和传统交互有什么区别?

我们将空间计算 Agent 的核心交互特征总结为以下 4 点:

  1. 从“指令驱动”到“意图驱动”;
  2. 从“单一模态”到“多模态融合”;
  3. 从“被动响应”到“主动预判”;
  4. 从“屏幕交互”到“空间共生”。

接下来我们会逐个讲解这些特征,并用对比表格、ER 实体关系图、交互流程图来帮助大家理解。

4.3.1 特征一:从“指令驱动”到“意图驱动”
核心概念
  • 指令驱动(Command-Driven):用户必须发出明确、具体的指令,Agent 才能执行任务。比如“打开客厅的空调,调到 26 度”——每一个细节都需要用户明确说明。
  • 意图驱动(Intent-Driven):用户只需要表达自己的“意图”(想要做什么),不需要说明具体的“指令”(怎么做),Agent 会根据情境自动推断出需要执行的具体操作。比如“我有点热”——Agent 会根据你的位置(客厅)、当前的温度(30 度)、你的偏好(喜欢 26 度),自动打开客厅的空调,调到 26 度。
问题背景

传统 Agent 之所以是“指令驱动”,是因为它们没有情境理解能力知识推理能力——它们不知道你为什么要发出这个指令,也不知道如何根据情境自动调整操作。比如你说“打开空调”,传统 Agent 不知道你是因为热还是因为冷,所以只能反问你“你想打开哪个房间的空调?调到多少度?”。

问题描述

“指令驱动”的交互存在以下问题:

  1. 交互成本高:用户需要思考如何发出明确的指令,甚至需要记住 Agent 的“指令格式”(比如必须说“打开客厅的空调”而不是“把空调打开”);
  2. 交互不自然:真实的人与人之间的交互是“意图驱动”的——你不会对朋友说“请帮我打开客厅的空调,调到 26 度”,你只会说“我有点热”;
  3. 无法处理模糊需求:如果用户的需求是模糊的(比如“我想放松一下”),传统 Agent 完全不知道该怎么做。
问题解决

空间计算 Agent 如何实现“意图驱动”?主要依靠以下 3 个技术:

  1. 情境感知:通过空间计算设备的传感器,获取用户的位置、姿势、眼球动作、物理环境、日程安排等情境信息;
  2. 意图识别:用 LLM(大语言模型)结合情境信息,理解用户话语背后的“真实意图”——比如用户说“我有点热”,LLM 会结合情境信息(当前温度 30 度,用户在客厅),识别出用户的意图是“降低客厅的温度”;
  3. 任务规划与工具调用:用 Agent 框架(比如 LangChain)根据意图,自动规划需要执行的任务,调用相应的工具——比如识别出“降低客厅的温度”的意图后,Agent 会规划任务:“打开客厅的空调→调到 26 度→检查空调是否正常运行”,然后调用智能家居平台的工具执行这些任务。
对比表格:指令驱动 vs 意图驱动
维度指令驱动(传统 Agent)意图驱动(空间计算 Agent)
用户输入明确、具体的指令(如“打开客厅的空调,调到 26 度”)模糊、自然的意图表达(如“我有点热”)
Agent 理解方式匹配“指令关键词”(如“打开”“空调”“26 度”)结合情境信息,用 LLM 推理“真实意图”
Agent 执行方式严格按照指令执行,没有调整空间根据情境自动调整操作,甚至补充用户没有提到的细节
交互成本高(用户需要思考指令格式)低(用户只需要表达意图)
自然度低(像对机器说话)高(像对朋友说话)
处理模糊需求的能力无(完全不知道该怎么做)强(能根据情境推断出需求)
交互流程图:意图驱动的交互流程

我们用 Mermaid 流程图来展示“意图驱动”的交互流程:

用户表达意图
(如“我有点热”)

空间计算设备采集情境信息
(位置:客厅
温度:30 度
用户偏好:26 度)

LLM 结合情境信息识别意图
(意图:降低客厅的温度)

Agent 框架规划任务
(任务1:打开客厅空调
任务2:调到 26 度
任务3:检查运行状态)

Agent 调用工具执行任务
(调用智能家居平台)

Agent 反馈结果
(“已为你打开客厅空调,调到 26 度”)

用户确认/调整
(如“再调到 25 度”)

实际场景应用

我们以“我想放松一下”为例,看看空间计算 Agent 如何处理这个模糊的意图:

  1. 情境信息采集:Agent 采集到以下信息:
    • 时间:晚上 8 点;
    • 位置:客厅;
    • 用户日程:今天开了 4 个会,工作了 10 小时;
    • 用户偏好:喜欢听轻音乐,喜欢喝红酒,喜欢把灯光调暗;
    • 物理环境:客厅的灯光是亮的,电视是关的,音响是关的。
  2. 意图识别:LLM 结合这些情境信息,识别出用户的意图是“结束一天的工作,放松身心”。
  3. 任务规划:Agent 规划以下任务:
    • 任务1:把客厅的灯光调暗到 30%;
    • 任务2:打开音响,播放用户喜欢的轻音乐;
    • 任务3:询问用户是否需要喝红酒(如果需要,控制机械臂拿红酒和酒杯);
    • 任务4:询问用户是否要看一部轻松的电影(如果需要,打开虚拟电视,推荐用户喜欢的喜剧片)。
  4. 任务执行:Agent 调用工具执行这些任务,同时询问用户的反馈。
4.3.2 特征二:从“单一模态”到“多模态融合”
核心概念

首先,我们需要明确什么是“模态”:

  • 模态(Modality):指信息的传递方式,比如声音、文字、图像、手势、眼球动作、触觉等。

接下来,我们定义两种交互方式:

  • 单一模态交互(Single-Modal Interaction):只使用一种模态进行交互,比如传统智能助手几乎只使用“声音”这一种模态。
  • 多模态融合交互(Multi-Modal Fusion Interaction):同时使用多种模态进行交互,并且多种模态之间是“互补”的——Agent 会融合所有模态的信息,理解用户的真实意图。比如用户用眼睛看着一个虚拟的花瓶,用手势指着花瓶的瓶口,同时说“帮我在这里插一朵花”——Agent 会融合“眼睛(选中花瓶)”“手势(选中瓶口)”“声音(插一朵花)”这三个模态的信息,完成任务。
问题背景

传统 Agent 之所以是“单一模态”,是因为:

  1. 硬件限制:传统的智能设备(手机、音箱)没有足够的传感器来采集多种模态的信息——手机只有麦克风(声音)和摄像头(图像),但摄像头不会一直开启;音箱只有麦克风。
  2. 技术限制:之前的 AI 技术无法很好地融合多种模态的信息——比如无法将“手势”和“声音”结合起来理解用户的意图。
问题描述

“单一模态”的交互存在以下问题:

  1. 信息传递效率低:只用一种模态传递信息,很多细节无法表达清楚——比如你想用传统智能助手“调整虚拟电视的位置”,你只能说“把电视往左移一点”,但“一点”是多少?传统 Agent 无法理解。
  2. 交互不自然:真实的人与人之间的交互是“多模态”的——你和朋友说话时,会用眼神、手势、面部表情来辅助表达,朋友也会通过这些模态来理解你的意思。
  3. 容易产生误解:只用一种模态,很容易产生误解——比如你说“把这个打开”,传统 Agent 不知道“这个”指的是什么,因为它看不到你指的东西。
问题解决

空间计算 Agent 如何实现“多模态融合”?主要依靠以下 3 个技术:

  1. 多模态传感器:空间计算设备(比如 Vision Pro)配备了大量的传感器,能采集多种模态的信息:
    • 视觉传感器:多个摄像头,能采集物理环境的图像、用户的手势、眼球动作、面部表情;
    • 听觉传感器:多个麦克风,能采集用户的声音、周围的环境音;
    • 空间传感器:LiDAR 扫描仪,能采集物理环境的三维结构;
    • 惯性传感器:加速度计、陀螺仪,能采集用户的头部姿势、设备的位置。
  2. 多模态大语言模型(MLLM):比如 GPT-4o、Gemini Ultra、Claude 3 Opus——这些模型能同时处理“文字、图像、声音、视频”等多种模态的信息,并且能融合这些信息,理解用户的真实意图。
  3. 多模态交互框架:比如 Vision Pro 的 RealityKit、ARkit——这些框架能将多种模态的信息(比如手势、眼球动作)转化为“交互事件”,并传递给 Agent。
概念之间的关系:多模态融合的 ER 实体关系图

我们用 Mermaid ER 图来展示多模态融合中各个实体之间的关系:

使用

由...采集

安装在...上

输入到...

输出意图到...

控制...

控制...

USER

string

user_id

string

name

json

preferences

MODALITY

string

modality_id

string

type

声音/手势/眼球/图像/面部表情

json

content

SENSOR

string

sensor_id

string

type

摄像头/麦克风/LiDAR/加速度计

string

status

SPATIAL_DEVICE

string

device_id

string

model

Vision Pro/Quest 3

json

position

MLLM

string

model_id

string

name

GPT-4o/Gemini Ultra

string

version

AGENT

string

agent_id

string

name

空间小助手

json

memory

SPATIAL_CONTENT

string

content_id

string

type

虚拟电视/虚拟花瓶/虚拟会议桌

json

position

PHYSICAL_DEVICE

string

device_id

string

type

空调/电视/机械臂

string

status

交互关系图:多模态融合的交互流程

我们用 Mermaid 流程图来展示多模态融合的交互流程:

用户使用多种模态表达意图
(眼睛:看着虚拟花瓶
手势:指着瓶口
声音:帮我在这里插一朵花)

空间计算设备的传感器采集模态信息
(摄像头:采集眼球动作、手势、虚拟花瓶的位置
麦克风:采集声音)

传感器将模态信息传递给 MLLM

MLLM 融合所有模态信息,理解真实意图
(意图:在用户选中的虚拟花瓶的瓶口插一朵花)

MLLM 将意图传递给 Agent

Agent 控制空间内容,执行任务
(在虚拟花瓶的瓶口生成一朵虚拟的花)

Agent 通过多模态反馈结果
(虚拟形象微笑着说“好的,已经帮你插好了”
同时用手势指着花瓶)

实际场景应用

我们以“调整虚拟电视的位置”为例,看看多模态融合的交互:

  1. 用户使用多种模态表达意图
    • 眼睛:看着虚拟电视;
    • 手势:用手抓住虚拟电视的边缘,往左拖动;
    • 声音:“再往左一点,对,就是这里。”
  2. 传感器采集模态信息
    • 摄像头:采集用户的眼球动作(选中虚拟电视)、手势(拖动的方向和距离)、虚拟电视的位置;
    • 麦克风:采集用户的声音(“再往左一点,对,就是这里”)。
  3. MLLM 融合模态信息
    • 首先,MLLM 理解用户的初始意图是“调整虚拟电视的位置”;
    • 然后,MLLM 结合手势的信息,将电视往左拖动用户手势指定的距离;
    • 最后,MLLM 理解用户说“再往左一点”,所以继续将电视往左拖一点;当用户说“对,就是这里”时,MLLM 知道位置调整完成了。
  4. Agent 执行任务
    • Agent 控制虚拟电视的位置,根据 MLLM 的指令调整;
  5. Agent 反馈结果
    • Agent 的虚拟形象点了点头,说“好的,电视已经放到这里了”,同时虚拟电视的位置固定下来。
4.3.3 特征三:从“被动响应”到“主动预判”
核心概念
  • 被动响应(Passive Response):只有当用户主动发出指令时,Agent 才会执行任务——就像一个“随时待命的仆人”,你不叫它,它就不会动。
  • 主动预判(Active Prediction):Agent 会根据用户的情境信息、长期记忆、习惯偏好,主动预判用户的需求,并提前执行任务——就像一个“懂你的朋友”,不需要你说,它就知道你想要什么。
问题背景

传统 Agent 之所以是“被动响应”,是因为:

  1. 没有情境感知能力:不知道用户现在在做什么,不知道用户的需求是什么;
  2. 没有长期记忆能力:不记得用户的习惯、偏好、过去的行为;
  3. 没有预判能力:之前的 AI 技术无法根据历史数据和情境信息,预判用户的未来需求。
问题描述

“被动响应”的交互存在以下问题:

  1. 用户体验差:用户需要不断地发出指令,才能完成一系列任务——比如你想做饭,需要先让 Agent 打开抽油烟机,再让它打开燃气灶,再让它找菜谱,非常麻烦;
  2. 无法处理紧急情况:如果有紧急情况(比如家里的煤气泄漏了),传统 Agent 不会主动提醒你,直到你发现问题并发出指令;
  3. 无法提供个性化服务:因为不记得用户的习惯,所以无法提供个性化的服务——比如不知道用户喜欢喝热牛奶还是冷牛奶,所以只能问“你想喝什么牛奶?”。
问题解决

空间计算 Agent 如何实现“主动预判”?主要依靠以下 3 个技术:

  1. 长时记忆模块(Long-Term Memory):比如 LangChain 的 Memory 模块、向量数据库(比如 Pinecone、Chroma)——这些模块能存储用户的长期使用数据、习惯偏好、日程安排、过去的行为,让 Agent “记得”用户是谁。
  2. 情境感知与实时分析:空间计算设备的传感器实时采集用户的情境信息,Agent 会实时分析这些信息,判断用户当前的状态(比如“在工作”“在休息”“在做饭”)。
  3. 预判模型(Prediction Model):用机器学习模型(比如 LLM、推荐系统)结合长时记忆实时情境信息,预判用户的未来需求——比如根据用户“每天早上 8 点起床,喜欢喝热牛奶”的长时记忆,结合“现在是早上 7 点 50 分,用户已经在卧室里翻了个身”的实时情境信息,预判用户“马上会起床,想要喝热牛奶”。
数学模型:主动预判的概率模型

我们可以用一个简单的概率模型来描述主动预判的过程:
假设我们要预判用户在时刻 ttt 的需求 DtD_tDt,我们有:

  • 长时记忆数据:M={m1,m2,...,mn}M = \{m_1, m_2, ..., m_n\}M={m1,m2,...,mn}(比如用户的习惯偏好、过去的行为);
  • 实时情境信息:Ct={ct1,ct2,...,ctk}C_t = \{c_{t1}, c_{t2}, ..., c_{tk}\}Ct={ct1,ct2,...,ctk}(比如用户的位置、姿势、当前时间);

那么,用户需求 DtD_tDt 的概率可以表示为:
P(Dt∣M,Ct)=P(Ct∣Dt,M)⋅P(Dt∣M)P(Ct∣M) P(D_t | M, C_t) = \frac{P(C_t | D_t, M) \cdot P(D_t | M)}{P(C_t | M)} P(DtM,Ct)=P(CtM)P(CtDt,M)P(DtM)

这个公式就是贝叶斯定理——它的意思是:

  • P(Dt∣M)P(D_t | M)P(DtM):先验概率——根据长时记忆 MMM,用户有需求 DtD_tDt 的概率;
  • P(Ct∣Dt,M)P(C_t | D_t, M)P(CtDt,M):似然概率——如果用户有需求 DtD_tDt,并且有长时记忆 MMM,那么出现实时情境信息 CtC_tCt 的概率;
  • P(Ct∣M)P(C_t | M)P(CtM):证据概率——在有长时记忆 MMM 的情况下,出现实时情境信息 CtC_tCt 的概率;
  • P(Dt∣M,Ct)P(D_t | M, C_t)P(DtM,Ct):后验概率——结合长时记忆 MMM 和实时情境信息 CtC_tCt,用户有需求 DtD_tDt 的概率。

Agent 会计算所有可能需求的后验概率,选择概率最高的需求作为预判结果,并提前执行任务。

算法流程图:主动预判的算法流程

我们用 Mermaid 流程图来展示主动预判的算法流程:

渲染错误: Mermaid 渲染失败: Parse error on line 3: ...[对所有可能的需求 D,计算先验概率 P(D|M)] C --> D[计 -----------------------^ Expecting 'SQE', 'DOUBLECIRCLEEND', 'PE', '-)', 'STADIUMEND', 'SUBROUTINEEND', 'PIPE', 'CYLINDEREND', 'DIAMOND_STOP', 'TAGEND', 'TRAPEND', 'INVTRAPEND', 'UNICODE_TEXT', 'TEXT', 'TAGSTART', got 'PS'
实际场景应用

我们以“用户早上起床”为例,看看空间计算 Agent 如何主动预判需求:

  1. 长时记忆数据:Agent 从向量数据库中加载以下长时记忆:
    • 用户每天早上 8 点起床;
    • 用户起床后喜欢喝热牛奶;
    • 用户起床后喜欢听早间新闻;
    • 用户起床后喜欢把窗帘打开;
    • 用户今天的日程是:上午 10 点开会。
  2. 实时情境信息采集:早上 7 点 55 分,Agent 采集到以下情境信息:
    • 用户在卧室里,已经翻了个身,睁开了眼睛(通过眼球追踪传感器);
    • 卧室的窗帘是关着的;
    • 现在的时间是 7 点 55 分。
  3. 计算后验概率:Agent 计算所有可能需求的后验概率:
    • 需求 1:打开窗帘——后验概率 95%;
    • 需求 2:热一杯牛奶——后验概率 90%;
    • 需求 3:播放早间新闻——后验概率 85%;
    • 需求 4:提醒今天的日程——后验概率 80%。
  4. 主动执行任务:Agent 选择后验概率最高的需求,依次执行:
    • 首先,打开卧室的窗帘;
    • 然后,控制厨房的设备热一杯牛奶;
    • 接着,在用户的眼前播放早间新闻(虚拟屏幕);
    • 最后,提醒用户“今天上午 10 点有个会,需要我帮你准备会议资料吗?”。
  5. 收集反馈,更新记忆:如果用户说“今天不想喝牛奶,想喝咖啡”,Agent 会把这个反馈更新到长时记忆中,下次预判时就会考虑到这个变化。
4.3.4 特征四:从“屏幕交互”到“空间共生”
核心概念
  • **屏幕交互(Screen Interaction)
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐