从 Jarvis 到 Vision Pro:空间计算时代的 Agent 交互新范式
从 Jarvis 到 Vision Pro:空间计算时代的 Agent 交互新范式
1. 标题选项
- 《从 Jarvis 到 Vision Pro:空间计算时代,如何重新定义 Agent 的交互范式?》
- 《跨越虚拟与现实:Vision Pro 开启的空间计算 Agent 交互革命》
- 《告别“屏幕囚笼”:空间计算时代,Agent 如何像 Jarvis 一样“懂”你?》
- 《全息交互不再是科幻:Vision Pro + Agent,打造下一代人机交互新体验》
- 《从语音指令到空间共生:空间计算 Agent 的设计逻辑与技术实践》
2. 引言
2.1 痛点引入
你是否还记得《钢铁侠》中托尼·斯塔克的智能助手 Jarvis?
当托尼在实验室里挥手调整全息投影的反应堆模型,Jarvis 能瞬间理解他的意图,自动计算参数、模拟实验结果;当托尼穿着战甲在空中飞行,Jarvis 会实时扫描周围环境,提醒障碍物、规划航线;甚至当托尼只是随口一句“帮我泡杯咖啡”,Jarvis 也能结合他的日程安排,判断他现在需要的是浓缩咖啡还是拿铁,并自动启动厨房的咖啡机。
这种“无缝、自然、情境化”的交互,曾是我们对未来智能助手的全部想象。但回到现实,我们现在的智能助手是什么样的?
- 你对着手机喊“小爱同学,打开空调”,它可能会反问你“你想打开哪个房间的空调?”——因为它不知道你现在在客厅还是卧室;
- 你用 AR 滤镜拍照时,滤镜只能简单地贴在你的脸上,无法根据你周围的环境(比如你在海边还是在办公室)调整风格;
- 你在工作时用 Siri 设定提醒,它不会结合你眼前的屏幕内容(比如你正在看一封紧急邮件)判断是否应该推迟提醒。
这些“笨拙”的交互,本质上是因为我们的智能助手仍然被困在“二维屏幕”和“单一模态”的囚笼里:它们看不到你周围的空间,听不懂你话语背后的情境,更无法像 Jarvis 那样“融入”你的生活场景。
而 2023 年苹果 Vision Pro 的发布,终于让我们看到了打破这个囚笼的可能——空间计算时代的到来,为 Agent(智能体)的交互带来了全新的范式。
2.2 文章内容概述
本文将带你从科幻想象的 Jarvis 出发,一路走到现实的 Vision Pro,深入探讨空间计算时代 Agent 交互的新变化:
- 我们会先回顾从 Jarvis 到现在的智能助手交互演变,分析传统交互的局限;
- 接着拆解 Vision Pro 带来的空间计算核心特征,以及这些特征如何重新定义 Agent 的“能力边界”;
- 然后我们会重点讲解空间计算 Agent 的核心交互范式——从“指令驱动”到“情境共生”,从“单一模态”到“多模态融合”,从“被动响应”到“主动预判”;
- 此外,我们还会深入技术底层,讲解实现空间计算 Agent 需要的关键技术(SLAM、眼球追踪、LLM、具身智能等);
- 最后,我们会通过一个概念性实战案例,展示如何用 Vision Pro 的开发工具和 Agent 框架,打造一个简单的“空间助手”。
2.3 读者收益
读完本文,你将:
- 理解空间计算时代 Agent 交互的核心逻辑,不再对“全息交互”“具身智能”等概念感到陌生;
- 掌握空间计算 Agent 的设计原则,能够从产品角度思考如何打造“像 Jarvis 一样自然”的交互;
- 了解实现空间计算 Agent 的关键技术栈,为后续的技术实践打下基础;
- 获得一个概念性的实战案例,能够直观感受到空间计算 Agent 的开发流程。
3. 准备工作
在开始阅读本文之前,你需要具备以下基础:
3.1 技术栈/知识
- 基础 AI 概念:了解 Agent(智能体)、LLM(大语言模型)、多模态交互的基本定义(如果不熟悉也没关系,本文会在核心概念部分详细解释);
- AR/VR 基础认知:知道 AR(增强现实)、VR(虚拟现实)、MR(混合现实)的区别,对 Vision Pro 这类空间计算设备有初步了解;
- 前端/3D 开发基础(可选):如果你想动手实践,了解 Swift(Vision Pro 开发语言)、RealityKit(苹果 3D 交互框架)或 LangChain(Agent 开发框架)会有帮助,但本文会尽量用通俗易懂的方式讲解,没有开发基础也能理解核心逻辑。
3.2 环境/工具
- Vision Pro 开发环境(可选):如果你想动手实践,需要一台 Mac(Apple Silicon 芯片最佳),安装 Xcode 15 及以上版本,以及 Reality Composer Pro(苹果的 3D 内容创作工具);
- Agent 开发环境(可选):如果你想体验 Agent 逻辑的实现,需要安装 Python 3.9 及以上版本,以及 LangChain、OpenAI API(或其他 LLM API);
- 学习资源(推荐):可以先观看苹果 Vision Pro 的官方发布会视频,了解设备的基本功能;也可以阅读 LangChain 的官方文档,了解 Agent 的基本开发流程。
4. 核心内容:从科幻到现实,空间计算 Agent 的交互革命
为了让大家更系统地理解空间计算时代的 Agent 交互,我们将核心内容分为以下 5 个模块:
- 模块一:回顾——从 Jarvis 到传统智能助手,交互的“变”与“不变”;
- 模块二:破局——Vision Pro 带来的空间计算,如何重新定义 Agent 的能力;
- 模块三:新范式——空间计算 Agent 的 4 大核心交互特征;
- 模块四:技术拆解——实现空间计算 Agent 的 5 大关键技术;
- 模块五:概念实战——用 Vision Pro + LangChain 打造一个简单的空间助手。
模块一:回顾——从 Jarvis 到传统智能助手,交互的“变”与“不变”
在讲空间计算 Agent 之前,我们先回过头来看看:Jarvis 到底“厉害”在哪里?我们现在的智能助手又“差”在哪里?
4.1.1 科幻中的 Jarvis:交互的“理想型”
我们来拆解一下《钢铁侠》中 Jarvis 的几个经典交互场景,看看它具备哪些特征:
场景 1:实验室的全息交互
托尼站在实验室里,看着眼前的全息反应堆模型,皱了皱眉头:“Jarvis,把反应堆的功率输出提高 20%,模拟一下在高空环境下的稳定性。”
话音刚落,全息模型立刻开始变化,红色的能量波动在模型中流动,Jarvis 的声音响起:“先生,功率提高 20% 后,反应堆在 30000 英尺高空的稳定性为 87%,建议增加钛合金外壳的厚度 0.5 毫米。”
托尼点了点头,挥手将模型中的外壳部分放大:“帮我把这个区域的应力分布数据调出来。”
Jarvis 立刻在模型旁边生成了一张三维应力图,并用红色标注出了薄弱环节。
在这个场景中,Jarvis 具备以下特征:
- 多模态融合:既能听懂托尼的自然语言,又能识别托尼的手势(挥手放大模型),还能通过全息投影展示三维数据;
- 空间感知:知道全息模型在实验室中的位置,能将应力图“放置”在模型旁边的合适位置,不会挡住托尼的视线;
- 专业知识与工具调用:具备核物理、材料学的专业知识,能调用模拟工具计算反应堆的稳定性,还能调取应力分布数据;
- 上下文理解:记得托尼之前的指令(提高功率 20%),后续的应力图展示是基于之前的模拟结果。
场景 2:飞行中的情境响应
托尼穿着 Mark 战甲在空中飞行,突然 Jarvis 的声音响起:“先生,前方 5 英里处有一片雷雨云,建议绕飞。另外,佩珀刚刚发来了一条消息,问你晚上要不要一起吃饭。”
托尼一边调整战甲的方向,一边说:“告诉佩珀我今晚有空,另外,扫描一下雷雨云里有没有可用的雷电能量。”
Jarvis 立刻在战甲的抬头显示(HUD)上标注出绕飞路线,同时回复佩珀的消息,还开始扫描雷雨云的能量分布:“先生,雷雨云中有较强的负电荷聚集,是否启动能量吸收装置?”
在这个场景中,Jarvis 又多了两个特征:
- 主动感知与预判:不需要托尼指令,主动扫描前方的环境,发现雷雨云并建议绕飞;还主动提醒托尼佩珀的消息;
- 情境优先级判断:知道托尼现在在飞行,所以先提醒安全问题(雷雨云),再提私人消息(佩珀的约会);
- 具身交互:和战甲“绑定”在一起,能直接控制战甲的功能(绕飞、能量吸收),HUD 的信息也是直接展示在托尼的眼前,不需要额外的屏幕。
场景 3:日常生活的无缝融入
托尼早上起床,走进客厅,Jarvis 的声音响起:“先生,早上好。今天的日程是:上午 10 点和斯塔克工业的董事会开会,下午 2 点测试新的战甲推进器。另外,天气预报说今天下午有雨,你昨天让我帮你修的车已经修好了。”
托尼走到冰箱前,打开门:“帮我拿杯牛奶,另外,把董事会的会议资料投到墙上。”
Jarvis 立刻控制机械臂从冰箱里拿出牛奶,同时在客厅的墙上投影出会议资料:“先生,会议资料已经准备好了,需要我帮你摘要一下重点吗?”
这个场景中,Jarvis 更进一步:
- 环境融合:能控制家里的机械臂、冰箱、投影设备,和家居环境无缝集成;
- 长期记忆与个性化:记得托尼昨天让他修车,知道托尼的日程安排,了解托尼的日常习惯(早上喝牛奶);
- 自然语言的模糊理解:托尼说“把会议资料投到墙上”,Jarvis 不需要问“投到哪面墙”,因为它知道客厅的哪面墙适合投影,也知道托尼习惯用哪面墙。
4.1.2 现实中的传统智能助手:交互的“现实骨感”
看完 Jarvis 的“理想型”,我们再看看现实中的传统智能助手(比如 Siri、小爱同学、Alexa),它们的交互是什么样的?
我们以一个常见的场景为例:“你在客厅里,想打开空调,同时想知道今天的天气。”
传统智能助手的交互流程
- 触发:你需要先说出唤醒词(比如“小爱同学”);
- 指令:你说“打开客厅的空调”——注意,你必须明确说“客厅的”,因为小爱同学不知道你现在在哪个房间;
- 执行:小爱同学打开客厅的空调,然后说“已为你打开客厅的空调”;
- 再次触发:你需要再次说“小爱同学”;
- 再次指令:你说“今天的天气怎么样”;
- 执行:小爱同学告诉你今天的天气。
传统智能助手的局限
对比 Jarvis,传统智能助手的局限非常明显:
- 模态单一:几乎只依赖语音交互,无法识别手势、眼球动作,也无法通过全息投影展示信息(只能用手机屏幕或音箱声音);
- 无空间感知:不知道你在哪个房间,不知道你周围有什么设备,更不知道你眼前的东西是什么;
- 无情境理解:不知道你现在是在休息还是在工作,不知道你之前的指令是什么(每次都需要重新唤醒),也无法预判你的需求;
- 被动响应:只有你主动发出指令,它才会行动,不会主动提醒你任何事情(除非你提前设定了提醒);
- 无具身交互:没有“身体”,无法和你在空间里互动,也无法直接控制物理设备(需要通过智能家居平台间接控制);
- 记忆短暂:只有短期对话记忆,没有长期的个性化记忆(比如不记得你昨天让它修过车)。
4.1.3 交互演变的“变”与“不变”
从 2011 年 Siri 发布,到现在已经 13 年了,我们的智能助手到底“变”了什么?又有什么“没变”?
变的地方:
- 语音识别准确率提高了:从之前的“听不懂人话”,到现在能识别大部分日常用语;
- 支持的功能变多了:从之前的“设定提醒、打电话”,到现在能“点外卖、打车、控制智能家居”;
- 接入的设备变多了:从手机,到音箱、电视、手表,甚至汽车。
不变的地方:
- 交互的核心逻辑没变:仍然是“唤醒→指令→执行”的被动响应模式;
- 模态的局限没变:仍然以语音为主,触屏为辅,没有真正的多模态融合;
- 空间与情境的缺失没变:仍然不知道你在哪里,不知道你在做什么,无法理解你的真实意图。
为什么“变”了这么多,我们还是觉得智能助手“不够聪明”?因为这些“变”都是功能的叠加,而不是交互范式的变革。传统智能助手就像是一个“功能更强的遥控器”,而 Jarvis 则是一个“能和你一起生活的伙伴”——这就是本质的区别。
模块二:破局——Vision Pro 带来的空间计算,如何重新定义 Agent 的能力
2023 年 6 月,苹果发布了 Vision Pro,并称其为“空间计算设备”(Spatial Computing Device)。很多人觉得 Vision Pro 只是一个“更高级的 AR/VR 头显”,但实际上,它带来的是人机交互的第三次革命——从“键盘鼠标”(第一次)到“触屏”(第二次),再到“空间计算”(第三次)。
那么,空间计算到底是什么?它又如何重新定义 Agent 的能力?
4.2.1 空间计算的核心定义
苹果对空间计算的定义是:“让数字内容与你的物理世界无缝融合,让你用自然的方式(眼睛、手势、声音)与数字内容交互,而不需要任何控制器。”
我们可以把空间计算的核心特征拆解为以下 4 点:
1. 数字内容的“空间化”
在空间计算中,数字内容不再是“贴在屏幕上的平面图片”,而是“存在于物理空间中的三维物体”。比如:
- 你可以把一个虚拟的电视“放在”客厅的墙上,它的大小和真实的电视一样,你可以走近它、远离它,甚至绕到它后面;
- 你可以把一个虚拟的会议桌“放在”你的书房里,你的同事的虚拟形象会坐在桌子旁边,就像他们真的在你面前一样;
- 你可以把一个虚拟的太阳系模型“放在”你的卧室里,你可以用手拨动地球,看它绕着太阳转。
2. 交互方式的“自然化”
空间计算不再依赖键盘、鼠标或触屏控制器,而是用你最自然的方式交互:
- 眼睛:你看着哪个虚拟物体,哪个物体就会被选中(就像你用鼠标点击一样);
- 手势:你可以用手捏合来“点击”物体,用手拖动来“移动”物体,用手放大缩小来“调整”物体的大小;
- 声音:你可以用自然语言和虚拟物体对话,就像和真人对话一样。
3. 物理环境的“感知化”
空间计算设备能“看到”你的物理环境,知道:
- 你所在的房间的大小、形状、布局;
- 房间里的物体(比如桌子、椅子、电视)的位置、大小、材质;
- 你的位置、姿势、眼球动作、面部表情;
- 周围的光线、声音、温度。
4. 体验的“沉浸化”与“隔离化”的平衡
空间计算不是完全的“虚拟现实”(把你和物理世界完全隔离开),也不是完全的“增强现实”(只是把数字内容贴在物理世界上),而是两者的平衡——你可以根据需要调整“沉浸度”:
- 增强现实模式:你能看到物理世界,同时数字内容叠加在物理世界上(比如把虚拟电视放在客厅墙上);
- 混合现实模式:数字内容能和物理世界互动(比如虚拟的球能从你的物理桌子上弹起来);
- 虚拟现实模式:你完全沉浸在数字世界里(比如坐在虚拟的电影院里看电影)。
4.2.2 空间计算如何重新定义 Agent 的能力
空间计算的这 4 个核心特征,刚好解决了传统智能助手的所有局限——它为 Agent 提供了一个“全新的舞台”,让 Agent 能真正像 Jarvis 一样“融入”你的生活。
我们来具体看看空间计算给 Agent 带来了哪些新能力:
1. 空间感知能力:Agent 终于“知道你在哪里”
传统 Agent 不知道你在哪个房间,不知道你周围有什么,但空间计算 Agent 能通过设备的 SLAM 技术(同时定位与地图构建)和传感器,“看到”你的物理环境。比如:
- 当你说“打开空调”时,Agent 知道你现在在客厅,所以自动打开客厅的空调,不需要你说“客厅的”;
- 当你看着一个虚拟的台灯说“把这个灯调亮一点”时,Agent 知道你看的是哪个台灯,直接调整它的亮度;
- 当你在厨房里做饭,说“帮我找一下盐”时,Agent 能扫描厨房的布局,告诉你盐在哪个柜子里(甚至能在柜子上投影一个箭头)。
2. 多模态交互能力:Agent 终于“能看、能听、能动手”
传统 Agent 几乎只依赖语音,但空间计算 Agent 能融合眼睛、手势、声音、物理环境等多种模态。比如:
- 你可以用眼睛看着一个虚拟的文件,用手势捏合来“打开”它,同时用声音说“帮我摘要一下这个文件的重点”——Agent 会同时理解这三个模态的指令,完成任务;
- 你可以用手拖动一个虚拟的地球模型,同时问“中国在哪里”——Agent 会在地球模型上用高亮标注出中国的位置,同时用声音介绍中国的基本情况;
- 你可以皱眉看着一个虚拟的图表,Agent 会通过你的面部表情知道你“看不懂”,主动问“需要我帮你解释一下这个图表吗?”。
3. 情境理解能力:Agent 终于“懂你在做什么”
传统 Agent 不知道你的情境,但空间计算 Agent 能通过你的位置、姿势、眼球动作、日程安排、物理环境等信息,理解你的情境。比如:
- 当你在卧室里,躺在床上,看着天花板(Agent 通过你的姿势和眼球动作判断你在休息),这时你的老板发来了一条消息——Agent 不会主动提醒你,而是问“你现在在休息,需要我把这条消息推迟到明天早上吗?”;
- 当你在书房里,坐在桌子前,看着一个虚拟的代码编辑器(Agent 通过你的位置和眼前的内容判断你在工作),这时你的朋友发来了一条游戏邀请——Agent 会问“你现在在工作,需要我帮你回复朋友说你稍后有空吗?”;
- 当你在厨房里,看着一个虚拟的菜谱(Agent 通过你的物理环境判断你在做饭),菜谱上写着“加 5 克盐”——Agent 会主动在你的虚拟秤上显示“5 克盐”的刻度,不需要你问。
4. 具身交互能力:Agent 终于“有了身体”
传统 Agent 没有“身体”,但空间计算 Agent 能以虚拟形象的形式存在于你的物理空间里,甚至能和物理设备互动。比如:
- Agent 可以是一个虚拟的“小助手”形象,站在你的桌子旁边,你可以和它握手、拥抱,它会通过面部表情和手势回应你;
- 当你说“帮我泡杯咖啡”时,Agent 可以控制厨房里的机械臂(就像 Jarvis 一样),帮你泡一杯咖啡;
- 当你在玩虚拟游戏时,Agent 可以成为你的“队友”,和你一起在虚拟空间里战斗,它的动作会根据游戏的情境变化。
5. 长期记忆与个性化能力:Agent 终于“记得你是谁”
传统 Agent 只有短期记忆,但空间计算 Agent 能结合你的长期使用数据、日程安排、偏好设置,形成长期的个性化记忆。比如:
- Agent 记得你每天早上 8 点起床,喜欢喝热牛奶,所以每天早上 8 点会自动在你的餐桌上放一个虚拟的热牛奶形象,同时问“需要我帮你热一杯真实的牛奶吗?”;
- Agent 记得你对花粉过敏,所以当天气预报说今天花粉浓度很高时,会主动提醒你“今天花粉浓度很高,出门记得戴口罩”,同时帮你关闭家里的窗户;
- Agent 记得你上次看电影看到一半,所以当你再次坐在虚拟电影院里时,会主动问“需要我继续播放上次的电影吗?”。
4.2.3 从“工具”到“伙伴”:Agent 角色的转变
因为空间计算给 Agent 带来了这些新能力,Agent 的角色也发生了本质的转变:
- 传统 Agent:是一个“工具”,你需要用指令“控制”它,它的作用是“帮你完成特定的任务”;
- 空间计算 Agent:是一个“伙伴”,它能“理解”你的意图,“预判”你的需求,“融入”你的生活,它的作用是“和你一起生活、工作、娱乐”。
这就像从“遥控器”到“朋友”的转变——你不需要对“朋友”说“请帮我打开电视”,朋友会根据你的情境(比如你坐在沙发上,看着电视的位置)主动问“要不要打开电视?”;你不需要对“朋友”说“请提醒我明天开会”,朋友会记得你的日程,主动提醒你。
模块三:新范式——空间计算 Agent 的 4 大核心交互特征
现在我们知道了空间计算能给 Agent 带来什么能力,接下来我们要重点讲解:空间计算 Agent 的核心交互范式到底是什么?和传统交互有什么区别?
我们将空间计算 Agent 的核心交互特征总结为以下 4 点:
- 从“指令驱动”到“意图驱动”;
- 从“单一模态”到“多模态融合”;
- 从“被动响应”到“主动预判”;
- 从“屏幕交互”到“空间共生”。
接下来我们会逐个讲解这些特征,并用对比表格、ER 实体关系图、交互流程图来帮助大家理解。
4.3.1 特征一:从“指令驱动”到“意图驱动”
核心概念
- 指令驱动(Command-Driven):用户必须发出明确、具体的指令,Agent 才能执行任务。比如“打开客厅的空调,调到 26 度”——每一个细节都需要用户明确说明。
- 意图驱动(Intent-Driven):用户只需要表达自己的“意图”(想要做什么),不需要说明具体的“指令”(怎么做),Agent 会根据情境自动推断出需要执行的具体操作。比如“我有点热”——Agent 会根据你的位置(客厅)、当前的温度(30 度)、你的偏好(喜欢 26 度),自动打开客厅的空调,调到 26 度。
问题背景
传统 Agent 之所以是“指令驱动”,是因为它们没有情境理解能力和知识推理能力——它们不知道你为什么要发出这个指令,也不知道如何根据情境自动调整操作。比如你说“打开空调”,传统 Agent 不知道你是因为热还是因为冷,所以只能反问你“你想打开哪个房间的空调?调到多少度?”。
问题描述
“指令驱动”的交互存在以下问题:
- 交互成本高:用户需要思考如何发出明确的指令,甚至需要记住 Agent 的“指令格式”(比如必须说“打开客厅的空调”而不是“把空调打开”);
- 交互不自然:真实的人与人之间的交互是“意图驱动”的——你不会对朋友说“请帮我打开客厅的空调,调到 26 度”,你只会说“我有点热”;
- 无法处理模糊需求:如果用户的需求是模糊的(比如“我想放松一下”),传统 Agent 完全不知道该怎么做。
问题解决
空间计算 Agent 如何实现“意图驱动”?主要依靠以下 3 个技术:
- 情境感知:通过空间计算设备的传感器,获取用户的位置、姿势、眼球动作、物理环境、日程安排等情境信息;
- 意图识别:用 LLM(大语言模型)结合情境信息,理解用户话语背后的“真实意图”——比如用户说“我有点热”,LLM 会结合情境信息(当前温度 30 度,用户在客厅),识别出用户的意图是“降低客厅的温度”;
- 任务规划与工具调用:用 Agent 框架(比如 LangChain)根据意图,自动规划需要执行的任务,调用相应的工具——比如识别出“降低客厅的温度”的意图后,Agent 会规划任务:“打开客厅的空调→调到 26 度→检查空调是否正常运行”,然后调用智能家居平台的工具执行这些任务。
对比表格:指令驱动 vs 意图驱动
| 维度 | 指令驱动(传统 Agent) | 意图驱动(空间计算 Agent) |
|---|---|---|
| 用户输入 | 明确、具体的指令(如“打开客厅的空调,调到 26 度”) | 模糊、自然的意图表达(如“我有点热”) |
| Agent 理解方式 | 匹配“指令关键词”(如“打开”“空调”“26 度”) | 结合情境信息,用 LLM 推理“真实意图” |
| Agent 执行方式 | 严格按照指令执行,没有调整空间 | 根据情境自动调整操作,甚至补充用户没有提到的细节 |
| 交互成本 | 高(用户需要思考指令格式) | 低(用户只需要表达意图) |
| 自然度 | 低(像对机器说话) | 高(像对朋友说话) |
| 处理模糊需求的能力 | 无(完全不知道该怎么做) | 强(能根据情境推断出需求) |
交互流程图:意图驱动的交互流程
我们用 Mermaid 流程图来展示“意图驱动”的交互流程:
实际场景应用
我们以“我想放松一下”为例,看看空间计算 Agent 如何处理这个模糊的意图:
- 情境信息采集:Agent 采集到以下信息:
- 时间:晚上 8 点;
- 位置:客厅;
- 用户日程:今天开了 4 个会,工作了 10 小时;
- 用户偏好:喜欢听轻音乐,喜欢喝红酒,喜欢把灯光调暗;
- 物理环境:客厅的灯光是亮的,电视是关的,音响是关的。
- 意图识别:LLM 结合这些情境信息,识别出用户的意图是“结束一天的工作,放松身心”。
- 任务规划:Agent 规划以下任务:
- 任务1:把客厅的灯光调暗到 30%;
- 任务2:打开音响,播放用户喜欢的轻音乐;
- 任务3:询问用户是否需要喝红酒(如果需要,控制机械臂拿红酒和酒杯);
- 任务4:询问用户是否要看一部轻松的电影(如果需要,打开虚拟电视,推荐用户喜欢的喜剧片)。
- 任务执行:Agent 调用工具执行这些任务,同时询问用户的反馈。
4.3.2 特征二:从“单一模态”到“多模态融合”
核心概念
首先,我们需要明确什么是“模态”:
- 模态(Modality):指信息的传递方式,比如声音、文字、图像、手势、眼球动作、触觉等。
接下来,我们定义两种交互方式:
- 单一模态交互(Single-Modal Interaction):只使用一种模态进行交互,比如传统智能助手几乎只使用“声音”这一种模态。
- 多模态融合交互(Multi-Modal Fusion Interaction):同时使用多种模态进行交互,并且多种模态之间是“互补”的——Agent 会融合所有模态的信息,理解用户的真实意图。比如用户用眼睛看着一个虚拟的花瓶,用手势指着花瓶的瓶口,同时说“帮我在这里插一朵花”——Agent 会融合“眼睛(选中花瓶)”“手势(选中瓶口)”“声音(插一朵花)”这三个模态的信息,完成任务。
问题背景
传统 Agent 之所以是“单一模态”,是因为:
- 硬件限制:传统的智能设备(手机、音箱)没有足够的传感器来采集多种模态的信息——手机只有麦克风(声音)和摄像头(图像),但摄像头不会一直开启;音箱只有麦克风。
- 技术限制:之前的 AI 技术无法很好地融合多种模态的信息——比如无法将“手势”和“声音”结合起来理解用户的意图。
问题描述
“单一模态”的交互存在以下问题:
- 信息传递效率低:只用一种模态传递信息,很多细节无法表达清楚——比如你想用传统智能助手“调整虚拟电视的位置”,你只能说“把电视往左移一点”,但“一点”是多少?传统 Agent 无法理解。
- 交互不自然:真实的人与人之间的交互是“多模态”的——你和朋友说话时,会用眼神、手势、面部表情来辅助表达,朋友也会通过这些模态来理解你的意思。
- 容易产生误解:只用一种模态,很容易产生误解——比如你说“把这个打开”,传统 Agent 不知道“这个”指的是什么,因为它看不到你指的东西。
问题解决
空间计算 Agent 如何实现“多模态融合”?主要依靠以下 3 个技术:
- 多模态传感器:空间计算设备(比如 Vision Pro)配备了大量的传感器,能采集多种模态的信息:
- 视觉传感器:多个摄像头,能采集物理环境的图像、用户的手势、眼球动作、面部表情;
- 听觉传感器:多个麦克风,能采集用户的声音、周围的环境音;
- 空间传感器:LiDAR 扫描仪,能采集物理环境的三维结构;
- 惯性传感器:加速度计、陀螺仪,能采集用户的头部姿势、设备的位置。
- 多模态大语言模型(MLLM):比如 GPT-4o、Gemini Ultra、Claude 3 Opus——这些模型能同时处理“文字、图像、声音、视频”等多种模态的信息,并且能融合这些信息,理解用户的真实意图。
- 多模态交互框架:比如 Vision Pro 的 RealityKit、ARkit——这些框架能将多种模态的信息(比如手势、眼球动作)转化为“交互事件”,并传递给 Agent。
概念之间的关系:多模态融合的 ER 实体关系图
我们用 Mermaid ER 图来展示多模态融合中各个实体之间的关系:
交互关系图:多模态融合的交互流程
我们用 Mermaid 流程图来展示多模态融合的交互流程:
实际场景应用
我们以“调整虚拟电视的位置”为例,看看多模态融合的交互:
- 用户使用多种模态表达意图:
- 眼睛:看着虚拟电视;
- 手势:用手抓住虚拟电视的边缘,往左拖动;
- 声音:“再往左一点,对,就是这里。”
- 传感器采集模态信息:
- 摄像头:采集用户的眼球动作(选中虚拟电视)、手势(拖动的方向和距离)、虚拟电视的位置;
- 麦克风:采集用户的声音(“再往左一点,对,就是这里”)。
- MLLM 融合模态信息:
- 首先,MLLM 理解用户的初始意图是“调整虚拟电视的位置”;
- 然后,MLLM 结合手势的信息,将电视往左拖动用户手势指定的距离;
- 最后,MLLM 理解用户说“再往左一点”,所以继续将电视往左拖一点;当用户说“对,就是这里”时,MLLM 知道位置调整完成了。
- Agent 执行任务:
- Agent 控制虚拟电视的位置,根据 MLLM 的指令调整;
- Agent 反馈结果:
- Agent 的虚拟形象点了点头,说“好的,电视已经放到这里了”,同时虚拟电视的位置固定下来。
4.3.3 特征三:从“被动响应”到“主动预判”
核心概念
- 被动响应(Passive Response):只有当用户主动发出指令时,Agent 才会执行任务——就像一个“随时待命的仆人”,你不叫它,它就不会动。
- 主动预判(Active Prediction):Agent 会根据用户的情境信息、长期记忆、习惯偏好,主动预判用户的需求,并提前执行任务——就像一个“懂你的朋友”,不需要你说,它就知道你想要什么。
问题背景
传统 Agent 之所以是“被动响应”,是因为:
- 没有情境感知能力:不知道用户现在在做什么,不知道用户的需求是什么;
- 没有长期记忆能力:不记得用户的习惯、偏好、过去的行为;
- 没有预判能力:之前的 AI 技术无法根据历史数据和情境信息,预判用户的未来需求。
问题描述
“被动响应”的交互存在以下问题:
- 用户体验差:用户需要不断地发出指令,才能完成一系列任务——比如你想做饭,需要先让 Agent 打开抽油烟机,再让它打开燃气灶,再让它找菜谱,非常麻烦;
- 无法处理紧急情况:如果有紧急情况(比如家里的煤气泄漏了),传统 Agent 不会主动提醒你,直到你发现问题并发出指令;
- 无法提供个性化服务:因为不记得用户的习惯,所以无法提供个性化的服务——比如不知道用户喜欢喝热牛奶还是冷牛奶,所以只能问“你想喝什么牛奶?”。
问题解决
空间计算 Agent 如何实现“主动预判”?主要依靠以下 3 个技术:
- 长时记忆模块(Long-Term Memory):比如 LangChain 的 Memory 模块、向量数据库(比如 Pinecone、Chroma)——这些模块能存储用户的长期使用数据、习惯偏好、日程安排、过去的行为,让 Agent “记得”用户是谁。
- 情境感知与实时分析:空间计算设备的传感器实时采集用户的情境信息,Agent 会实时分析这些信息,判断用户当前的状态(比如“在工作”“在休息”“在做饭”)。
- 预判模型(Prediction Model):用机器学习模型(比如 LLM、推荐系统)结合长时记忆和实时情境信息,预判用户的未来需求——比如根据用户“每天早上 8 点起床,喜欢喝热牛奶”的长时记忆,结合“现在是早上 7 点 50 分,用户已经在卧室里翻了个身”的实时情境信息,预判用户“马上会起床,想要喝热牛奶”。
数学模型:主动预判的概率模型
我们可以用一个简单的概率模型来描述主动预判的过程:
假设我们要预判用户在时刻 ttt 的需求 DtD_tDt,我们有:
- 长时记忆数据:M={m1,m2,...,mn}M = \{m_1, m_2, ..., m_n\}M={m1,m2,...,mn}(比如用户的习惯偏好、过去的行为);
- 实时情境信息:Ct={ct1,ct2,...,ctk}C_t = \{c_{t1}, c_{t2}, ..., c_{tk}\}Ct={ct1,ct2,...,ctk}(比如用户的位置、姿势、当前时间);
那么,用户需求 DtD_tDt 的概率可以表示为:
P(Dt∣M,Ct)=P(Ct∣Dt,M)⋅P(Dt∣M)P(Ct∣M)
P(D_t | M, C_t) = \frac{P(C_t | D_t, M) \cdot P(D_t | M)}{P(C_t | M)}
P(Dt∣M,Ct)=P(Ct∣M)P(Ct∣Dt,M)⋅P(Dt∣M)
这个公式就是贝叶斯定理——它的意思是:
- P(Dt∣M)P(D_t | M)P(Dt∣M):先验概率——根据长时记忆 MMM,用户有需求 DtD_tDt 的概率;
- P(Ct∣Dt,M)P(C_t | D_t, M)P(Ct∣Dt,M):似然概率——如果用户有需求 DtD_tDt,并且有长时记忆 MMM,那么出现实时情境信息 CtC_tCt 的概率;
- P(Ct∣M)P(C_t | M)P(Ct∣M):证据概率——在有长时记忆 MMM 的情况下,出现实时情境信息 CtC_tCt 的概率;
- P(Dt∣M,Ct)P(D_t | M, C_t)P(Dt∣M,Ct):后验概率——结合长时记忆 MMM 和实时情境信息 CtC_tCt,用户有需求 DtD_tDt 的概率。
Agent 会计算所有可能需求的后验概率,选择概率最高的需求作为预判结果,并提前执行任务。
算法流程图:主动预判的算法流程
我们用 Mermaid 流程图来展示主动预判的算法流程:
实际场景应用
我们以“用户早上起床”为例,看看空间计算 Agent 如何主动预判需求:
- 长时记忆数据:Agent 从向量数据库中加载以下长时记忆:
- 用户每天早上 8 点起床;
- 用户起床后喜欢喝热牛奶;
- 用户起床后喜欢听早间新闻;
- 用户起床后喜欢把窗帘打开;
- 用户今天的日程是:上午 10 点开会。
- 实时情境信息采集:早上 7 点 55 分,Agent 采集到以下情境信息:
- 用户在卧室里,已经翻了个身,睁开了眼睛(通过眼球追踪传感器);
- 卧室的窗帘是关着的;
- 现在的时间是 7 点 55 分。
- 计算后验概率:Agent 计算所有可能需求的后验概率:
- 需求 1:打开窗帘——后验概率 95%;
- 需求 2:热一杯牛奶——后验概率 90%;
- 需求 3:播放早间新闻——后验概率 85%;
- 需求 4:提醒今天的日程——后验概率 80%。
- 主动执行任务:Agent 选择后验概率最高的需求,依次执行:
- 首先,打开卧室的窗帘;
- 然后,控制厨房的设备热一杯牛奶;
- 接着,在用户的眼前播放早间新闻(虚拟屏幕);
- 最后,提醒用户“今天上午 10 点有个会,需要我帮你准备会议资料吗?”。
- 收集反馈,更新记忆:如果用户说“今天不想喝牛奶,想喝咖啡”,Agent 会把这个反馈更新到长时记忆中,下次预判时就会考虑到这个变化。
4.3.4 特征四:从“屏幕交互”到“空间共生”
核心概念
- **屏幕交互(Screen Interaction)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)