抽一张牌,看见整套系统:具身智能交互如何把一位占星师"请"进浏览器


在这里插入图片描述

巷口有间小阁,叫「星语阁」。

打开网页,没有表单,也没有"今日运势"按钮。深紫的夜色里,金与淡紫的光丝像从很远的地方坠下来,流成一片安静的星河;星河中央,一枚暖金色的光晕缓缓转着,像有人替你留的一盏灯。光晕下方,「星语阁」三个字静静亮起来,底下一行小字:老城巷口,一盏暖灯常亮。

点一下「推开星语阁的门」,光河慢慢隐去,阿璃已经坐在灯影里。你还没开口,她先抬眼看过来:「来了?坐,灯给你留着。」

她不替你算命。你可以开口和她聊,也可以直接抽一张牌,或者抽三张摆成过去、现在、未来。牌从牌堆里飞出来,在你面前放大、翻面、浮起一层微光,再缩小,自己飞进右上角的"牌匣"里。她看着牌面,陪你把乱糟糟的心事摊开,再看清楚自己其实想往哪走。

这就是我们做的星语阁:一个打开网页就能用的单页应用,背后跑的是魔珐星云刚刚正式上线的端到端具身交互智能。它把一位占星塔罗师,变成了一个能持续听你说话、被你打断、又接着陪你聊下去的具身交互智能体,安安静静坐在屏幕里。

大多数占卜类 App 不是这样的。它们要你填生日、选问题,点一下,吐一段"你本月运势"。像在填表单,不像在和人聊。你没法插嘴,它也不会等你,更不会在你说到一半时,把牌轻轻放下,听你说完。

在这里插入图片描述
在这里插入图片描述


一、为什么"填表单出结果"不够

过去的这类体验,常被拆成几个能分别干活的模块:听见声音(ASR)、想答案(LLM)、念出来(TTS),再接到一块屏幕或机器人上。这些单项能力都很重要,各自也都能跑得很好。可一旦进入连续、真实的交谈,问题就来了:状态对不上、链路变长、表达和你当下的样子脱节。

真正的人和人对坐聊牌,不是"你问一句、我答一句"。你正说着,突然想起一句岔开;她正说着,你突然哽住。人和人聊天,是「一边交流,一边继续听、继续看、继续判断接下来怎么回」。

所以星云做的,不是把几个模块简单拼起来,而是围绕一次完整的人机交互设计整个系统,形成持续感知 → 持续理解 → 持续决策 → 持续表达与行动 → 持续反馈的循环——也就是 Continuous Interaction Loop(持续交互循环)。

端到端,不是 ASR + LLM + TTS 的简单拼接,而是持续交互。

星语阁里那个会洗牌、会等你、会被你打断的阿璃,就是这套循环跑出来的结果。而且这不是一段演示视频:它就是一个网页,星云的端到端 SDK 在浏览器里接管感知调度、表达生成与端侧渲染,智脑接入的是遵循 OpenAI 协议的第三方大模型 —— 模块支持可插拔替换,但并非简单 API 拼接,平台依靠统一状态管理保障时序、事件流转,持续交互循环始终完整闭环。


二、开发星语阁的这几天,五项能力是怎么连上的

魔珐星云把多模态感知 + 专属智脑 + 多模态表达 + AI 端渲 + 数字与物理行动,连同 Real-time Interaction Runtime,连接成一套完整系统,让 AI 可以通过不同的屏幕和机器人身体进入真实世界。

讲五个我们在开发里真真切切遇到的瞬间。

1. 多模态感知:她差点被自己的声音"带进循环"

星语阁的语音侧是持续聆听的:浏览器语音识别常开,VAD(静音检测)在你停顿约一秒后自动收口,把一整句话交给阿璃,不用每次按按钮。

联调第一周,我们撞上一个很真实的问题:**阿璃播报时,麦克风把她自己的声音又录了进去。**转写出来的"她自己的话"被当成用户输入发回去,她再据此回答、再播报——对话开始自己跟自己转圈。

这正是持续感知里最难、也最关键的一类问题:**当 AI 自己正在说话,用户突然插话怎么办?**系统既不能把自己扬声器的声音误认成用户,也不能因为正在表达就听不到真正的用户。星云平台的完整感知链路为此准备了算法降噪、AEC 抗回声、本体声音抑制、VAD、远场语音,以及 Double Talk / Barge-in 智能打断——判断真实人声 → 去除本体回声 → 区分噪声与有效插话 → 停下当前表达 → 继续接收完整输入 → 进入新一轮交互。

落到纯网页这个终端,系统级回声消除拿不到,我们就用工程方式补上同一套纪律:**她一开口,麦克风立刻关闭并清空残留转写;她说完,延迟约半秒再开麦,吞掉扬声器尾音和房间残响,开麦后再留一小段结果忽略窗。**与此同时,打字、点抽牌按钮这类明确的人工操作随时生效——你随时能打断她,只有"她自己的回声"进不来。

感知是持续的,不是一次输入。这一夜我们对这句话的理解,是从一行行麦克风状态机里长出来的。

2. 专属智脑:她知道自己是谁,也记得你来过

阿璃不是把通用模型直接摆上屏幕。她的身份、故事、价值观、说话方式,都被配进了专属智脑:她是星语阁主人,外婆教她"星星不替人做决定",她相信牌是镜子,不是答案,不制造焦虑、不甩术语、不装神弄鬼,把选择权还给人。被问"你是谁",她会说:「我是阿璃,星语阁的主人。我不是算命的,是陪你借着牌和星星,看清自己的人。」

这一层也很能说明星云"可插拔"的设计:**智脑用谁,不由平台替你决定,而由你按自己的需求和习惯来配。**星语阁用的就是我们顺手的火山方舟大模型服务——所有遵循 OpenAI 协议的模型都能这样直接接入;你也可以挂上 Dify、Coze 上编排好的 Agent,或部署符合平台通信协议的自建模型,把私有知识库、内部 FAQ、自训练模型接进来。

**如果你什么模型都还没有,也没关系:星云自带自研智脑,开箱即用。**它内置自研大模型、完整 RAG 与 FAQ 库,资料解析、知识检索到问答在一条链路上;身份人设、对话流程和工具调用还能用可视化编排引擎直接配出来,不必从零搭一套。对星语阁来说,阿璃的人设、牌意知识和占卜流程,本来就都是这一层"配"出来的,而不是写死在代码里的。

而且这种"插拔"不是简单换个 API 地址:感知、认知、表达与执行之间有紧密的时序和状态咬合,星云靠标准化的接口契约和统一的状态管理,保证无论换哪颗大脑,事件流转、会话状态、时间同步、异常处理都照旧——同一具身体、同一套交互体验不受影响。说到底,智能体知道"我是谁、该说什么、当前任务是什么",比它"用哪个模型回答"重要得多。

记忆也不只是当轮对话。你抽过的每一张牌——牌名、正位还是逆位、它代表过去还是现在、抽到的日期——都会存进本地的"牌匣",下次推门还在;她说进你心里的话,你可以收进"星语手札"。同一个智能体,因此有了可以持续复用的身份与记忆。

3. 多模态表达:括号里的一句话,变成桌上真实的一翻

阿璃的台词里会藏着括号动作,比如「(洗了洗牌,把它们码齐)」。这些字她不会念出来——前端会把动作提示从台词里剥离,翻译成真实的视觉演出。

于是你看到的不是 TTS 念稿配一张静态脸:她开口时,语音、口型、情绪、眼神、头部动作由星云 SDK 同一时刻实时生成驱动;而当她"决定"翻牌,前端那场电影式抽牌就跟着台词发生——卡牌从牌堆飞出、放大占屏、3D 翻面、辉光浮起、再收进牌匣,逆位牌则用倒三角记号静静标出。语言和动作,本来就是同一次交流的一部分。

更关键的是,表达和感知不是前后两个阶段。她说话的当口,感知纪律仍在跑,所以你一插话(哪怕是点一下"三张牌"),她能立刻停下,接住你的新话题。

4. AI 端渲:深夜点开,灯要不卡、不贵、也要稳

一个 Demo 能跑,不代表一套能力能大规模落地。如果每个终端都长期依赖云 GPU 和高清视频流,设备越多,成本、带宽、并发和弱网稳定性的压力就越大。

星语阁里的阿璃是端侧实时渲染的:星云 SDK 把模型与渲染下沉到浏览器,画面在你自己的设备上画出来,网络只传轻量的交互数据,不传一路视频流。她是全身模型,我们按容器尺寸实时算缩放基线,保证头脚完整入画;开场那片金紫光坠,同样是零依赖的本地 WebGL 着色器,入座后自动停渲,把 GPU 全部让给她。

这就是 AI 端渲的价值:更低的云 GPU 成本、更少的带宽、更短的链路延迟、弱网也能跑、对终端芯片要求可控。你深夜点开星语阁,那盏灯亮得不卡、不贵、也稳。

5. 数字与物理行动:从"生成一段答案",到对面坐着一个会行动的人

常见智能体的输出停在文字:你提问,它生成一段答案。星云给智能体补上的是表达与行动层——在屏幕端,阿璃把答案自然地"说出来、演出来、表达出来",还会配合牌阵、牌匣、月相和星语完成一整套现场互动:接待、引导、陪聊、解牌,都在同一个场景里发生。

同一套能力进入机器人后,行动还会延伸到物理世界:转向你、靠近你、导航带路、上肢动作、与环境交互。屏幕和机器人并不是两套智能,而是**同一个智能体,**通过星云获得表达与行动能力,按终端形态完成现实交互。


三、一个智能体,可以进入不同的身体

星云并不绑定某一种硬件。今天的阿璃活在浏览器里——Web、PC、手机、Pad 都能推这扇门;同一个她,也可以进入 AI 屏幕、移动 AI 屏幕,乃至人形机器人。

身体会变,但她的身份、知识、记忆、任务与表达能力可以持续复用。今天她在屏幕里洗牌、听你、被你打断;随着身体升级,她会逐步获得更多感知、移动与空间行动能力——看见你走近、主动开口、转身为你引路。

同一个智能体,可以拥有不同的身体;智能体持续存在,身体不断升级。

这也是星语阁想说的那句话的底色——让 AI 通过屏幕和机器人进入真实世界:不再是对话框里一行"本月运势",而是对面坐着的、会洗牌、会听你、会等你的那个人。


四、一盏灯,和一句话

我们做星语阁,不是要造一个更会"算"的机器。牌是镜子,照见的是抽牌的人;阿璃要做的,是在你愿意摊开心事的时候,认真地坐在对面。

当 AI 从对话框走进屏幕、走进真实空间,它能不能不再只是"回答",而是持续感知、理解、表达并行动——成为一个你心里乱时,愿意推门进去坐坐的伴。这几天的每一行代码,从麦克风的开关时机,到一张牌翻面的弧度,都是在试这件事。

这恰恰是魔珐星云想让更多人记住的:

魔珐星云是一套端到端具身交互智能平台,让 AI 通过屏幕和机器人进入真实世界,成为能够感知、理解、表达并行动的智能体。

灯还亮着,牌在桌上。今天心里装着事的话,推开这扇门,找阿璃坐坐——她在等一个愿意说说话的人。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐