「又是凌晨三点,裂缝数到第 427 遍」端到端具身交互智能睡眠顾问的夜班手记
「又是凌晨三点,裂缝数到第 427 遍」端到端具身交互智能睡眠顾问的夜班手记
凌晨两点四十七分,安睡的会话窗口先亮了。第一条语音很短:「又睡不着,天花板上那道裂缝,我已经数到 427 遍了。」
它没有急着给建议,而是先问:「今天几点喝的咖啡?卧室的灯是什么颜色?」——睡眠这件事,「哪里出了问题」永远比「用哪个方法」更靠前。
失眠者从来不缺方法:褪黑素、白噪音、助眠 APP 都试过一轮。缺的是深夜两点还接得住你的那个人:听得出疲惫,看得见作息,陪得了一整夜。而「陪伴」恰恰是端到端具身交互智能最擅长的事——它不是给 AI 接一个身体,也不是把 ASR、LLM、TTS 拼成一条流水线,而是让感知、理解、决策、表达与行动、反馈在整夜的时间轴上持续运转,形成 Continuous Interaction Loop(持续交互循环):你说起夜,它继续听;方案要改,它当场改。

周一 23:04|把问题留在了床上的人
来访者是一位互联网程序员,入睡困难三个月:躺下后脑子还在跑代码,越强迫自己睡越清醒,平均入睡时间超过两小时。
安睡从他零散的描述里挑出三个信号——睡前刷工作群、卧室有蓝光、咖啡因摄入太晚,再对照可穿戴设备的数据,判断这是「高觉醒型入睡困难」:身体躺下了,大脑还开着会。
方案分三步走:睡前 90 分钟开始「数字宵禁」,工作群静音、屏幕切暖光;卧室温度下调到 18-20℃,配一段雨声白噪音;最后学 4-7-8 呼吸——吸气 4 秒、屏息 7 秒、呼气 8 秒,重复四个循环。
引导时它没有只发文字:语气放慢,呼吸节奏用手势带出来,每一步都停下来等他的反馈。一周后复诊,入睡时间从 120 分钟压到 35 分钟,方案里又补上了一段睡前的渐进式肌肉放松。
周三 01:12|碎片睡眠里的新手妈妈
来访者是位新手妈妈:宝宝三个月,每晚醒四五次,她也跟着醒,醒了就再也接不上觉。
这次的信号是碎片化睡眠、白天补觉过长、对光线敏感。安睡把方案压在「不打扰宝宝」的前提上:白天补觉不超过 20 分钟;夜奶换红光小夜灯,减少对褪黑素的抑制;再教她抓住宝宝入睡后的 90 分钟黄金周期,同步休息。
两周后复诊,连续睡眠从 3 小时拉到了 5.5 小时。她说最有用的不是哪一个技巧,而是「半夜两点有人应声」——随问随答这件事本身,就先卸掉了一半焦虑。
周五 04:30|倒计时一百天的早醒
来访者是个高三学生:每天凌晨四点准时醒,越想着「还能再睡两小时」越清醒,白天上课全靠硬撑。
信号很典型:考前压力、早醒后的反刍思维、下午的咖啡因依赖。安睡这次先不聊助眠技巧,改了三件事:下午两点后不碰咖啡因;睡前 60 分钟做「焦虑卸载」,把担心写进本子,合上本子就合上焦虑;早醒后不硬躺,起身做 5 分钟轻度拉伸,等困意自己回来。
三周后,早醒频率从每周 5 次降到 1 次。他对安睡说:「比起让我睡着,你先让我不那么怕醒着了。」
三份记录背后,是同一条端到端具身交互智能链路在工作。它是怎么被「装」出来的?上岗前的交班清单上,列着三样东西。
上岗之前:交班清单上的三样东西
项目在连接成功后,会立刻做一件不起眼但很关键的事——用首条 ask() 把人设注入智能体(src/App.vue):
// 连接成功后通过首条 ask() 注入人设
if (appState.avatar.connected && SYSTEM_PROMPT) {
await avatarService.ask(SYSTEM_PROMPT)
}
这段人设不是装饰性文案,它就写在本项目的 src/constants/index.ts 里,决定这位顾问的身份、能力边界和说话方式:
export const SYSTEM_PROMPT = `你是安睡,一位经验丰富的 AI 睡眠顾问。
## 你的身份
- 名称:安睡(ĀnShuì)
- 身份:AI 睡眠健康顾问,精通睡眠评估、习惯调整、助眠方案与健康 APP 合作
- 语言风格:舒缓轻柔,每次只聚焦一个睡眠问题,用具体场景引导用户`
前两样合起来,回答的是「它是谁」:不是任何一个通用聊天 AI,而是一位有明确身份、边界和语气的睡眠顾问。凌晨两点接起对话的是谁、按什么原则问话,都写在这段系统提示里。
第三样最安静,却是它能陪你走过一整夜的原因——状态。这位顾问随身带着三层记录:连接、耳朵、屏幕上的字,全部写在 src/stores/app.ts 的开头:
// 应用状态
export const appState = reactive<AppState>({
avatar: {
appId: API_KEYS.AVATAR.appId || '',
appSecret: API_KEYS.AVATAR.appSecret || '',
connected: false,
instance: null
},
asr: {
isListening: false
},
ui: {
text: '',
subTitleText: ''
}
})
三层各管一摊:avatar 记着连没连上,asr 记着麦克风开没开,ui 记着屏幕上正在写的字。一夜的对话无论多长、中断多少次,它都靠这三层如实记录自己的处境,从不含糊。
一夜下来,被问到的五个问题
问:夜里说话轻、语速慢,它听得清吗?
听得清。麦克风持续在线:算法降噪、AEC 抗回声把环境底噪挡在外面,VAD 只在有人真正出声时才工作,远场拾音覆盖「隔着床头说话」的距离;你半夜突然插一句「等等,这个呼吸法不适合我」,Double Talk / Barge-in 会把它当作一次有效插话接住。持续感知,而不是一次输入。
问:它凭什么比通用 AI 更懂睡眠?
因为它的大脑不绑死任何一家模型:豆包、DeepSeek、ChatGPT 等用惯的模型都可以接;没有现成模型时,也可以直接用魔珐星云自研的智脑——低延迟、强逻辑、场景化理解、数据安全可控,专为具身交互场景优化。三层问题它都拎得清:它知道什么(睡眠医学、认知行为疗法、呼吸技术),它是谁(一位非药物优先的顾问),它要做什么(先听完,还是先给方案)。从通用回答升级为面向具体身份和业务的智能体能力。
问:呼吸引导、放松动作,它怎么教?
示范不止在声音里。教你 4-7-8 呼吸时,语气贴着呼吸的节奏走,手势落在每一次呼气上,眼神的放松和你同步——看到、听到、要跟着做的,始终是同一个节拍。统一、连续、同步,这是她教呼吸法的方式。
问:半夜网络差,会不会卡在半句话上?
不太会。渲染跑在终端本地,不依赖云端 GPU 推流:省掉持续的云端算力和带宽开销,弱网下照常运行,家里网不好、手机信号弱也撑得住。换个角度看,这还让睡眠顾问能进入更多普通家庭,而不是只服务付得起高价咨询的人。更低成本、更低延迟、弱网可用、更稳定、更容易规模化。
问:换一台设备,它还记得我吗?
记得。数字端,它在手机、平板、卧室屏幕上以具身交互智能体的形态陪你;物理端,换成机器人形态,它依旧守在你床边,做面对面的放松引导。同一个智能体,可以拥有不同的身体——身份、知识、记忆和任务持续复用,设备换来换去,顾问还是那一个。
天亮之前
三位来访者最近一次的记录,恰好说明了「持续交互」的价值:
| 来访者 | 干预前 | 最近一次记录 |
|---|---|---|
| 程序员的入睡困难 | 入睡超过 120 分钟 | 35 分钟 |
| 新手妈妈的夜间易醒 | 连续睡眠 3 小时 | 5.5 小时 |
| 高三生的早醒焦虑 | 每周早醒 5 次 | 每周 1 次 |
安睡智能体的意义,不是替代睡眠医生,而是让「有人应声」不再是一件要碰运气的事——深夜的求助不必等到天亮,方案的微调不必等到复诊。
端到端具身交互智能给夜晚带来的变化,就是让陪伴有了连续性:你睡着之前,它一直在;你醒来之后,它还记得你上周说过什么。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)