「又是凌晨三点,裂缝数到第 427 遍」端到端具身交互智能睡眠顾问的夜班手记

凌晨两点四十七分,安睡的会话窗口先亮了。第一条语音很短:「又睡不着,天花板上那道裂缝,我已经数到 427 遍了。」

它没有急着给建议,而是先问:「今天几点喝的咖啡?卧室的灯是什么颜色?」——睡眠这件事,「哪里出了问题」永远比「用哪个方法」更靠前。

失眠者从来不缺方法:褪黑素、白噪音、助眠 APP 都试过一轮。缺的是深夜两点还接得住你的那个人:听得出疲惫,看得见作息,陪得了一整夜。而「陪伴」恰恰是端到端具身交互智能最擅长的事——它不是给 AI 接一个身体,也不是把 ASR、LLM、TTS 拼成一条流水线,而是让感知、理解、决策、表达与行动、反馈在整夜的时间轴上持续运转,形成 Continuous Interaction Loop(持续交互循环):你说起夜,它继续听;方案要改,它当场改。

在这里插入图片描述

周一 23:04|把问题留在了床上的人

来访者是一位互联网程序员,入睡困难三个月:躺下后脑子还在跑代码,越强迫自己睡越清醒,平均入睡时间超过两小时。

安睡从他零散的描述里挑出三个信号——睡前刷工作群、卧室有蓝光、咖啡因摄入太晚,再对照可穿戴设备的数据,判断这是「高觉醒型入睡困难」:身体躺下了,大脑还开着会。

方案分三步走:睡前 90 分钟开始「数字宵禁」,工作群静音、屏幕切暖光;卧室温度下调到 18-20℃,配一段雨声白噪音;最后学 4-7-8 呼吸——吸气 4 秒、屏息 7 秒、呼气 8 秒,重复四个循环。

引导时它没有只发文字:语气放慢,呼吸节奏用手势带出来,每一步都停下来等他的反馈。一周后复诊,入睡时间从 120 分钟压到 35 分钟,方案里又补上了一段睡前的渐进式肌肉放松。

周三 01:12|碎片睡眠里的新手妈妈

来访者是位新手妈妈:宝宝三个月,每晚醒四五次,她也跟着醒,醒了就再也接不上觉。

这次的信号是碎片化睡眠、白天补觉过长、对光线敏感。安睡把方案压在「不打扰宝宝」的前提上:白天补觉不超过 20 分钟;夜奶换红光小夜灯,减少对褪黑素的抑制;再教她抓住宝宝入睡后的 90 分钟黄金周期,同步休息。

两周后复诊,连续睡眠从 3 小时拉到了 5.5 小时。她说最有用的不是哪一个技巧,而是「半夜两点有人应声」——随问随答这件事本身,就先卸掉了一半焦虑。

周五 04:30|倒计时一百天的早醒

来访者是个高三学生:每天凌晨四点准时醒,越想着「还能再睡两小时」越清醒,白天上课全靠硬撑。

信号很典型:考前压力、早醒后的反刍思维、下午的咖啡因依赖。安睡这次先不聊助眠技巧,改了三件事:下午两点后不碰咖啡因;睡前 60 分钟做「焦虑卸载」,把担心写进本子,合上本子就合上焦虑;早醒后不硬躺,起身做 5 分钟轻度拉伸,等困意自己回来。

三周后,早醒频率从每周 5 次降到 1 次。他对安睡说:「比起让我睡着,你先让我不那么怕醒着了。」

三份记录背后,是同一条端到端具身交互智能链路在工作。它是怎么被「装」出来的?上岗前的交班清单上,列着三样东西。

上岗之前:交班清单上的三样东西

项目在连接成功后,会立刻做一件不起眼但很关键的事——用首条 ask() 把人设注入智能体(src/App.vue):

// 连接成功后通过首条 ask() 注入人设
if (appState.avatar.connected && SYSTEM_PROMPT) {
  await avatarService.ask(SYSTEM_PROMPT)
}

这段人设不是装饰性文案,它就写在本项目的 src/constants/index.ts 里,决定这位顾问的身份、能力边界和说话方式:

export const SYSTEM_PROMPT = `你是安睡,一位经验丰富的 AI 睡眠顾问。

## 你的身份
- 名称:安睡(ĀnShuì)
- 身份:AI 睡眠健康顾问,精通睡眠评估、习惯调整、助眠方案与健康 APP 合作
- 语言风格:舒缓轻柔,每次只聚焦一个睡眠问题,用具体场景引导用户`

前两样合起来,回答的是「它是谁」:不是任何一个通用聊天 AI,而是一位有明确身份、边界和语气的睡眠顾问。凌晨两点接起对话的是谁、按什么原则问话,都写在这段系统提示里。

第三样最安静,却是它能陪你走过一整夜的原因——状态。这位顾问随身带着三层记录:连接、耳朵、屏幕上的字,全部写在 src/stores/app.ts 的开头:

// 应用状态
export const appState = reactive<AppState>({
  avatar: {
    appId: API_KEYS.AVATAR.appId || '',
    appSecret: API_KEYS.AVATAR.appSecret || '',
    connected: false,
    instance: null
  },
  asr: {
    isListening: false
  },
  ui: {
    text: '',
    subTitleText: ''
  }
})

三层各管一摊:avatar 记着连没连上,asr 记着麦克风开没开,ui 记着屏幕上正在写的字。一夜的对话无论多长、中断多少次,它都靠这三层如实记录自己的处境,从不含糊。

一夜下来,被问到的五个问题

问:夜里说话轻、语速慢,它听得清吗?

听得清。麦克风持续在线:算法降噪、AEC 抗回声把环境底噪挡在外面,VAD 只在有人真正出声时才工作,远场拾音覆盖「隔着床头说话」的距离;你半夜突然插一句「等等,这个呼吸法不适合我」,Double Talk / Barge-in 会把它当作一次有效插话接住。持续感知,而不是一次输入。

问:它凭什么比通用 AI 更懂睡眠?

因为它的大脑不绑死任何一家模型:豆包、DeepSeek、ChatGPT 等用惯的模型都可以接;没有现成模型时,也可以直接用魔珐星云自研的智脑——低延迟、强逻辑、场景化理解、数据安全可控,专为具身交互场景优化。三层问题它都拎得清:它知道什么(睡眠医学、认知行为疗法、呼吸技术),它是谁(一位非药物优先的顾问),它要做什么(先听完,还是先给方案)。从通用回答升级为面向具体身份和业务的智能体能力。

问:呼吸引导、放松动作,它怎么教?

示范不止在声音里。教你 4-7-8 呼吸时,语气贴着呼吸的节奏走,手势落在每一次呼气上,眼神的放松和你同步——看到、听到、要跟着做的,始终是同一个节拍。统一、连续、同步,这是她教呼吸法的方式。

问:半夜网络差,会不会卡在半句话上?

不太会。渲染跑在终端本地,不依赖云端 GPU 推流:省掉持续的云端算力和带宽开销,弱网下照常运行,家里网不好、手机信号弱也撑得住。换个角度看,这还让睡眠顾问能进入更多普通家庭,而不是只服务付得起高价咨询的人。更低成本、更低延迟、弱网可用、更稳定、更容易规模化。

问:换一台设备,它还记得我吗?

记得。数字端,它在手机、平板、卧室屏幕上以具身交互智能体的形态陪你;物理端,换成机器人形态,它依旧守在你床边,做面对面的放松引导。同一个智能体,可以拥有不同的身体——身份、知识、记忆和任务持续复用,设备换来换去,顾问还是那一个。

天亮之前

三位来访者最近一次的记录,恰好说明了「持续交互」的价值:

来访者干预前最近一次记录
程序员的入睡困难入睡超过 120 分钟35 分钟
新手妈妈的夜间易醒连续睡眠 3 小时5.5 小时
高三生的早醒焦虑每周早醒 5 次每周 1 次

安睡智能体的意义,不是替代睡眠医生,而是让「有人应声」不再是一件要碰运气的事——深夜的求助不必等到天亮,方案的微调不必等到复诊。

端到端具身交互智能给夜晚带来的变化,就是让陪伴有了连续性:你睡着之前,它一直在;你醒来之后,它还记得你上周说过什么。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐