把这一天发生的事按「Agent 住在哪里」排一下,会看到一个很清晰的结构:

主体动作Agent 住在哪里
荣耀9/15 发布 MagicOS 11手机操作系统
百度搭子作为「超能小度」底座落地小度硬件智能音箱 / 家庭硬件
网易有道上线 AI 原生语音 Agent「叭哥说」语音输入链路 + 本地处理
Meta推出个人智能体 Muse独立安全虚拟机
小鹏IRON 产线启用,机器人自主走下产线机械本体

同一天,五个不同位置。这不是巧合,这是 Agent 技术在找一个更合适的容器。

过去两年 Agent 主要住在两个地方:聊天窗口和 IDE。这两个位置有个共同问题——它们都是「你去访问它」。而上面这五个尝试的共同方向是:让 Agent 待在你本来就在的地方,或者干脆给它一个身体。


二、荣耀 MagicOS 11:手机 OS 第一次把 Agent Harness 做成商用

荣耀将于 9 月 15 日发布 MagicOS 11,官方定位是「行业首个系统级 Agent Harness 商用落地的手机系统」。

两个关键词值得拆:

「系统级 Agent Harness」 —— Harness 这个词在 Agent 工程里指的是包裹模型的那套脚手架:prompt、memory、tool、skill 的组织方式。荣耀把它做进 OS,意味着:

  • Agent 可以跨应用调用系统能力,而不是被 App 沙箱切碎;
  • 权限、身份、通知在系统层打通;
  • 状态可以跨会话持久化在设备上。

「最高可执行上百步长程任务」 —— 这是最关键的一个数字。

为什么步数是核心指标?因为任务长度决定了 Agent 的价值量级

3–5 步    →  打开 App、填个表、发条消息    (自动化)
20–50 步  →  比价、下单、改签、整理相册     (助手)
100+ 步   →  完成一个完整项目              (协作者)

上百步意味着它进入第三档。而长程任务真正的难点不在规划,在错误恢复:跑到第 37 步时目标 App 突然没有登录态了,或者页面改版了,系统能不能自己发现并绕过去?

这是判断「真长程」和「演示长程」的分水岭。 目前公布的只有步数上限,没有恢复机制的任何说明。建议等 9 月 15 日发布会之后的真机测试,尤其是刻意在中间环节制造异常。

顺带一提,华为那边的达芬奇 NPU 据报道支持「总参数 300 亿、激活 20 亿的端侧 MoE 全模态大模型入端」——手机端能跑的 MoE 规模已经到了这个量级。硬件能力先行,OS 层的 Agent 才有落地的物理基础。


三、百度搭子 × 小度:Agent 走进家庭

9 月 8 日百度 AI Day,百度搭子作为「超能小度」的 Agent 能力底座落地小度硬件,覆盖家庭日程、作业管理、AI 看护等场景,四款硬件新品率先接入。

这条新闻的意义官方说得很准:标志 Agent 从软件界面走向真实硬件入口。

我更关注的是它选的三个场景:

  • 家庭日程 —— 低频但高价值的协调类任务;
  • 作业管理 —— 高频、重复、家长愿意付费;
  • AI 看护 —— 责任最重,也最考验可靠性。

这三个场景的共同点是:它们都不是「问答」,而是「代办」。 智能音箱过去十年主要被用来放音乐和查天气,因为那两件事的容错率高。把 Agent 放进去意味着容错率要求整体上了一个台阶。

AI 看护尤其值得警惕。 这是所有家庭场景里责任最重的一类——漏报一次跌倒是无法挽回的。我个人对这个场景的落地节奏持保留态度:技术可以做,但产品定义和法律责任边界需要先想清楚。

家庭硬件还有个特殊约束:它是多人共享设备。 一个手机 Agent 只服务一个人,一个音箱 Agent 要区分爸爸、妈妈、孩子的意图和权限。这个多用户问题在技术上(声纹识别 + 权限模型)有解,但在产品设计上目前很少有人认真做过。


四、网易有道「叭哥说」:语音 Agent 的本地化路线

9 月 8 日,网易有道上线首个 AI 原生语音 Agent「网易叭哥说」:

  • 依托自研 ASR 与语义理解链路
  • 语音输入效率达键盘的 5 倍
  • 支持 124 种语言实时翻译;
  • 数据本地处理
  • 终身免费

「语音输入效率是键盘 5 倍」这个说法需要一个前提:它指的是连续口述场景。 中文键盘输入约每分钟 40–60 字,正常语速口述约每分钟 200–250 字,算下来确实是 4–5 倍。这个数字是合理的。

真正值得说的是后面两条:数据本地处理 + 终身免费。

本地处理在语音 Agent 上是刚需而不是加分项。语音数据天然包含声纹(生物特征)、环境声(家庭隐私)、口音和语言习惯。一条语音发到云端,泄露的信息量远大于一段文字。

终身免费则是一个明确的获客策略——语音 Agent 目前还处在「让人养成习惯」的阶段,这个阶段收费会直接劝退。


五、Meta Muse:另一种思路——把 Agent 关进虚拟机

海外这边同一天也有一条,路线完全不同:Meta 推出个人智能体 Muse,面向 18 岁以上用户。

核心设计有两个:

1. 运行在独立安全虚拟机中。
智能体操作与用户本地系统隔离,避免权限越界风险。

2. 原生接入 1Password。
可安全调用账号凭证,自主完成网页登录、表单填写、预约办理等任务。

这两条组合起来解决的是同一个问题:Agent 要替你办事,就得有你的凭证;但把凭证交给 Agent,风险怎么控?

Meta 的答案是:不把凭证交给模型,而是放进一个受控环境里,让 Agent 在隔离沙箱中「使用」凭证,但看不到凭证本身。

这个思路和国内厂商的做法形成了一个有意思的对照:

国内路线(荣耀 / 百度 / 有道)Meta 路线
切入点入口:把 Agent 放进 OS / 硬件边界:把 Agent 关进虚拟机
优势来源用户触达、场景数据、跨应用能力权限隔离、凭证安全
主要风险权限过度集中能力受限、体验割裂
隐含假设用户愿意用便利换权限用户愿意用能力换安全

两条路我都不认为会赢。 更可能的终局是:OS 层提供便利,沙箱层提供边界,两者叠加。 就像现代手机既有系统级剪贴板,又有每个 App 的权限弹窗。

一个具体的观察点:国内目前的终端 Agent 方案,公开信息里几乎没提凭证隔离。 如果 Agent 能替你登录网站、填写表单,那它必然要接触凭证。这部分怎么做、做在哪一层,是接下来一年最值得追问的安全问题。


六、两条容易漏掉的产业线

1. 具身智能到了量产节点。
小鹏 IRON 产线启用,机器人自主走下产线——「机器人造机器人」这件事本身就是一个信号:产线节拍已经稳定到可以让机器人参与装配。同时字节跳动的世界模型由张一鸣亲自督战,最快 10 月落地;天机智能完成 B++ 轮融资,蚂蚁集团、SOFINA 联合领投,高榕创投、腾讯跟投。

2. OpenAI 在把图像生成做「快」。
ChatGPT Images 2.5 发布,核心生成延迟最高降低 50%,新增 Sketch 草图功能——用简单线条草稿快速生成完整图像,并可基于草图迭代调整风格、细节与构图。

延迟降 50% 这件事被低估了。图像生成的交互模式取决于延迟:延迟 20 秒时,你是「下指令 → 等 → 看结果」;延迟 10 秒以下时,你会开始「试一下 → 改一点 → 再试」。后者才是创作,前者只是下单。

Sketch 功能同理——它把「描述你想要的」变成「画出你想要的」,这个门槛的降低比画质提升更有意义。


七、一个耐人寻味的小数据

同一天还有一条:DeepSeek 扩招 150 人,其中 0 个 AI 研究岗。

这个细节很容易被划过去,但它透露的信息不小。

一家以模型能力著称的公司,在大规模扩招时不招研究岗——可能有两种解释:

  1. 研究团队已经饱和,当前瓶颈在工程、产品、基础设施;
  2. 研究范式的重心转移——从「人做研究」转向「人管理 Agent 做研究」(参考本系列前一篇里 OpenAI 的「研究部门 Agent 工作量是人类研究员 3.1 倍」)。

如果是第二种,那这是一个行业级的信号:AI 公司的人力结构正在从「研究员金字塔」转向「Agent 运营 + 工程」的哑铃型。

当然,也可能只是这一轮的招聘结构如此。单个数据点不足以定论,但值得记下来,看下一轮是否延续。


八、给开发者的三条可执行建议

1. 现在就开始为「长程任务」设计错误恢复,而不是等步数上去。
如果你在做 Agent,把「跑到中间失败怎么办」当成一等公民。一个最小可行的模式:

# long_run_agent.py —— 长程任务的检查点与恢复骨架
import json, pickle, pathlib
from dataclasses import dataclass, asdict, field

@dataclass
class StepRecord:
    index: int
    action: str
    observation: str
    ok: bool
    retry_count: int = 0

@dataclass
class RunState:
    task: str
    steps: list = field(default_factory=list)
    max_steps: int = 100
    consecutive_failures: int = 0

    def checkpoint(self, path: str):
        """每一步都落盘 —— 长程任务崩溃是常态,不是异常"""
        pathlib.Path(path).write_bytes(pickle.dumps(self))

    @staticmethod
    def restore(path: str) -> "RunState":
        return pickle.loads(pathlib.Path(path).read_bytes())

    def should_abort(self) -> bool:
        """连续 3 步失败说明环境变了,继续硬跑只会越跑越偏"""
        return self.consecutive_failures >= 3

    def record(self, rec: StepRecord):
        self.steps.append(rec)
        self.consecutive_failures = 0 if rec.ok else self.consecutive_failures + 1

# 使用模式:
# state = RunState.restore(ckpt) if ckpt.exists() else RunState(task="...")
# for i in range(len(state.steps), state.max_steps):
#     obs, ok = do_one_step()
#     state.record(StepRecord(i, action, obs, ok))
#     state.checkpoint(ckpt)
#     if state.should_abort():
#         escalate_to_human(state)   # ← 关键的不是恢复,是知道何时该叫人
#         break

这段代码里最有价值的不是 checkpoint,是最后那一行:should_abort() + escalate_to_human() 一个不会求救的 Agent,在长程任务里一定会在第 40 步左右开始自欺欺人。

2. 如果你做家庭/共享设备上的 Agent,先把多用户权限模型建起来。
这是智能音箱与手机最本质的区别,也是最少被认真处理的。声纹做身份、权限按人分、敏感操作二次确认——这三层要在架构阶段就设计,事后补非常痛苦。

3. 语音类功能优先做本地。
不只是合规考虑。语音链路的延迟对体验影响极大,本地 ASR 能省掉往返时间;而且语音数据的敏感性天然高于文本。有道把「数据本地处理」写进宣传点,说明市场已经开始认这个了。


参考来源
- 时代周报(荣耀 MagicOS 11),2026-09-08
- 电厂(百度搭子落地小度硬件),2026-09-08
- 财闻(网易有道「叭哥说」),2026-09-08
- Breitbart / dailyai.report(Meta Muse),2026-09-09
- 前沿在线《图像引擎与个人智能体密集迭代》,2026-09-09
- i黑马《黑马早报》(天机智能融资、DeepSeek 扩招),2026-09-09

免责:文中产品功能与参数为厂商公布口径,多数尚未发布或刚上线,未做实测;「上百步长程任务」为官方表述,实际能力以真机测试为准。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐