9 月 8 日:Agent 集体开始找「身体」
把这一天发生的事按「Agent 住在哪里」排一下,会看到一个很清晰的结构:
| 主体 | 动作 | Agent 住在哪里 |
|---|---|---|
| 荣耀 | 9/15 发布 MagicOS 11 | 手机操作系统 |
| 百度 | 搭子作为「超能小度」底座落地小度硬件 | 智能音箱 / 家庭硬件 |
| 网易有道 | 上线 AI 原生语音 Agent「叭哥说」 | 语音输入链路 + 本地处理 |
| Meta | 推出个人智能体 Muse | 独立安全虚拟机 |
| 小鹏 | IRON 产线启用,机器人自主走下产线 | 机械本体 |
同一天,五个不同位置。这不是巧合,这是 Agent 技术在找一个更合适的容器。
过去两年 Agent 主要住在两个地方:聊天窗口和 IDE。这两个位置有个共同问题——它们都是「你去访问它」。而上面这五个尝试的共同方向是:让 Agent 待在你本来就在的地方,或者干脆给它一个身体。
二、荣耀 MagicOS 11:手机 OS 第一次把 Agent Harness 做成商用
荣耀将于 9 月 15 日发布 MagicOS 11,官方定位是「行业首个系统级 Agent Harness 商用落地的手机系统」。
两个关键词值得拆:
「系统级 Agent Harness」 —— Harness 这个词在 Agent 工程里指的是包裹模型的那套脚手架:prompt、memory、tool、skill 的组织方式。荣耀把它做进 OS,意味着:
- Agent 可以跨应用调用系统能力,而不是被 App 沙箱切碎;
- 权限、身份、通知在系统层打通;
- 状态可以跨会话持久化在设备上。
「最高可执行上百步长程任务」 —— 这是最关键的一个数字。
为什么步数是核心指标?因为任务长度决定了 Agent 的价值量级:
3–5 步 → 打开 App、填个表、发条消息 (自动化)
20–50 步 → 比价、下单、改签、整理相册 (助手)
100+ 步 → 完成一个完整项目 (协作者)
上百步意味着它进入第三档。而长程任务真正的难点不在规划,在错误恢复:跑到第 37 步时目标 App 突然没有登录态了,或者页面改版了,系统能不能自己发现并绕过去?
这是判断「真长程」和「演示长程」的分水岭。 目前公布的只有步数上限,没有恢复机制的任何说明。建议等 9 月 15 日发布会之后的真机测试,尤其是刻意在中间环节制造异常。
顺带一提,华为那边的达芬奇 NPU 据报道支持「总参数 300 亿、激活 20 亿的端侧 MoE 全模态大模型入端」——手机端能跑的 MoE 规模已经到了这个量级。硬件能力先行,OS 层的 Agent 才有落地的物理基础。
三、百度搭子 × 小度:Agent 走进家庭
9 月 8 日百度 AI Day,百度搭子作为「超能小度」的 Agent 能力底座落地小度硬件,覆盖家庭日程、作业管理、AI 看护等场景,四款硬件新品率先接入。
这条新闻的意义官方说得很准:标志 Agent 从软件界面走向真实硬件入口。
我更关注的是它选的三个场景:
- 家庭日程 —— 低频但高价值的协调类任务;
- 作业管理 —— 高频、重复、家长愿意付费;
- AI 看护 —— 责任最重,也最考验可靠性。
这三个场景的共同点是:它们都不是「问答」,而是「代办」。 智能音箱过去十年主要被用来放音乐和查天气,因为那两件事的容错率高。把 Agent 放进去意味着容错率要求整体上了一个台阶。
AI 看护尤其值得警惕。 这是所有家庭场景里责任最重的一类——漏报一次跌倒是无法挽回的。我个人对这个场景的落地节奏持保留态度:技术可以做,但产品定义和法律责任边界需要先想清楚。
家庭硬件还有个特殊约束:它是多人共享设备。 一个手机 Agent 只服务一个人,一个音箱 Agent 要区分爸爸、妈妈、孩子的意图和权限。这个多用户问题在技术上(声纹识别 + 权限模型)有解,但在产品设计上目前很少有人认真做过。
四、网易有道「叭哥说」:语音 Agent 的本地化路线
9 月 8 日,网易有道上线首个 AI 原生语音 Agent「网易叭哥说」:
- 依托自研 ASR 与语义理解链路;
- 语音输入效率达键盘的 5 倍;
- 支持 124 种语言实时翻译;
- 数据本地处理;
- 终身免费。
「语音输入效率是键盘 5 倍」这个说法需要一个前提:它指的是连续口述场景。 中文键盘输入约每分钟 40–60 字,正常语速口述约每分钟 200–250 字,算下来确实是 4–5 倍。这个数字是合理的。
真正值得说的是后面两条:数据本地处理 + 终身免费。
本地处理在语音 Agent 上是刚需而不是加分项。语音数据天然包含声纹(生物特征)、环境声(家庭隐私)、口音和语言习惯。一条语音发到云端,泄露的信息量远大于一段文字。
终身免费则是一个明确的获客策略——语音 Agent 目前还处在「让人养成习惯」的阶段,这个阶段收费会直接劝退。
五、Meta Muse:另一种思路——把 Agent 关进虚拟机
海外这边同一天也有一条,路线完全不同:Meta 推出个人智能体 Muse,面向 18 岁以上用户。
核心设计有两个:
1. 运行在独立安全虚拟机中。
智能体操作与用户本地系统隔离,避免权限越界风险。
2. 原生接入 1Password。
可安全调用账号凭证,自主完成网页登录、表单填写、预约办理等任务。
这两条组合起来解决的是同一个问题:Agent 要替你办事,就得有你的凭证;但把凭证交给 Agent,风险怎么控?
Meta 的答案是:不把凭证交给模型,而是放进一个受控环境里,让 Agent 在隔离沙箱中「使用」凭证,但看不到凭证本身。
这个思路和国内厂商的做法形成了一个有意思的对照:
| 国内路线(荣耀 / 百度 / 有道) | Meta 路线 | |
|---|---|---|
| 切入点 | 入口:把 Agent 放进 OS / 硬件 | 边界:把 Agent 关进虚拟机 |
| 优势来源 | 用户触达、场景数据、跨应用能力 | 权限隔离、凭证安全 |
| 主要风险 | 权限过度集中 | 能力受限、体验割裂 |
| 隐含假设 | 用户愿意用便利换权限 | 用户愿意用能力换安全 |
两条路我都不认为会赢。 更可能的终局是:OS 层提供便利,沙箱层提供边界,两者叠加。 就像现代手机既有系统级剪贴板,又有每个 App 的权限弹窗。
一个具体的观察点:国内目前的终端 Agent 方案,公开信息里几乎没提凭证隔离。 如果 Agent 能替你登录网站、填写表单,那它必然要接触凭证。这部分怎么做、做在哪一层,是接下来一年最值得追问的安全问题。
六、两条容易漏掉的产业线
1. 具身智能到了量产节点。
小鹏 IRON 产线启用,机器人自主走下产线——「机器人造机器人」这件事本身就是一个信号:产线节拍已经稳定到可以让机器人参与装配。同时字节跳动的世界模型由张一鸣亲自督战,最快 10 月落地;天机智能完成 B++ 轮融资,蚂蚁集团、SOFINA 联合领投,高榕创投、腾讯跟投。
2. OpenAI 在把图像生成做「快」。
ChatGPT Images 2.5 发布,核心生成延迟最高降低 50%,新增 Sketch 草图功能——用简单线条草稿快速生成完整图像,并可基于草图迭代调整风格、细节与构图。
延迟降 50% 这件事被低估了。图像生成的交互模式取决于延迟:延迟 20 秒时,你是「下指令 → 等 → 看结果」;延迟 10 秒以下时,你会开始「试一下 → 改一点 → 再试」。后者才是创作,前者只是下单。
Sketch 功能同理——它把「描述你想要的」变成「画出你想要的」,这个门槛的降低比画质提升更有意义。
七、一个耐人寻味的小数据
同一天还有一条:DeepSeek 扩招 150 人,其中 0 个 AI 研究岗。
这个细节很容易被划过去,但它透露的信息不小。
一家以模型能力著称的公司,在大规模扩招时不招研究岗——可能有两种解释:
- 研究团队已经饱和,当前瓶颈在工程、产品、基础设施;
- 研究范式的重心转移——从「人做研究」转向「人管理 Agent 做研究」(参考本系列前一篇里 OpenAI 的「研究部门 Agent 工作量是人类研究员 3.1 倍」)。
如果是第二种,那这是一个行业级的信号:AI 公司的人力结构正在从「研究员金字塔」转向「Agent 运营 + 工程」的哑铃型。
当然,也可能只是这一轮的招聘结构如此。单个数据点不足以定论,但值得记下来,看下一轮是否延续。
八、给开发者的三条可执行建议
1. 现在就开始为「长程任务」设计错误恢复,而不是等步数上去。
如果你在做 Agent,把「跑到中间失败怎么办」当成一等公民。一个最小可行的模式:
# long_run_agent.py —— 长程任务的检查点与恢复骨架
import json, pickle, pathlib
from dataclasses import dataclass, asdict, field
@dataclass
class StepRecord:
index: int
action: str
observation: str
ok: bool
retry_count: int = 0
@dataclass
class RunState:
task: str
steps: list = field(default_factory=list)
max_steps: int = 100
consecutive_failures: int = 0
def checkpoint(self, path: str):
"""每一步都落盘 —— 长程任务崩溃是常态,不是异常"""
pathlib.Path(path).write_bytes(pickle.dumps(self))
@staticmethod
def restore(path: str) -> "RunState":
return pickle.loads(pathlib.Path(path).read_bytes())
def should_abort(self) -> bool:
"""连续 3 步失败说明环境变了,继续硬跑只会越跑越偏"""
return self.consecutive_failures >= 3
def record(self, rec: StepRecord):
self.steps.append(rec)
self.consecutive_failures = 0 if rec.ok else self.consecutive_failures + 1
# 使用模式:
# state = RunState.restore(ckpt) if ckpt.exists() else RunState(task="...")
# for i in range(len(state.steps), state.max_steps):
# obs, ok = do_one_step()
# state.record(StepRecord(i, action, obs, ok))
# state.checkpoint(ckpt)
# if state.should_abort():
# escalate_to_human(state) # ← 关键的不是恢复,是知道何时该叫人
# break
这段代码里最有价值的不是 checkpoint,是最后那一行:should_abort() + escalate_to_human()。 一个不会求救的 Agent,在长程任务里一定会在第 40 步左右开始自欺欺人。
2. 如果你做家庭/共享设备上的 Agent,先把多用户权限模型建起来。
这是智能音箱与手机最本质的区别,也是最少被认真处理的。声纹做身份、权限按人分、敏感操作二次确认——这三层要在架构阶段就设计,事后补非常痛苦。
3. 语音类功能优先做本地。
不只是合规考虑。语音链路的延迟对体验影响极大,本地 ASR 能省掉往返时间;而且语音数据的敏感性天然高于文本。有道把「数据本地处理」写进宣传点,说明市场已经开始认这个了。
参考来源
- 时代周报(荣耀 MagicOS 11),2026-09-08
- 电厂(百度搭子落地小度硬件),2026-09-08
- 财闻(网易有道「叭哥说」),2026-09-08
- Breitbart / dailyai.report(Meta Muse),2026-09-09
- 前沿在线《图像引擎与个人智能体密集迭代》,2026-09-09
- i黑马《黑马早报》(天机智能融资、DeepSeek 扩招),2026-09-09
免责:文中产品功能与参数为厂商公布口径,多数尚未发布或刚上线,未做实测;「上百步长程任务」为官方表述,实际能力以真机测试为准。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)