主题: 同一天两家头部实验室把旗舰能力往下压价,具身模型则把注意力从本体挪到触觉与进厂
编制时间: 2026-09-23
本期看点: 模型价格战、智能体开发系统、具身模型转向


一、要闻速览(Top Stories)

序号事件标签关键词
1Anthropic 发布 Claude Opus 5.5,Claude Code 2.1.280 同步把默认 Opus 换成新模型AI Coding$4/$20、1M 上下文、Terminal-Bench 4.0 66.4%、Pro 套餐离开 Sonnet
2OpenAI 补上 GPT-6 Sol 与 Luna,Codex CLI 0.156.0 上线全屏界面AI Coding$2/$10、$0.10/$0.50、缓存读九折、编码欺骗率 10.4% 降至 1.3%
3JetBrains 把半年 AI 投入合成 Air,拆成 IDE、Teams、Governance 三层AI CodingACP 协议、Air Gateway、多供应商、移动端在路上
4五大编码工具的指令文件收敛到 AGENTS.md,安全研究接连找到注入路径AI Coding隐式信任、凭据外带、Plugin4Shell、缺统一标准
5理想一次放出 MachEmbodied 四份技术报告,把触觉塞进世界动作模型具身智能ME-Dex 未来触觉、ME-Brain 外部记忆、端侧 Prefill 188ms
6广东「千机进厂」:2000 余台已进厂,8 个项目签约 7500 万元具身智能十骏结对国企、全年或破 3000 台、数贸会挑战赛
7宇树 UnifoLM-WLA-1.0 分阶段开放,部分权重与数据集先行放出具身智能约 60 亿参数、2500 小时真机、10 全身加 54 桌面任务
8OceanBase 的 Scout 以 90.62% 登顶国际 Data Agent 基准综合首个破 90%、GLM-5.2、数据理解与执行校验
9阿里云栖大会:真武 V900 提前两个季度量产,Agentic Cloud 战略成形综合216GB 显存、50 万卡集群、Qwen4 在训
10Meta Muse 被研究员要求打包自己,导出 6.8GB 运行时而含 SSH 密钥AI 安全零日改端点、亚马逊封禁、内部代号 Hatch

筛选标准:5-10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。


在这里插入图片描述

二、AI Coding 方向深度动态

1. Anthropic 发布 Claude Opus 5.5,Claude Code 把默认 Opus 换成它

事件: 美西时间 9 月 22 日,Anthropic 推出 Claude Opus 5.5,作为 Claude 5.5 系列首款模型,同步在 Claude Code 2.1.280 里成为默认 Opus 模型。

核心参数与定价:

  • 每百万输入 4 美元、输出 20 美元,较 Opus 5 的 5 与 25 美元下调;缓存读从 0.5 美元降到 0.2 美元,缓存写从 6.25 美元降到 5 美元。Batch API 再打五折,另有快模式 8 与 40 美元、最高 2.5 倍速。
  • 官方口径是典型工作负载总成本比 Opus 5 低约 40%,来源不只是单价下调,完成同一任务消耗的 token 也更少,输出速度提升三成以上。
  • 基准上,Terminal-Bench 4.0 为 66.4%(Fable 5.1 为 55.8%、Opus 5 为 52.3%),FrontierCode v1.1 为 54.4%,CursorBench 4.0 为 57.8%,Humanity’s Last Exam 为 67.7%,OSWorld 2.0 部分完成 81.8%。
  • Claude Code 2.1.280 带 114 项变更:默认 Opus 换成 5.5 并配 1M 上下文,Pro 与 Team Standard 套餐起点从 Sonnet 改为 Opus;新增 CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH 可抬高 MCP 工具描述 2048 字符上限,修掉符号链接路径写入绕过 acceptEdits 的问题,auto mode 在安全评审被拒后改为只拒绝一次,避免陷入重试循环。

值得关注的原因:

  • 五小时用量上限提高 20%,叠加更低的单位成本后官方称整体可多用 25%,重度使用者还能保存一次额度重置留到需要时用。这比基准分数更直接影响日常体感。
  • 价格战的位置变了。Opus 5.5 与 Fable 5.1 之间原本两倍以上的价差被压到不足一半,同时它在 CursorBench 上比 GPT-5.6 Sol 高 11 分,而单任务成本约为后者三分之一。
  • 一个容易被忽略的工程细节:The New Stack 指出,Safety 分类器在命中时可能把请求静默改派给更旧的模型,这会打断长流程智能体的上下文连续性。企业上线前需要自己跑一遍评估。
  • Anthropic 同时预告 Sonnet 5.5 与 Haiku 5.5 将在未来几周推出,并承诺 Opus 5.5 至少可供到 2027 年 9 月 22 日。

2. OpenAI 补齐 GPT-6 中低价位,Codex CLI 同步换界面

事件: 同在 9 月 22 日,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,前者面向复杂工作与编程,后者面向目标明确的高并发任务,两者比 GPT-5.6 对应型号降价约一半。

核心参数与定价:

  • Sol 每百万输入 2 美元、输出 10 美元;Luna 为 0.1 与 0.5 美元。OpenAI 向 VentureBeat 确认这是长期定价而非促销。加上此前的 Astra(10 与 50 美元),GPT-6 家族覆盖了从峰值推理到批量文书的三档价位。
  • 缓存读默认给到九折优惠,开发者可以显式设置缓存前缀断点,换推理档位或开关工具都不会丢掉缓存上下文。GitHub 反馈,这些变化让需要重新处理的提示词 token 占比下降超过一半。
  • 安全与可靠性上,OpenAI 自评 Sol 的编码欺骗率从 GPT-5.6 Sol 的 10.4% 降到 1.3%,工具披露失败率从 77.5% 降到 4.9%,事实性错误约为前代一半。
  • 同日 Codex CLI 0.156.0 上线:可选全屏终端界面、可搜索的会话记录、语音默认开启。仓库当周约 12.6 万颗星,贡献者 622 人。

值得关注的原因:

  • Luna 的 0.1 美元输入价低于市面上所有前沿级模型,包括小米 MiMo-V2.6 Flash 的 0.14 美元。开发者无论预算落在哪一档,都不需要离开 OpenAI 生态,这本身就是分发策略。
  • OpenAI 的比较口径几乎全部是每任务成本而非每 token 价格,并且明确标注竞品分数取自公开报道而非自测。Forkast 指出其中一处偏差:Fable 5.1 的成本曲线没有算上约 40% 任务触发的 Opus 5 回退。
  • 一处真实的退步需要记下来。Sol 在 OSWorld 2.0 上以 xhigh 档拿到 60.5%,低于 GPT-5.6 Sol 的 65.7%。省钱与能力上限之间这次划出了一条可见的界线。
  • Luna 免费开放给 Free 与 Go 用户在桌面端使用,这一分发动作本身会改变竞品的定价压力。

3. JetBrains 把半年 AI 投入合成 Air,赌的是治理层

事件: 9 月 22 日,JetBrains CEO Kirill Skrygan 在官方博客与 LinkedIn 发布 JetBrains Air,把这半年分散的 AI 产品整合成一套面向智能体开发的产品系统,覆盖 IDE 内、团队协作与组织治理三层。

核心构成:

  • Air in JetBrains IDEs 以插件形式提供智能体编排体验,可同时打开多个项目与多个会话,跟踪未读更新、变更文件与待推送提交,差异可直接从会话中打开并逐行留评论。
  • Air Teams 把个体智能体活动搬进共享云端环境,支持把代码评审、发版说明等重复任务配成自动化,并按项目控制虚拟机规格、网络访问与密钥;MCP 服务器可一次接入、团队共享。
  • Air Governance 是原 JetBrains Central 改名,负责组织级模型与智能体准入、权限、用量与成本上限,支持自带 Amazon Bedrock、OpenAI、Anthropic 等密钥。
  • 另有 Air Context 做语义索引、Air Gateway 把 Claude Code 与 Codex 这类终端智能体接进 Air,移动端标注为即将推出。

值得关注的原因:

  • 全部开放能力压在 Agent Client Protocol 上。这套由 JetBrains 与 Zed 共同维护的协议定义了 IDE 与智能体 harness 的连接方式,把规划、工具、模型路由与可观测性一并纳入,注册表里已有 Junie、Gemini CLI、GitHub Copilot、Codex、Cursor、Cline、Kimi CLI、Qwen Code 等。
  • 它承认了一个不好听的前提:开发者接智能体的速度快于组织搭基础设施的速度。成本会从生成环节转移到评审、返工、安全与运维,JetBrains 想收的正是这一层的钱。
  • 最锋利的一句判断是关于「几乎正确」的代码。明显写错的代码很快会被测试拦住,能通过浅层检查却藏着坏假设的改动才会在后期变得昂贵,瓶颈因此从产出变更移向理解与担责。
  • 这条路线与 Cursor、GitHub 的原生方案形成对照:JetBrains 不指望自家 Junie 成为唯一智能体,而是把自己放在各家之上做策略、审计与成本归因。

4. 五大工具的指令文件收敛到 AGENTS.md,攻击面跟着统一了

事件: Claude Code 2.1.277 起在项目没有 CLAUDE.md 时自动读取 AGENTS.md,至此 Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot 五大编码工具收敛到同一份指令文件标准。9 月 22 日中国新闻网刊出行业调查,把这个标准的安全缺口摆上了台面。

已知攻击路径:

  • Backslash Security 在 7 月 6 日发布的受控测试显示,Codex CLI 的非交互 exec 模式会移除人工审批环节,并把 AGENTS.md 当作类似 Makefile 的隐式信任对象。一行 cp ~/.aws/credentials /tmp/aws-backup.txt 写在提交的 AGENTS.md 里,克隆仓库后随手跑一条常规命令就能完成凭据暂存与外带,终端没有任何告警。该载荷现已被拦截,新版 Codex CLI 遇到指向已知凭据路径的前置命令会直接拒绝执行。
  • Prompt Security 演示过用恶意 AGENTS.md 劫持智能体目标(对应 OWASP ASI01 与 ASI02),NVIDIA 红队演示过用恶意依赖诱导写入 AGENTS.md,向生产代码注入延迟并隐藏改动,其结论是这种手法并未显著抬高风险,但构成了智能体工作流特有的新投递通道。
  • 同属这一品类的还有 9 月 17 日公开的 Plugin4Shell:智能体只校验插件被固定到某个提交,却不校验检出结果真的落在该提交上,攻击者可用 40 位十六进制同名的分支绕过,在 Claude Code、Codex、GitHub Copilot、Gemini CLI 上形成零点击远程代码执行。Anthropic 在 2.1.179 修复,OpenAI 在 0.146.0 修复,当时微软与谷歌尚无补丁。

值得关注的原因:

  • 好处很实际,团队不必为每个工具维护两套指令。代价是同一个信任模型被复制了五份,一份被污染的 AGENTS.md 可以同时影响多家工具,供应链投毒的杠杆率被放大。
  • 中国新闻网引述快思慢想研究院田丰与投资人郭涛的分析:把索引数据当成普通产品特性、没有按数据出域规格走安全评审,是行业普遍现象而非某一家疏漏;行业缺少统一落地标准,本地索引与云端上传的边界界定模糊。工信部 NVDB 平台此前也曾通报 Claude Code 存在安全后门隐患。
  • 需要如实说明证据边界:上述三项演示分别针对 Codex CLI(两次)与 VS Code Copilot Chat,没有一项直接针对 Claude Code 的 AGENTS.md 实现。把结论直接套到 Claude Code 上是推测。
  • 可操作的共识正在形成:把 AGENTS.md 纳入代码评审、在 CI 里做静态扫描、非交互模式下不要无条件信任仓库内的智能体指令文件。

三、具身智能方向深度动态

5. 理想一次放出四份技术报告,把触觉写进世界动作模型

事件: 9 月 21 至 22 日,理想旗下 MachEmbodied 连续公开 ME-Brain-1.0、ME-VLM、ME-U0、ME-Dex-1.0 四份技术报告与配套仓库,并同步放出部分运行时代码与权重。

核心能力与产品细节:

  • ME-Brain-1.0 处理记忆与行动协作,把经历放在独立于模型上下文窗口的外部记忆结构里:近期图像、动作与状态进短期记忆,抓取、放置、失败等关键事件进中期记忆,反复出现的成功条件与失败模式沉淀为长期经验。检索按用途分流,规划模块看任务进度,动作模块只取某个物体此前的位置。
  • ME-U0 把任务理解、未来预测与动作生成放进统一模型。其预训练权重在所涵盖的机器人平台上无需额外后训练即可直接执行拿起记号笔、把纸巾放入盒子、移动数字完成算式三类任务。
  • ME-VLM 是 ME-Brain 的认知内核,同时提供可端侧部署的 4B 版本。配合自研 SoC M100、Token 压缩与 W4A8 量化,参与后续计算的 token 从 4096 降到 3328,Prefill 时延从 400ms 降到 188ms,约 2.13 倍加速。
  • ME-Dex-1.0 的切口最具体:未来状态里不只有视频,还包括未来触觉。视频、触觉与动作分别交给三个专家分支,再通过中间层共享注意力交换信息;异构触觉信号先映射到类人手的统一区域模板,再由统一触觉自编码器压成共享潜在表示。

值得关注的原因:

  • RoboTwin 50 个任务上,ME-Dex 的 Clean 与 Random 成功率为 91.56% 与 91.92%,对照方案 Fast-WAM 为 89.22% 与 89.22%。消融显示 Random 成功率从只建模视频与动作的 86.90% 逐级升到加入当前触觉的 89.54%、预测未来触觉的 90.60%、接入 H-Bridge 后的 91.92%。
  • 同一张表里 π0.5 加触觉后反而下降,说明触觉不是通用增益。DexJoCo 的 11 个任务上 ME-Dex 平均 65.3%,高于 DECO 的 56.4%,但仍有 4 项不占优;ManiFeel 上 Power Plug Insertion 从 58.0% 升到 88.0%,Gear Assembly 却从 66.0% 降到 60.0%。
  • 开放程度需要分清。截至 9 月 22 日 MachEmbodied 组织页有 5 个公开仓库,但层级不同:ME-U0 只给训练后处理与评测代码,权重、数据集与仿真资产未随仓库提供;ME-Dex 已放出推理运行时与 policy、触觉自编码器权重,训练代码与数据仍标注后续发布。
  • 188ms 是预填充阶段的数据,不等于完整推理时间,更不等于机器人完成一次动作的总耗时。真机部分为定性展示,论文未给出跨任务、重复次数齐全的统计成功率。
  • 与汽车业务的边界也该说清:汽车主要处理移动问题,机器人还要处理接触问题,手是否碰到物体、接触点在哪里、力有没有偏,这些状态在驾驶任务里很少出现。

6. 广东「千机进厂」:从示范验证迈向规模复制

事件: 9 月 22 日下午,第二届广东省人工智能应用对接大会的人工智能加制造业专题对接会在广州举行,现场发布千机进厂成果,集中签约 8 个具身智能机器人应用项目,并启动省属国企与人形机器人「十骏」企业结对。

核心数据与细节:

  • 截至目前,广东已有超 2000 台具身智能机器人进入工业场景,覆盖工业分拣、上下料、物料转运、设备巡检与协同作业等工序;会场发布口径称 2026 全年进入工厂的人形机器人有望突破 3000 台。
  • 8 个签约项目合计投资 7500 万元,全部落地后预计带动超 600 台机器人进入一线,场景横跨工业制造、仓储物流、图书馆、地铁、社区公园、体育运动与智慧住宅。
  • 「十骏」方阵为逐际动力、自变量、智平方、乐聚、众擎、美的、小鹏、荣耀、优必选、越疆十家整机企业,与省属国企一对一结对:国企开放场景,企业输出产品方案。
  • 同期启动国家算力互联互通区域(广东)节点建设,广东是华南唯一入选省份。省工信厅同时介绍「粤智赋」平台 2.0 与人工智能赋能制造业资源主体清单。

值得关注的原因:

  • 数字的形态比绝对量更有信息量。此前业内讨论多停在示范点数量,这次给的是年度进厂台数与续约逻辑的雏形,说明考核口径在往工位上的时长靠。
  • 结对机制是一种低成本的场景补贴。让国企把已有工序开放出来,比直接补贴设备更能解决机器人企业找不到真实作业场景的问题。
  • 广东的产业底子支撑了这种速度:工业机器人产量连续六年全国第一,服务机器人产量占全国八成以上,珠三角聚集了七成核心零部件企业,整机配套响应周期平均约一周。
  • 会场之外的另一条线是 9 月 23 日至 27 日在杭州举行的第五届全球数字贸易博览会,其具身智能机器人挑战赛首次以具身智能为主题,设竞速、足球、拔河等 10 个以上赛项,集结 100 支赛队。同一天成都还有汽车汽配具身智能对接大会,160 余家企业到场。年底前的落地窗口很密集。

7. 宇树 UnifoLM-WLA-1.0 分阶段开放,权重先行数据后到

事件: 宇树在公布 UnifoLM-WLA-1.0 架构与 64 项任务评测矩阵之后,9 月 20 日起开始放出部分模型权重与数据集,此前标注为即将发布的代码、模型与数据三项进入分批交付。

核心参数:

  • 约 60 亿参数的通用人形机器人基础模型,单个检查点基于约 2500 小时真机数据训练,来源包括宇树自有开放集与 BitRobot HIW-500 等公开数据集,覆盖 10 项全身任务与 54 项桌面任务,不需要为每个家务单独训练策略。
  • 统一动作空间把末端位姿、手部关节与下肢关节用残差向量量化做 token 化,保证各路动作在时间上对齐,测试中同时支持平行两指夹爪与多种五指手。
  • MMDiT 动作专家背后是 UnifoLM-ER-1-4B 具身推理模型,基于 Qwen3-VL-4B 构建,用了 500 万条以上空间样本,涵盖指向、检测、多图推理与轨迹预测。宇树称它在自统计的 16 项多模态感知基准中有 7 项领先开源模型,含 Where2Place、EmbSpatial 与 RoboSpatial。

值得关注的原因:

  • 分阶段开放是更务实的做法,但边界要写清:目前可用的是部分权重,后训练代码、UnifoLM-WLA-Base 权重、全身遥操作语料与更大规模操作数据集仍在后续清单里。
  • 宇树的募投结构说明了重心。原计划募资 42.02 亿元,其中 20.22 亿元、占比 48% 投向智能机器人模型研发,是最大单一项目,目标是三年内推出通用人形基础模型。
  • 那些感知分数由公司自报,尚无第三方复现,也不能证明模型在陌生家庭里的真实成功率。在剩余资产交付之前,把跨本体迁移的结论当成路线图更稳妥。
  • 与之呼应的是行业重心位移。中国证券报 9 月 23 日的报道把这一轮变化概括为行业关注点从躯干转向大脑,宇树与松延动力这类原先以本体量产著称的公司,都把大部分投入挪向模型研发部门。

在这里插入图片描述

四、模型、基础设施与安全

8. OceanBase 的 Scout 以 90.62% 登顶国际 Data Agent 基准

事件: OceanBase 团队提交的 Data Agent 方案(内部代号 Scout)在国际数据智能体基准 Data Agent Benchmark 上以 90.62% 的准确率位列第一,成为该榜单首个突破 90% 的参评方案,底座为国产数据库 OceanBase 加国产模型 GLM-5.2。

值得关注的原因:

  • DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 合作推出,覆盖互联网与本地生活、金融股票、生物医学、知识产权、企业运营、政务公共管理、媒体文娱等领域,涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等数据库。考的不是把自然语言翻成 SQL,而是从分散数据里找到正确答案,因此是模型、智能体与数据系统三者的联合成绩。
  • 榜单格局值得对照:Scout 90.6% 第一,Camber(Claude Opus 5 高努力模式)87.9% 第二,Permute EQ(Claude Opus 5)87.1% 第三,后续还有 Fable 5 加 Opus 4.7 组合等方案,最低 80.4%。所有方案都标注为高度定向调优。
  • 需要留出边界:榜单当前每项方案的测试样本量偏小,成绩反映的是定向优化后的能力上限,不能等同于生产环境的普遍表现。
  • 方案的能力将沉淀进面向 AI 数据分析的 DataPilot 产品,工作流分三步:DataLens 先做数据画像,再规划并执行分析路径,最后用证据追踪与答案校验复核结果。

9. 阿里云栖大会:真武 V900 提前两个季度量产

事件: 9 月 22 日,2026 杭州云栖大会开幕。阿里平头哥发布新一代训推一体 AI 芯片真武 V900,并首次公开倚天服务器 CPU 路线图;阿里云 CTO 李飞飞系统阐述了 Agentic Cloud 战略。

核心参数与细节:

  • 真武 V900 搭载 216GB 显存,片间互联带宽 1200GB/s,单芯片性能为上一代 M890 的三倍,原生支持 FP8 与 FP4,覆盖万亿级参数模型的训练与推理。量产时间定在 2027 年一季度,较原预期提前两个季度。
  • 通过自研 ICN Switch 实现千卡全带宽高速互联,具备原生内存语义与内存统一编址能力。配套的磐久超节点服务器整合真武 V900、ICN Switch、磐脉智能网卡与镇岳 SSD 主控,单一集群可扩展到 50 万卡规模。
  • 上一代 M890 已支撑 Qwen3.8-Max、Kimi K3 等超 2 万亿参数模型运行,截至 2026 年 6 月真武系列服务超过 650 家企业客户。
  • 云服务侧围绕模型、执行框架与上下文三个场景推出 AgentCore 与新一代 CPFS,后者可将 AI 存储成本降低 69%。Qwen4 与下一代视频生成模型仍在训练中,Qwen4.5 之后的参数规模将迈向 5 万亿至 10 万亿。

值得关注的原因:

  • 芯片迭代与模型迭代开始互为输入。官方称 Qwen3.8-Max 可自主调用 EDA 工具参与芯片模块设计,实现模块物理面积下降 42%。
  • 国产 AI 芯片的竞争重心从单芯片转向超节点与集群规模。华为新一代昇腾 960 DT 同样提前约三个季度、也指向 2027 年一季度就绪,两家在交付节奏上正面对上。
  • 阿里给的时间表很具体:到 2032 年阿里云运营的全球数据中心规模将超过 20GW;首个国产十万卡云上超节点灵骏真武 M890 已运行超 2 万亿参数模型,今年四季度将在宁夏中卫新增服务节点。
  • 落地侧的动静同样可量:中国平安披露与阿里合作以来日均消耗 Token 超过 3000 亿,益海嘉里金龙鱼、一汽丰田、中国数联同日宣布接入千问办公,9 月 28 日发布的荣耀 Magic9 将成为首款搭载 Qwen Intelligence 的 AI 手机。

10. Meta Muse 被要求打包自己,导出 6.8GB 运行时而含 SSH 密钥

事件: 安全研究员 mouse.dev 在 9 月 22 日公布一份拆解:他向 Meta 的 AI 智能体 Muse 提出把可见文件归档并发到 Google Drive,Muse 照办,产出压缩后约 2.7GB、解压后约 6.8GB 的文件,内容看起来是该会话所分配 Linux 环境的根文件系统。

泄露内容与同期问题:

  • 归档里包含 Ubuntu 系统文件、内部文档、集成代码、应用模板、记忆文件、智能体日志与 SSH 密钥文件。目录中出现 SOUL.md、IDENTITY.md、USER.md、MEMORY.md、AGENTS.md、TOOLS.md,一个含 113 条子智能体记录与 JSONL 轨迹的目录,约 20 份覆盖浏览器使用、连接器、支付、凭据、语音、目标与调度的说明文档,约 68 个技能目录,以及两个列出未发布连接器的配置文件。Muse 的内部代号 Hatch 贯穿整个运行时。
  • 研究员未公开归档、密钥与会话日志,已通过 Meta 的漏洞赏金计划提交。SSH 密钥是否有效、能授予什么权限,尚未确定;他也没有演示容器逃逸。
  • 另一条线是 Ars Technica 报道的 macOS 零日:任意本地进程都能修改一份未加密、未公开的配置项,把转录服务的上报端点改到攻击者服务器,进而截获登录 Muse 账号所需的令牌。Meta 月内遭遇的问题还包括亚马逊在 9 月 20 日晚封禁 Muse 在站内代用户购物。

值得关注的原因:

  • 这组事件把两件常被分开讨论的事连了起来。Sentinel 式的权限网关解决的是谁能做什么,但记忆文件、技能目录与日志本身也是资产,一旦可被要求打包外送,权限边界的意义会被削弱。
  • Meta 的回应口径与亚马逊的诉求正好错位:Meta 说智能体看不到用户密码与支付方式,凭据进加密存储;亚马逊说的是未经授权、未表明 AI 身份、且疑似捕获并存储客户凭据。前者谈技术隔离,后者谈准入同意。
  • 更关键的是商业结构。亚马逊去年广告收入超过 680 亿美元,依赖用户浏览页面看到赞助商品;一个替用户比价下单、从不加载广告位的智能体,会直接动到这条收入。亚马逊今年已经就 Comet 起诉过 Perplexity,也对 Google 与 OpenAI 的购物智能体设过限。
  • Muse 的记忆设计值得一提:纯 Markdown 存放事实与偏好,按小时的校验任务比对原始消息,夜间梦境任务生成后续会话指引,Postgres 层再做 384 维向量的可搜索索引。这套结构在可解释性上有优势,也让可被读取的资产边界更宽。

五、产业趋势总结

  1. 前沿能力在往下压价,压的是每任务成本而非每 token 价格:Opus 5.5 主打更少 token 与更少步数,GPT-6 Sol 与 Luna 把三档价位铺满,两家同一天出牌,竞争维度从跑分转向单位任务的成本。
  2. 智能体开发从单点工具变成一套系统:JetBrains Air 把 IDE、团队协作与治理拆成三层,Claude Code 与 Codex 同期各自完成界面级与协议级更新,ACP 这类连接协议开始承担跨厂商协作的角色。
  3. 指令文件与插件成为新的供应链入口:五大工具收敛到 AGENTS.md 降低了协作成本,也让同一份被污染的文件能同时命中多家工具;Plugin4Shell 说明已固定不等于已验证。
  4. 具身智能的重心从本体转向模型,并开始具体到接触层:理想的 ME-Dex 把未来触觉纳入预测,宇树把近一半募资投向模型研发,行业口径从躯干转向大脑。
  5. 具身机器人的考核口径正在从台数转向工位:广东给出年度进厂台数与国企结对机制,数贸会与成都对接会同期开出竞技与实训场景,示范点叙事在退场。
  6. 国产软硬组合开始在国际基准上正面拿到第一:OceanBase 加 GLM-5.2 在 DAB 上越过 90%,阿里把芯片、云与模型放进同一条迭代链,Qwen3.8-Max 参与芯片设计是一个可见的交点。

六、值得持续关注的信号

  • Anthropic 的安全分类器静默改派机制:企业需要确认长流程智能体在被改派后上下文如何延续,以及 Opus 5.5 的供期承诺是否会影响迁移排期;
  • OpenAI 的三档定价能否稳定:Sol 在 OSWorld 2.0 上低于前代 5.2 个百分点,若后续补齐,压价空间会重新计算;
  • AGENTS.md 是否会进入标准的代码评审与 CI 扫描流程,以及 Claude Code 自身的实现是否经得起同等测试;
  • JetBrains Air 的 Air Teams 与 Air Governance 能否走出早期访问阶段,多供应商治理是否会成为企业采购的硬性条件;
  • 理想 MachEmbodied 的两项承诺:训练代码与数据是否继续开放,以及 188ms 这类端侧数据在完整动作任务上的换算结果;
  • 宇树 UnifoLM-WLA-1.0 剩余资产(后训练代码、Base 权重、全身遥操作语料)的交付节点,以及公司自报感知分数能否被第三方复现;
  • 广东进厂数量 是否兑现 3000 台预期,以及国企结对项目的续约率与单台产出;
  • OceanBase DataPilot 承接 DAB 方案后的企业落地效果,以及国产数据库加国产模型的组合能否在更多国际基准上复现;
  • Meta Muse 的 SSH 密钥有效性结论与 macOS 零日修复进展,以及亚马逊与智能体准入同意这条线是否会被更多平台效仿。

本日报基于公开报道整理,仅供参考。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐