目录

窗口: 2026-08-17 00:00 → 2026-08-23 23:59(UTC+8)
方向: AI Coding · AI Agent · 具身智能
信源: P0 官方一手 + P1 高信噪媒体 + P2 国际对照锚点

本周核心判断

本周呈现三条清晰主线:

  1. Agent 基础设施从"实验"跨入"生产可用",但定价战同步加剧:Anthropic 于 8/20 将 Computer Use、Browser Use、Skills API、Files API 一举移出 beta 转为 GA,给出可量化的多动作回合与 HIPAA 合规信号;同期 OpenAI 于 8/21 将旗舰 GPT-5.6 Sol 的 API 价格下调超 20%(输入 $5→$4、输出 $30→$20),Stripe 以约 70–80 亿美元收购模型路由平台 OpenRouter——"模型调用层"正被支付与基础设施巨头直接吞并。
  2. 国产/开源模型完成"API 即服务"聚合,GLM-5.3 与 DeepSeek-V4-Pro 接入千问平台,GUI Agent 进入真机纪元:智谱 GLM-5.3 于 8/19 开放 API(权重定于 8/28 开源),阿里云千问 AI 平台 8/21 同步接入 GLM-5.3 与 DeepSeek-V4-Pro;阿里 Qwen-UI-Agent(8/20)以 100+ 真机、150+ 应用的实采环境训练,把 GUI Agent 从模拟器刷分推向"真实屏幕可执行"。
  3. 具身智能资本市场与真实落地双线引爆:宇树科技 8/19 登陆科创板(收盘 +460.34%、市值 3418 亿),WRC 2026(8/19–23)披露 2025 年机器人产业规上营收破 3000 亿、2026 上半年同比 +24.5%,星动纪元公布行业首个完成 PMF 验证的具身物流方案(顺丰、中国邮政 5 省市 10+ 物流中心常态运营)——机器人从"秀肌肉"转向"接订单、算 ROI"。

一、AI Coding

1. [官方发布] Anthropic 将 Computer Use、Browser Use、Skills API、Files API 一并转为 GA

时间: 2026-08-20
标签: [官方发布] [产品更新] [行业新闻]

Anthropic 在 Claude Platform 将四项 Agent 原语从 beta 移出、同日转为正式可用(GA)。关键事实:

  • Computer Use(computer_toolset_20260801): 不再需要 beta 头;新增"多动作回合"(multi-action turns),单回合可执行点击、输入、滚动等多个操作,早期客户报告每任务往返次数减少 20%–40%、单工作流成本约降 30%;并首次纳入 HIPAA 适用范畴(BAA 覆盖,Files/Skills API 不在此列)。
  • Browser Use(browser_toolset_20260801,新工具): 直接读取页面 DOM 结构而非像素坐标,在 WebVoyager 基准(586 个真实网页任务)得分 89.1%;适用"干净 DOM 的 Web 应用",桌面/遗留系统仍走 Computer Use。
  • Skills API: 以 SKILL.md 形式封装指令、脚本、模板,可版本化(生产环境 pin 到 version_id),在 Claude 沙箱内运行,无需自建托管。
  • Files API: 自动过期(expires_in_seconds,1 小时至 90 天,上传即定不可改)、速率限制提升 5 倍至 500 RPM、组织级存储扩至 1 TB。
  • 可用性: 四项现均可通过 Claude API 调用;Skills API 与 Files API 同步上线 Microsoft Foundry;Computer/Browser Use 即将登陆 Google Cloud Vertex AI。

来源: Anthropic 官方公告 · ByteIota 解析 · VibecodedThis 整理 · Enterprise DNA


2. [官方发布] 智谱 GLM-5.3 开放 API,权重定于 8/28 开源;阿里云千问平台接入 GLM-5.3 与 DeepSeek-V4-Pro

时间: 2026-08-19(API 上线) / 2026-08-21(千问平台接入)
标签: [官方发布] [开源权重] [产品更新]

  • GLM-5.3 API(8/19 凌晨): 智谱正式开放新一代基座模型 GLM-5.3 的 API,调用方式兼容 OpenAI 风格,并已接入 ZCode 编码平台与 GLM Coding Plan 订阅;官方同时宣布模型权重计划于 2026-08-28 开源。该模型 8/14 发布(W34 已述),参数 7430 亿、后训练跃迁,CyberGym 84.5%、Z.ai Code Bench 31.4% 超 Opus 4.8。
  • 千问 AI 平台接入(8/21): 阿里云宣布 MaaS 矩阵扩容,GLM-5.3 与 DeepSeek-V4-Pro 正式版接入千问 AI 平台,API 同步开放。平台现已聚合 Qwen3.8-Max、Qwen3.8 开源、Qwen Audio 3.0、Qwen-Image 3.0 Pro、Wan 3.0、Kimi K3 等,覆盖文本/代码/语音/图像/视频五大赛道;DeepSeek-V4-Pro、Qwen3.8-Max、Qwen-Audio 已开放 Token Plan 订阅,可在 Qoder、Codex 等工具按需切换。

来源: 百度百科 GLM-5.3 · 新浪财经·千问平台接入 · 站长之家 · 网易转载


3. [官方发布] 阿里发布 Qwen-UI-Agent:以真实世界为中心的 GUI 智能体基座模型

时间: 2026-08-20(技术报告与项目主页公开)
标签: [官方发布] [开源权重] [产品更新]

阿里巴巴通义千问 MAI-UI Team 发布 Qwen-UI-Agent,定位"以真实世界为中心的 GUI 智能体基座模型",覆盖移动端、电脑端、网页端与 DeepSearch 四类环境。关键事实:

  • 训练范式(sim-to-real 导向): 搭建覆盖 100+ 台真实手机、150+ 应用的真机移动运行时,用于任务构建、轨迹采集、训练与评测;自建 MobileWorld-Real 真机基准(400+ 任务、100+ 应用),打通"从模拟到真实"的最后一公里。
  • 混合动作空间: 除点击/滑动/输入外可直接执行命令行(GUI+CLI),电脑任务中约半数动作为 CLI、约 40% 以 batched actions 形式输出,显著压缩执行轨迹。
  • 长程 RL: 支持 100+ 步超长轨迹在线 RL,约 1 万并发环境同时 rollout,配自适应课程学习。
  • 安全内建: 遇违法/高风险请求直接拒绝终止;支付、删数据、隐私授权等敏感操作主动停手待确认。
  • 公开基准(厂商/公开报道口径): Tau2-Bench 89.9、Terminal-Bench 2.0 50.1、MMLU-Pro 86.5、IFEval 90.2、BrowseComp-ZH 由 62.1 升至 75.0;在 OSWorld-v2 上 40.0,低于 Claude Opus 4.8(54.8)与 GPT-5.5(49.5),长程桌面仍是差距项。
  • 开源情况: 技术报告与演示公开;前代 MAI-UI 已开源 2B/8B(Apache 2.0),Qwen-UI-Agent 旗舰权重暂未完整开放。

来源: 阿里研究院/公众号转载 · 智东西 · 今日头条 · arXiv 2607.28227 · GitHub Tongyi-MAI/MAI-UI · 项目主页


4. [官方发布] OpenAI 将 GPT-5.6 Sol API 价格下调超 20%,促销期至 11/21

时间: 2026-08-21
标签: [官方发布] [产品更新] [行业新闻]

OpenAI 宣布未来 3 个月内将 GPT-5.6 Sol 的 API 与 Credit 价格下调超 20%。关键事实:

  • 新价格(标准短上下文): 输入 $5→$4、缓存输入 $0.50→$0.40、输出 $30→$20 每百万 token;长上下文文档位同步下调(输入 $10→$8、输出 $45→$30)。
  • 覆盖范围: API、Codex credits、ChatGPT Work(陆续推送);Pro/Plus/Business 订阅价格不变。
  • 期限: 促销性质,运行至 2026-11-21;为 GPT-5.6 家族自 7/9 发布以来首次触及旗舰档价格,此前 7/30 已对 Terra(−20%)、Luna(−80%)降价。
  • 背景: Reuters 等报道将此次降价与 Anthropic、DeepSeek、Kimi K3 在 API 定价上的压力并列;Sol 是 OpenAI 面向长程 Agent 与编码的旗舰档,此前一直维持发布价。

来源: OpenAI 开发者社区公告 · IT之家/今日头条 · AI/TLDR · Tech in Asia(转 Reuters) · Startup Fortune 分析


5. [开源生态] DeepSeek Harness 迭代至 0.1.1-rc.2:MIT 插件化 Agent 运行时,原生支持视觉

时间: 2026-08-21(rc.2 发布)
标签: [开源权重] [产品更新] [行业新闻]

DeepSeek 于 8/13 开源的 Agent 运行时 DeepSeek Harness(CLI 名 dsh)在窗口内迭代至 0.1.1-rc.2。关键事实:

  • 架构: MIT 协议、TypeScript 单体仓库(约 500K LOC)+ ~300 行 C11;基于 Cordis 插件框架,“一切皆插件”——模型适配器、工具注册、会话日志、沙箱乃至 Agent 循环本身均可从配置替换,无特权核心。
  • 规模与状态: 截至 8/23 约 186,383 stars / 20,661 forks;GitHub 标记为 Pre-release,官方明确"将存在兼容性破坏性变更",属开发者预览。
  • 0.1.1-rc.2 变更: DeepSeek 适配器优先使用 Files API 上传图片并复用;按模型要求自动缩放/转码预处理;宣布支持 deepseek-v4-flash-vision-exp(实验性视觉模型)。
  • 可复现性: V4-Pro-0813 的代码 Agent 基准即由该 Harness 的 minimal 模式评出,开源使分数在原理上可外部复现(截至窗口尚未见独立复现)。

来源: GitHub deepseek-ai/deepseek-harness · andrew.ooo 评测 · freedom.tech 变更说明 · S5 Labs 解读


6. [行业新闻] Stripe 以约 70–80 亿美元收购 AI 模型路由平台 OpenRouter

时间: 2026-08-17(彭博率先报道) / 2026-08-19–20(Stripe 官宣)
标签: [行业新闻] [融资/人事]

支付巨头 Stripe 完成对 AI 模型网关 OpenRouter 的收购。关键事实:

  • 交易规模: 多方口径不一——彭博称超 70 亿美元,《纽约时报》援引知情者称 75 亿美元,Axios 称超 80 亿美元且以股票为主,《金融时报》称约 80 亿美元(约 538 亿元人民币);Stripe 与 OpenRouter 均未披露具体条款。较 OpenRouter 今年 5 月 B 轮 13 亿美元估值显著跃升。
  • 业务: OpenRouter 为开发者提供统一模型入口,聚合 400+ 模型、80+ 提供商,按复杂度/价格/速度自动路由;日均处理 超 10 万亿 token,服务 超 1000 万开发者与企业(英伟达、Zoom、Lovable 等)。
  • 战略意义: Stripe 将支付/计费/金融基础设施延伸至 AI 推理消费与路由环节,构建"Token 即经济单位"的基础设施层;OpenRouter 公告强调产品名与路线图不变、路由决策始终以客户利益优先。
  • 团队: OpenRouter 2023 年初成立,约 90 人;CEO Alex Atallah。

来源: 环球网/彭博 · 新浪财经 · 至顶科技 · Proactive Investors


二、AI Agent / 国际锚点

7. [学术前沿] Google DeepMind × EVE Online:以持久游戏世界研究长程 Agent

时间: 2026-08-21(官方博客)
标签: [学术前沿] [行业新闻]

Google DeepMind 发布与 Fenris Creations(《EVE Online》背后独立工作室)的游戏 AI 研究合作长篇回顾,将研究场域从有限对局、短片段推向"运行逾 20 年、由玩家持续改写的世界"。关键事实:

  • 研究目标(四项硬问题): 持续学习(不遗忘)、超越上下文窗口的记忆、跨周/月/年的长程规划、含合作/竞争/谈判/经济的复杂多智能体动态。
  • 分阶段路径: 从与真实玩家隔离的离线 EVE Online 实例起步 → 经 EVE Frontier 研究人机共存 → 能力成熟后才考虑进入实时游戏(EVE Online / EVE Vanguard)。
  • 已有产出: Aura Guidance(2026-02-17 原型上线)用 Gemini 基于真实 Rookie Help 问答回答新手问题,正以受控 A/B 测试衡量新玩家留存。
  • 边界提示: DeepMind 明确不会在当下将自主 Agent 投入实时 EVE Online;本次公告未给出任何 EVE 专属分数、方法或安全评估。

来源: Google DeepMind 官方博客 · Unite.AI 解析 · explainx.ai 拆解


8. [学术前沿] SWE-bench Science: Coding Agent 遇上真实科研代码,最优 Agent pass@1 不足 50%

时间: 2026-08-20(arXiv 提交)
标签: [学术前沿] [待核验]

复旦大学 OpenMOSS 组(邱锡鹏团队)发布 SWE-bench Science 基准。关键事实:

  • 规模: 119 个仓库级任务,来自 98 个 GitHub 仓库、20 个科学领域,分 Issue-driven(52)、Expert-exploratory(49)、Engineering-integration(18)三类。
  • 核心发现: 最优 Agent(Claude Code 配 Opus-5 max)pass@1 低于 50%;同一代 Agent 在常规 SWE-bench Verified 上轻松破 80%——工程代码与科学代码之间存在约 30 分差距。
  • 失败机制(四类): 科学知识/抽象缺失、探索方向偏误或表面修复、修复覆盖不全/系统集成不足、无法将科学原理泛化到未见情形。
  • 知识消融: 补充科学上下文"并非 uniformly 有益"——对齐良好时可提效,对齐偏差则会诱发锚定(anchoring)、反而降低首试成功率。
  • 评估设计: 公开发布不含参考补丁、私有测试与评分器;验证容器与评分容器分离,提交后才运行隐藏测试,直接回应 SWE-bench Verified 被诟病的"测试过具体/任务欠规范"。
  • 备注: 系第一方对第一方基准的评估;隐藏测试的有效性依赖维护纪律,随提交积累可能泄露,已标注待核验。

来源: arXiv 2608.19799 · Clauday 解读 · DEV Community 深读 · ArxivLens


三、具身智能

9. [行业新闻] 宇树科技登陆科创板:收盘 +460.34%,市值 3418 亿

时间: 2026-08-19
标签: [行业新闻] [融资/人事]

宇树科技(688836.SH)于 8/19 正式登陆上交所科创板,成为"A 股人形机器人第一股"。关键事实:

  • 发行与估值: 发行价 150.80 元/股,公开发行 40,446,434 股(占发行后 10%),募资 60.99 亿元(原拟 42.02 亿,超募 45.15%);发行后总股本 4.0446 亿股。
  • 首日行情: 开盘 1100 元/股(+629.44%),盘中最高 1100 元;收盘 845 元/股(+460.34%),总市值 3418 亿元;全日成交 25.66 万手、成交额 231.60 亿元、换手率 85.28%。
  • 热度与分歧: 网上中签率 0.01809759%(科创板开板以来最低),978.46 万户参与申购、认购倍数 2618 倍(另有报道称 8288 倍);创始人王兴兴直接持股 21.44%,按收盘价持股市值约 732 亿元。
  • 板块反差: 上市首日机器人概念股集体下挫——宇树机器人指数跌 8.38%、人形机器人/具身智能指数均跌超 7%;科创 50 跌 6.89%。

来源: 腾讯股票/行情 · 第一财经/今日头条 · 21 世纪经济报道 · 青岛日报/观海新闻


10. [行业新闻] 2026 世界机器人大会(WRC)开幕:产业从"秀肌肉"转向"接订单"

时间: 2026-08-19 至 08-23(北京亦庄)
标签: [行业新闻] [待核验]

2026 世界机器人大会(WRC 2026)以"人机共生、产需共融"为主题在北京举办。关键事实:

  • 规模: 373 家企业参展、携 3000+ 件创新产品,311 款新品集中亮相;同期举办 70 余场活动(较去年翻倍),1 万余名选手参赛。
  • 工信部数据(副部长辛国斌开幕式披露): 2025 年机器人产业规上企业营业收入突破 3000 亿元,近 5 年年均增速超 20%;2026 上半年达 1655 亿元、同比 +24.5%
  • 产业链定位: 中国电子学会理事长徐晓兰称,我国人形机器人具备完整"材料—核心零部件—整机整合—场景运营—数据服务"配套能力,2025 年以全球 90% 出货量、逾 330 款产品占据产业高地;2026 Q1 人形机器人出口同比 +210%。
  • 信号: 多家媒体一致指出,产业焦点从"舞台炫技"转向"产线干活、算 ROI";8/20 主论坛发布《2026 人形机器人产业发展报告》称 2026 上半年中国人形机器人出货量已超 4 万台、全球占比升至 97%。
  • 备注: “90% 出货量”"97% 占比"等口径来自学会/媒体转述 SAG 等机构,与 W34 已述 SAG H1 数据(97%+)一致,但不同机构统计口径存在差异,已标注待核验。

来源: 工信部官网 · 中国网 · 中国青年网 · 央广网


11. [行业新闻] 星动纪元公布行业首个 PMF 验证的具身物流方案:顺丰、中国邮政 5 省市 10+ 中心常态运营

时间: 2026-08-23(WRC 期间接受采访)
标签: [行业新闻] [产品更新]

星动纪元在 WRC 2026 展出全栈具身产品矩阵,并披露商业化进展。关键事实:

  • PMF 验证: 作为行业首个宣布完成 PMF(产品市场匹配)验证的具身物流方案,已与顺丰、中国邮政在 5 省市 10 多个物流中心实现常态运营;在部分场景运营效率已超人类,场景迁移从"过去约两个月"缩短至"一周内"。
  • PMF 标准(联合创始人席悦): 解决真实需求(雪中送炭而非锦上添花)、看复购率与批量部署、经济模型健康可跑通。
  • 产品矩阵: 全尺寸双足人形机器人星动 L7(55 高自由度、1:1 复刻全身动作,可作全身遥操作数据源);全直驱灵巧手 XHAND 1(12 主动自由度、最大抓握力 80N、可完成超 100 种操作)与 XHAND 1 PRO(21 自由度 + 18 全掌触觉、重复定位精度 ±0.1mm);人形服务机器人星动 Q5。
  • 其他: 方案获外交部发言人点赞推介;公司称全球市值前十科技企业中 9 家为其客户,自研硬件占比超 95%。

来源: 新浪财经/中国经营报 · 经济观察报/今日头条 · 极目新闻


四、arXiv 论文快筛

本周从 arXiv cs.RO/cs.AI/cs.CL/cs.LG 中筛选与 VLA、世界模型、具身智能相关的预印本(提交于 2026-08-16 至 08-20),保留 5 篇。

12. [学术前沿] τ0-VLA:世界模型引导测试时计算的分层机器人基础模型

  • arXiv: 2608.16885(cs.RO,提交于 2026-08-17;上海创新研究院、智元 Finch、香港中文大学)
  • 核心: 多数分层 VLA 对每个高层决策仅做一次前向推理,无机制为困难/关键选择分配额外算力。τ0-VLA 将高层子任务生成建模为"可扩展算力的推理问题":每步用执行记忆生成子任务,必要时在世界模型引导下搜索替代方案后再提交;低层策略跨多本体执行。
  • 数据/结果: 基于 40,115 小时异构真实数据多模态协同训练;在分布内与分布偏移设定下,分配更多测试时计算显著提升下一步子任务预测准确率,并转化为更高的长程操作闭环成功率。登 Hugging Face Daily Papers 榜首(514 upvotes)。
  • 意义: 将"先思考再提交、按难度分配算力、以世界模型为草稿纸"的 o1 范式从对话 token 移植到机器人操作规划——与同期 Coding Agent 的推理模式趋同。

13. [学术前沿] GigaBrain-0.7:三系统架构驱动的具身基础模型

  • arXiv: 2608.15875(cs.RO,提交于 2026-08-16;GigaBrain Team)
  • 核心: 以"三系统架构"统一理解、预测与动作——System 2(理解与规划)、System 3(预测与评估)、System 1(动作与控制);预训练扩展至 37,000+ 小时异构具身数据,并引入单阶段对齐训练联合优化视觉-语言理解与多本体动作生成。
  • 结果: 相较前代 GigaBrain-0 系列及 π0.5 等 SOTA,在零样本基础能力、语言条件指令跟随、训练后任务成功率上均有提升;在自研 Maker H01 平台与主流本体上展现家庭/工业场景适应性。训练代码与预训练权重将发布。

14. [学术前沿] EATR-Stereo:面向人形机器人的"身体感知"双目 VLA 路由

  • arXiv: 2608.17453v2(cs.RO,提交 08-18、v2 08-19;哈尔滨工业大学、荣耀)
  • 核心: 头戴式双目人形机器人的视觉接口需兼容预训练表示。EATR-Stereo 保留主视角 token,用跨视角注意力构造与主视角对齐的辅助 token(CVAT),并以"身体分段本体状态编码器"按机器人构型历史条件化每个辅助 token 的使用强度——冻结 VLM 主干,仅学路由。
  • 结果: 在 33 自由度、37 维本体状态的人形上,超 100 秒"搜索—接近—抓取—放置—返回"任务取得全任务成功率 60.0%、抓取 100.0%、阶段 80.0%;严重非对称遮挡下恢复成功率 80%(CVAT 基线仅 30%)。

15. [学术前沿] TGL(Teach-and-Grow):以"智能体为中心"消除 VLA 的重训练税

  • arXiv: 2608.17209(cs.RO,提交于 2026-08-17;上海交通大学 王贺升团队)
  • 核心: 端到端 VLA/世界动作模型的可靠性受限于"已验证物理覆盖";一旦遇到覆盖外的物体/传感器/本体/接触,纠正失败需新数据+策略更新+回归测试——作者称为**“重训练税”(retraining tax)**。TGL 将少量成功演示转成可复用 Skill Blocks(闭环子目标行为),新场景中组合既有/几何工具、观察物理结果、偏离意图时修订路线;Skill Library 存可执行行为,结构化 Experience Memory 承载成功/失败/修复。
  • 结果: LIBERO 评测达 SOTA;提出"Teach-and-Grow 缩放律假设"——随有效可复用经验 X 增长,未来任务误差与教学需求以幂律趋近不可约下界(该假设为提案,尚未经实证缩放研究验证)。

16. [学术前沿] Fine-Tuning VLAs with Self-Demonstrated Generative Control:用自示rollout 抑制灾难性遗忘

  • arXiv: 2608.19490(cs.RO,提交于 2026-08-19;UIUC,Saurabh Gupta、Derek Hoiem 等)
  • 核心: 将 π0.5 等 SOTA VLA 在新本体上用专家数据微调会提升目标任务、却丢失原指令遵循与行为先验(VLA 版灾难性遗忘)。方法在微调前用零样本 VLA 在新机器人上生成在线交互 rollout,作为额外训练数据,使微调后策略同时继承原任务、保持通用指令遵循、并以更高样本效率学新技能。
  • 验证: 真实 ALOHA 双臂机器人与新仿真基准 RoboTwin 上验证;对"基础模型跨本体可移植性"这一具身部署痛点给出直接可用的正则化思路。

来源: arXiv 2608.16885 · arXiv 2608.15875 · arXiv 2608.17453v2 · arXiv 2608.17209 · arXiv 2608.19490 · τ0-VLA 项目主页


五、快速扫描

以下条目为本周监测到但未展开的重要信号,供后续追踪。

# 事件 领域 来源
1 OpenAI GPT-6 发布传闻(CSDN 8/19 日报):经多源核验未见官方公告,判定为未确认谣言,未作为主选 AI Coding 公开报道/待核验
2 SpaceX 收购 Cursor 传闻(CSDN 博客):无可靠一手源,判定为编造/误传,已排除 AI Coding 公开报道/待核验
3 Gemini 3.5 Pro 仍处 “coming soon”:延续 W34 状态,官方模型页未 GA,2M 上下文与 Deep Think 均未被官方证实 AI Coding 公开报道
4 Qwen-UI-Agent 旗舰权重暂未开放:前代 MAI-UI 已开源 2B/8B(Apache 2.0),Qwen-UI-Agent 权重开放时间待官方公布 AI Coding 公开报道
5 DeepSeek Harness 仍为开发者预览:GitHub 标记 Pre-release,明确"将存在兼容性破坏性变更",生产使用需隔离工作区 AI Coding andrew.ooo
6 WRC 2026 "97% 全球占比"等口径:来自学会/媒体转述 SAG 等机构,不同机构统计口径存在差异 具身智能 公开报道/待核验
7 星动纪元物流 PMF 仍处安全辅助协议:实机评测采用每次最多 2 次人工干预协议,非完全无人介入成功率 具身智能 HumanoidIntel

六、本周观察

Agent 基础设施"转正",但价值正在向"调用层"集中

8/20 Anthropic 一举将 Computer Use、Browser Use、Skills API、Files API 移出 beta 转为 GA,是 Agent 工程从"能跑 demo"走向"能进生产"的标志性动作——多动作回合把往返次数压 20%–40%、成本降约 30%,HIPAA 合规则把医疗/保险等强监管场景的闸门打开。但同一周 OpenAI 把 GPT-5.6 Sol 降价超 20%、Stripe 以约 70–80 亿美元吞下 OpenRouter,说明"模型能力"的议价权正在向"谁能路由、谁能计费、谁能聚合"的调用层转移。当支付巨头直接持有模型网关,前沿模型的利润池不再只由训练方定义。

国产模型的竞争焦点从"参数"转向"可被调用"

GLM-5.3(8/19 开放 API、8/28 拟开源权重)与 DeepSeek-V4-Pro 在 8/21 同步接入阿里云千问平台,意味着开发者已可在单一 MaaS 入口按需切换 Qwen3.8-Max、Kimi K3、GLM-5.3、DeepSeek-V4-Pro 等主力模型。Qwen-UI-Agent 同日发布,并以 100+ 真机、150+ 应用的实采环境把 GUI Agent 从"模拟器刷分"推向"真实屏幕可执行"——中国应用的弹窗、登录过期、网络抖动等独特生态,正在反向定义 GUI Agent 的训练范式。

具身智能:资本市场与真实落地"双锚"同时落地

宇树 8/19 上市首日 +460.34%、市值 3418 亿,WRC 2026 披露 2025 年产业营收破 3000 亿、2026 上半年 +24.5%,星动纪元公布行业首个 PMF 验证的物流方案(顺丰、中国邮政 5 省市 10+ 中心常态运营)——机器人第一次有了"公开市值基准 + 可量化 ROI 场景"的双重锚定。但需冷静看待:宇树上市同日机器人概念股集体下挫(人形机器人指数跌超 7%),"第一股"的稀缺溢价与经营现实之间仍有温差;星动纪元的实机评测仍依赖每次最多 2 次人工干预的安全辅助协议。出货量领先不等于商业化健康,物流 PMF 能否从"5 省市"复制到全国、从安全辅助走向无人介入,才是下一阶段真问题。

arXiv 信号:VLA 的"推理范式"正在与 Coding Agent 收敛

本周 5 篇论文共同指向一个趋势——τ0-VLA 把"按难度分配测试时算力"的 o1 范式移植到机器人子任务规划,TGL 用可复用 Skill Blocks 消除"重训练税",EATR-Stereo 以冻结主干+路由解决双目证据融合,GigaBrain-0.7 用三系统架构统一理解/预测/动作,Fine-Tuning VLAs 用自示 rollout 抑制跨本体遗忘。“先思考再提交、按难度分配计算、用世界模型当草稿纸”——这套在 Coding Agent 中已被验证的推理模式,本季度同时出现在机械臂上。 当同一套推理范式在终端与机器人上同期出现,它不再是某个赛道的局部技巧,而是 Agent 的通用 playbook。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐