ai-news-2026-08-25
AI 每日简报 · 2026-08-25
主题:AI coding × 具身智能 | 按"当天新增或当天显著发酵"筛选 5 条主新闻 + 若干补充观察
收集时间:北京时间 09:09 | 上一份简报:2026-08-24
主新闻 · 5 条
① 微软 Agent Lightning v1.0 / v1.0.1 正式发布——零代码改造让 Agent 在自己的 Harness 里做强化学习
事件:8 月 24-25 日,微软研究院(Microsoft Research Asia–Shanghai)正式发布并开源 Agent Lightning v1.0,次日即推出 v1.0.1。框架核心范式被命名为"harnessed agentic RL"——通过 LLM endpoint 代理,让现有 Agent(LangChain / OpenAI Agents SDK / AutoGen / CrewAI 等)在完全不修改工具、上下文、控制流与环境的前提下,直接在生产 Harness 上做强化学习训练。
值得关注:
- 战绩真实可验证:仅 6000 条训练样本,Qwen3.5-9B 编程工作流在 SWE-bench Verified 上从 41.8% 跃升至 56.4%,绝对涨幅 +14.6 pp;核心 Python 代码仅约 3500 行。
- v1.0.1 推出 Agent Lightning Skill:让 Claude Code、Codex、GitHub Copilot 能"系统性优化其他 AI Agent 的提示词、工具与工作流"——Coding Agent 开始具备"调优 Agent"的能力。
- 首次工程化承认"Harness 与模型共享 token 边界":文档显式说明 decode-then-retokenize 的有损性,并给出"best-effort merging"修复方案;同步在训练时禁用 .git 目录 + 屏蔽通用出网,正面承认 RL 训练中的 reward hacking 风险与对策。
- 原生支持 Kubernetes Job 方式运行 Agent:把"训练可重现"和"部署可重现"对齐,对企业 Agent 工业化是关键一步。
来源:Microsoft Agent Lightning v1.0.1 GitHub Release、Hacker News 技术长文(74 分)、The Next Gen Tech Insider、The Agent Times、World Programming("harness vs model"专文)、博客园 AI 技术日报 8-25。
② OpenAI GPT-5.6 Sol API 降价超 20%——中美前沿模型进入"按价值定价"的基建商品化阶段
事件:8 月 21 日 OpenAI 宣布未来三个月内将其旗舰模型 GPT-5.6 Sol 的 API 与 Credit 价格下调超 20%:输入 5 → 4 美元/百万 Token(-20%)、输出 30 → 20 美元/百万 Token(-33%)、缓存输入 0.5 → 0.4 美元、长上下文输出 45 → 30 美元。同时谷歌 Gemini 3.7 Flash 在 OpenRouter 上降价约 75%;Anthropic 取消原定涨价计划并将首发优惠永久化(Claude Sonnet 5 永久价 $2 / $10)。
值得关注:
- 价格倒挂:GPT-5.6 Sol($4 / $20)已低于 Anthropic Opus 5($5 / $25)和 Fable 5($10 / $50)——“前沿旗舰首次比中端模型便宜”。
- 不是孤立事件,而是"价格逐底战"开启:Terra 降 20%、Luna 降 80%、Sol 降 20%;一个半月内 OpenAI 同一系列连降三档,《福布斯》与"企业 DNA"研报均称"前沿模型正像普通大宗商品一样进入基建竞赛"。
- 企业支出实证已先于降价:Ramp 数据显示 Anthropic Fable 5 仅占企业 token 支出 6%,而 OpenAI GPT-5.6 Sol 占 25%——企业已主动用"够用就好"的小模型,迫使前沿模型通过降价争夺份额。
- 对国内影响:中信建投同日研报指出"降价将拉动 Agent / 代码生成等高 Token 场景使用量增长";阿里最新季度 AI Cloud and Compute Services 收入约 484 亿元 +45%,连续 12 个季度三位数增长,"正向循环"已成型。
来源:OpenAI 官方定价页、The Hindu、The Deep View、环球时报 8-25"美国 AI 大模型接连降价、价格战担忧抬头"、中信建投 8-25 研报、东方财富 / 21 财经 8-25 转载、今日头条 AI 新闻日报 8-25。
③ Anthropic 开放 Claude 社区插件市场 + VoltAgent 千 Skill 库成型——AI 编程进入"插件生态平台"竞争
事件:8 月 24-25 日,Anthropic 正式在 GitHub 开放社区插件市场 anthropics/claude-plugins-community(900+ Star,仓库为只读镜像,提交需经 clau.de/plugin-directory-submission 内部安全审核),与官方市场形成"官方 + 社区"双轨插件体系。同步,VoltAgent 整理出超过 1000 个 Agent Skills,兼容 Claude Code / Codex / Gemini CLI / Cursor。
值得关注:
- 插件 ≠ Skill ≠ Connector 三个层级首次被官方厘清:Skill 是"教 Claude 你的流程",Connector 是"连外部 App",Plugin 是"把 MCP + Skill + Slash Command + Agent 打包一次安装"——AI 编程工具从"单兵能力"切到"开箱即用工作流"分发。
- 生态门槛首次量化:仓库中 .claude-plugin/marketplace.json 由 Anthropic 内部审核管线每日夜间同步,自动化安全扫描 + 分发批准。"插件市场"已变成标准基建动作(与 VS Code / JetBrains 早期插件生态对标)。
- 个人开发者被赋能到极致:出现"非开发者用 Claude Code + Opus 5 自建浏览器矢量设计 App"、“业余 GM 跑 1st→5th 版规则转换(含 Foundry JSON)”、"iOS 无障碍游戏工具 TrackBridge(Swift + ARKit + UDP)"等案例——AI 编程的"长尾扩展"全面打开。
- 非编程延伸:TrackBridge、Sedona Sunset(纯代码生成的可探索 3D 浏览器场景)、Obsidian 3D Galaxy 插件——Claude Code 已不只是"代码工具",而是"个人软件工厂"。
来源:Anthropic 官方 anthropics/claude-plugins-community GitHub 仓库、Anthropic skills 仓库、AGI Hunt Daily 8-24、Just Being Resourceful 8-24 教程、dev.to kasir-barati 解读(plugins 与 skills 与 MCP 关系)、博客园 AI 技术日报 8-24、Dev Breakfast 8-25。
④ 第二届世界人形机器人运动会全自主开赛,天工 Ultra 三破人类田径世界纪录
事件:8 月 22-26 日,第二届世界人形机器人运动会在北京国家速滑馆"冰丝带"举行,16 国 666 队 2056 台机器人参赛(+138% / +2 倍),围绕 51 个赛项竞技。除 100 米 / 400 米障碍外,所有径赛及其他竞技赛项均须全自主完成,实现"全自主、零遥控"。北京人形机器人创新中心的天工 Ultra 在 22 日晚百米预赛跑出 9.39 秒(超博尔特 9.58 秒人类世界纪录),随后 400 米 39.70 秒再次破人类纪录;原地跳高 2.8843 米(超人类男子双足立定跳高 2.45 米,较去年冠军 95.641 厘米跨越式飞跃)。央视新闻 8 月 25 日预告今日下午将举行原地跳高决赛。
值得关注:
- "全自主"门槛跨越式升级:去年大部分机器人靠工程师远程控制,今年只剩两项带遥控——意味着机器人必须自己判断地面摩擦力、调整步幅、维持动态平衡。"大脑给指令,小脑对每一块肌肉瞬时调节"是浙江大学熊蓉教授总结的关键进步。
- 成绩一年三阶跳:百米从 21.50 秒 → 9.39 秒,跳高从 95.6 cm → 2.88 米——关节功率密度、本体轻量化、动态平衡、全身控制和高速运动能力的集中爆发,背后是散热、构型、电机峰值功率的多线优化(天工 Ultra 膝关节峰值功率 18.3 kW/kg,踝关节响应延迟 12 毫秒)。
- "自主决策能力"已成新考核维度:网球 / 乒乓球 / 足球混双对抗中,机器人需实时感知对手与球的位置、预测下一时刻状态、全身协调——从"运动控制"开始切到"智能化"。
- 国际媒体集中关注:阿联酋《阿联酋之声》、巴基斯坦《每日独立报》、澳大利亚媒体(“机器人奥运会考验自主性”)、西班牙 Atalayar 均把天工 Ultra 与中国人形机器人推到头版——中国具身赛道首次获得"全球科技体育"级的关注流量。
来源:央视新闻 8-25、网易/环球时报 8-25"超越博尔特"专题、中国经济网 8-25、人民日报海外版 8-25 第 10 版、中国网 8-25"全球媒体聚焦中国机器人"、21 世纪经济报道 8-25 评论"期待机器人从赛场跑进市场"。
⑤ 上半年中国人形机器人出货 4 万台占全球 97%,但产业链散热 / 可靠性仍卡在"千小时级"
事件:8 月 25 日《人民日报》海外版报道,由中国人形机器人与具身智能百人会编纂的《2026 年人形机器人产业发展报告》发布:2026 年上半年中国人形机器人出货量已超 4 万台,全球占比进一步提升至 97%;技术进入"集群涌现"新阶段。同日,证券日报 / 中国经济网走访第二届世界人形机器人运动会产业链发现:散热瓶颈仍突出(仅靠自然风冷、客户需自行加装风扇)、无界动力创始人张玉峰披露 MTBF 平均故障间隔时间仅千小时级(传统工业机械臂可达万小时级)、南宁宇立仪器称六维力传感器交付从 6 周被压至 2 周。
值得关注:
- 97% 占比背后的产业脆弱性:兆易创新面向机器人的 MCU 产品 95%+ 已支持功能安全,但"长程任务可靠性"仍是核心瓶颈——墨奇智能 CTO 黄青虬指出"长程任务每个环节的可靠性都要达到极高水平"。
- 量产爬坡与质量门槛的矛盾:电池、电流调校已升级,但散热、MTBF、传感器交付周期同时承压——上游供应商"希望主机厂多给一些耐心",与下游"低成本 / 小型化 / 高可靠"三重要求形成强张力。
- 从赛场到工厂的"安全可靠必选项":李宝魁指出"功能安全关乎人机共存的底线",异常时机器人必须静止而非冲撞;信息安全需硬件级加密与安全启动防范远程劫持——功能安全从加分项变成前置条件。
- 天工 Ultra 的"星穹-3"多模态运动决策架构被全场复用:北青网披露统一搭载北京人形机器人创新中心"星穹-3"架构,膝关节峰值功率 18.3 kW/kg、踝关节响应延迟 12 毫秒——是"中国速度"背后真正的硬件 / 软件共性底座。
来源:人民日报海外版 8-25 第 10 版、证券日报 8-25、中国经济网 8-25"产业链协同托举机器人赛场高光时刻"、21 世纪经济报道 8-25 评论、阿联酋《阿联酋之声》8-23、巴基斯坦《每日独立报》8-23、Counterpoint Research 8-24 H1 全球人形机器人出货数据。
补充观察 · 4 条
⑥ 智谱 GLM-5.3 API 阿里千问平台正式上线,权重 8-28 “负责任开源”
- 阿里千问平台同步上线 GLM-5.3 与 DeepSeek-V4-Pro;Artificial Analysis Intelligence Index 60 分与 Claude Fable 5、GPT-5.6 Sol 同档,与 Kimi K3 并列开源第一梯队。
- CyberGym 84.5% 居首,超越 Anthropic Mythos 5 83.8% 与 GPT-5.6 Sol 83.6%;在 269 个真实项目中识别 2436 个漏洞,含 1097 个中高危。
- 8-20 上《光明日报》头版"北京自研大模型网络安全能力升级";同步启动"开源的盾"对重点开源项目免费安全审计。
- 来源:今日头条 AI 新闻日报 8-25、光明日报 8-20、智谱官方 8-19、东方财富 / 智通财经 / 证券时报 8-19-20。
⑦ vLLM CVE-2025-9141 任意代码执行:恶意 LLM 可利用推理引擎漏洞夺取宿主机控制权
- 一篇 Hacker News 74 分技术长文提出新攻击面:LLM 响应在另一台 GPU 机器计算时,若推理引擎(vLLM / SGLang)解析存在漏洞,恶意模型可输出"语义无关但构成攻击载荷"的 token 序列让引擎误当代码执行。
- 真实案例:vLLM 在 Qwen3 Coder 的 XML 工具解析器中把几乎所有工具调用参数传给
eval()(CVE-2025-9141),Gemini 自动化分析当时已将该 PR 标记为严重漏洞,主维护者仍强制合入。 - 引擎层面 vLLM 支持 200+ 模型架构 + 约 35 个 Jinja 聊天模板,解析复杂度天然制造代码执行机会;多模态输出解码器进一步扩大攻击面——Agent 供应链安全已成新战场。
- 来源:博客园 AI 技术日报 8-25、Hacker News 原文(zX41ZdbW)。
⑧ 大淘宝技术:AI Coding 从 Spec 驱动转向"环境与验证驱动",1 小时改码 3 周上线
- 大淘宝技术团队提出,AI 生成的代码质量不仅取决于 Spec(规格)描述,更依赖运行环境的反馈与验证机制;一个内部案例:AI 完成代码修改仅用 1 小时,但上线耗时 3 周——环境搭建、验证测试与集成部署是真正的成本。
- Steve Yegge 同步提出:当 Agent 数量增多,应引入可执行的治理系统,用"围栏"管理 50-60 个 Agent 的协作与边界;吴恩达详解 AI 工程所需的六类核心能力。
- 与今日头条条 Agent Lightning 形成完美对照——改得快 ≠ 上得快,部署时反馈已成 Agent 工程化的下一道窄门。
- 来源:网易号"Ping 值焦虑"8-25 08:48。
⑨ 推理引擎把 Harness 写入训练回路——模型 / Harness 边界开始共享 token 层
- World Programming 8-24 长文指出,Agent Lightning v1.0 把"Harness 写入训练回路"是从未真正触及的领域——harness 决定模型能看到的输入,trainer 通过 LLM endpoint 代理看到的是 harness 重渲染后的请求。
- 工程承认:decode-then-retokenize 有损,harness 解析与修复会改变 token ID;微软用 best-effort merging 修复——意味着"通过某 harness 渲染训练的模型,会被调谐到该 harness 的渲染方式"。
- 防 reward hacking 的工程措施(禁用 .git / 屏蔽通用出网)与 Dipankar Sarkar 提出的"独立信任域执行测试"是同一控制的两侧——测试是 agent 不能接触的 artifact 网关。
- 来源:World Programming 8-24 “The Model Scored 30%. The Harness Scored 100%. Which One Did You Benchmark?”、The Next Gen Tech Insider 8-24、The Agent Times 4-11 历史背景。
一句话总结
8-25 是"价格战 + 训练工业化 + 插件生态 + 全自主比赛 + 量产可靠性"五线交汇:GPT-5.6 Sol 降价 33% 与 Anthropic / Gemini 联动把前沿模型彻底推入"商品化基建",Agent Lightning v1.0.1 把 Coding Agent 推上"调优 Agent"的新位次;Claude 开放社区插件市场 + 千 Skill 库让 AI 编程正式进入"插件生态平台"竞争;世界人形机器人运动会首次实现全自主比赛,天工 Ultra 三破人类世界纪录;而人民日报披露 97% 全球占比背后的千小时级 MTBF 与散热瓶颈,又把"全自主赛场"与"工厂服役"之间的产业耐心问题再次摆上桌面。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)