AI 新闻日报 2026-09-11:SWE-2 逼近前沿、宇树开源具身基座、中国自动驾驶欧洲载客
主题: 编码模型掀"性价比贴身战",具身智能开源、出海与行业洗牌三线并进
编制时间: 2026-09-11
本期看点: SWE-2 性价比冲击 宇树开源 WLA 基座模型 具身智能出海提速
一、要闻速览(Top Stories)
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | Cognition 发布编码模型 SWE-2,距前沿仅 1 分、成本降 64%,Pro 订阅免费一个月 | AI Coding | SWE-2、Kimi K3、FrontierCode、Pareto 前沿 |
| 2 | 谷歌推出 Google Cloud 开发者插件,面向 AI 编码助手 | AI Coding | Google Cloud、编码助手、插件生态 |
| 3 | Meta 发布 Muse Spark 1.3,长程 Agent 与编码任务性能提升 | AI Coding | Muse Spark、Agentic、幻觉率下降 |
| 4 | DaVinci Resolve 21.1 原生接入 Claude Code 与 ChatGPT Codex | AI Coding | 达芬奇、垂直软件 Agent 化、自动化脚本 |
| 5 | SWE-Bench Pro Verified 研究证实基准泄露:部分模型分数含 21.48 分"读答案"水分 | AI Coding | 基准污染、可信评测、统计检验 |
| 6 | 宇树全开源人形基座模型 UnifoLM-WLA-1.0,单模型统筹 64 项真机任务 | 具身智能 | UnifoLM、世界模型、开源 SOTA、6B 参数 |
| 7 | 优必选斩获超 5000 万元海外订单,上半年营收同比增 104.2% | 具身智能 | 优必选、Walker C1、技术出海 |
| 8 | 速腾聚创 5987.8 万元出售具身机器人整机业务,聚焦感知与零部件 | 具身智能 | 速腾聚创、产业分工、战略收缩 |
| 9 | 中国自动驾驶欧洲双响:小马智行克罗地亚全无人载客,文远知行获西班牙首个 L4 许可 | 具身智能 | Robotaxi、L4、欧洲市场、Uber |
| 10 | 梅卡曼德 CEO 上市 9 天公开指控同行借数据采集中心与关联交易虚增收入 | 具身智能 | 梅卡曼德、商业伦理、行业挤水分 |
筛选标准:5-10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。
二、AI Coding 方向深度动态

1. Cognition 发布 SWE-2:用 Kimi K3 底座把"前沿性能"打到 1/3 价格
事件: 9 月 10 日,Devin 母公司 Cognition 正式发布自研编码模型 SWE-2,同步上线 Devin Desktop 与 CLI,并宣布对全部 Pro($20/月)、Max、Teams 订阅用户免费开放一个月。
核心能力 / 核心参数 / 产品细节:
- FrontierCode 1.1 Main 得分 50.0%,距 Anthropic 前沿模型 Fable 5.1(50.9%)仅 1 分,超越 Grok 4.6 与 GPT-5.6 Sol,接近 GPT-6 Astra(53.3%)但成本仅约其 1/4;
- 基于 Moonshot AI 的 **Kimi K3(2.8 万亿参数开源模型)**做后训练——这是 Cognition 首次把强化学习扩展到多万亿参数规模,延续"强开源底座 + 自研大规模 RL"路线;
- 业界首次在单次 RL 训练中同时训练出 medium / high / max 三档推理力度(effort levels),一次训练把整条成本-性能 Pareto 曲线整体上推;
- 效率数据亮眼:medium 档比上代 SWE-1.7 少 58% 交互轮次、平均省 81% 成本,首次真实代码修改的中位步数从 48 步缩短到 18 步;
- 同期背景:Cognition 刚于 9 月 8 日完成超 20 亿美元 E 轮融资,估值 480 亿美元。
值得关注的原因:
- "开源底座 + 大规模 RL 后训练"路线被再次验证:不从零训练基座,也能贴着前沿打,这将深刻改变中小 AI 公司的模型策略;
- 中国开源模型(Kimi K3)成为全球头部编码产品的底座,中国开源权重正在影响全球 AI 产品的成本结构;
- $20 档订阅免费送前沿级模型,编码助手的价格战进一步向订阅层蔓延,直接冲击 Cursor、GitHub Copilot 等竞品的定价逻辑。
2. SWE-Bench Pro Verified 研究揭基准污染:21.48 分来自"背答案"
事件: 9 月 10 日前后,Bespoke Labs 与研究者发布的 SWE-Bench Pro Verified 通过配对统计检验证实:在一个被广泛引用的编码基准中,部分模型的得分里有多达 21.48 个百分点来自读取了泄露的答案内容。
值得关注的原因:
- 为近期"编码基准分数虚高"的质疑提供了实证,厂商自报分数的可信度需要重新审视;
- 与 Cognition 自建 FrontierCode、The New Stack 的"agents building agents"基准(总通过率不足 25%)相互印证:评测体系本身正在成为 AI Coding 赛道的竞争维度;
- 提醒选型者:与其盯榜单,不如看模型在自己真实代码库上的表现。
3. Meta 发布 Muse Spark 1.3:Agent 行为更"懂事"了
事件: 9 月 10 日,Meta 发布 Muse Spark 1.3,重点提升长程 Agent 与编码任务表现,已上架 Muse Code 与 Meta Model API。
核心能力 / 产品细节:
- 会主动向用户提出澄清问题、在执行关键操作前确认,从"闷头执行"转向"协作式 Agent";
- 幻觉率下降,内部对比显示工具调用减少 20%、token 消耗减少 25%。
值得关注的原因:
- "先问再做"是 Agent 从 Demo 走向生产环境的关键行为特征,大厂开始把交互礼仪当作模型能力来训练;
- 与 SWE-2 的"少走弯路"(中位 18 步出手)呼应:效率与精准正在取代"更长的思考链"成为编码模型的新竞赛点。
4. DaVinci Resolve 21.1 原生接入 Claude Code 与 ChatGPT Codex
事件: 9 月 10 日前后,Blackmagic Design 在专业剪辑调色软件 DaVinci Resolve 21.1 中内置 Claude Code 与 ChatGPT Codex 接入,开发者可用自然语言让 Agent 编写脚本、插件与批量自动化流程。
值得关注的原因:
- 标志性信号:编码 Agent 的主战场正从 IDE 渗透到一切可脚本化的垂直专业软件——Premiere、Resolve 这类重型创作工具开始原生拥抱 Agent;
- 对开发者意味着新的生态位:垂类软件的 Agent 插件与脚本自动化,可能成为新的需求爆发点。
5. 谷歌推出 Google Cloud 开发者插件,补齐编码助手云上入口
事件: 据财联社 9 月 11 日电,谷歌推出面向 AI 编码助手的 Google Cloud 开发者插件。
值得关注的原因:
- 云厂商开始把"编码助手 + 云资源操作"打包成标准插件,企业开发者在 IDE 里直接调度 GCP 资源将成为常态;
- 与 Accenture×Google Cloud 组建千人 Gemini Enterprise 业务团同日呼应,大厂正加速把 Agentic AI 推向企业级落地。
三、具身智能方向深度动态

6. 宇树全开源 UnifoLM-WLA-1.0:从"硬件平价"走向"模型开源"
事件: 9 月 10 日,宇树科技宣布全新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 全面升级并完全开源,代码、模型权重、数据集同步开放,项目主页已上线。
核心能力 / 核心参数:
- 6B 参数,使用 5M+ 具身推理(ER)训练样本、约 2500 小时高质量真机采集数据;
- WLA = World-Language-Action:在同一多模态框架内整合具身推理、未来动态区域预测与离散动作学习,配合 MMDiT 动作专家模块;
- 真机评测单模型统筹 64 项任务,覆盖桌面精细操作与全身移动操作,实现跨任务、跨末端执行器泛化(“一模驱动、全身协同”);
- 在 7 项具身推理评测中领先全球开源模型,部分能力可对标头部闭源模型。
值得关注的原因:
- 全球主流人形机器人公司核心模型多以闭源为主,宇树把基座模型全开源,大幅拉低高校与中小团队的准入门槛,是其"硬件平价 + 开源生态"打法在模型层的复刻;
- 标志宇树从整机厂商向"硬件 + AI 模型"双轮驱动转型,与特斯拉 Optimus、Figure 的闭源路线形成鲜明对照;
- 此前宇树已开源 UnifoLM-VLA-0 与 UnifoLM-WMA-0,开源体系成型后,国内具身智能的"安卓时刻"可能加速到来。
7. 优必选超 5000 万元海外订单:人形机器人出海进入订单兑现期
事件: 9 月 10 日消息,优必选接连与欧洲、日韩客户签约,斩获超 5000 万元海外订单,产品包括工业人形 Walker C1 与消费级优世界 U1;其上半年营收 12.7 亿元,同比增长 104.2%。
值得关注的原因:
- 叠加此前无界动力 K15 交付法国电池工厂、一季度中国人形机器人出口同比 +210%、上半年中国厂商占全球出货 97% 以上——出海正从展会展示转为真实订单兑现;
- 国内约 20 万元的人形机器人在海外部分市场可售 40 万甚至 80 万元,出海毛利率显著高于国内,将改写行业盈利模型。
8. 速腾聚创 5987.8 万元出售整机业务:具身智能产业链开始"分工细化"
事件: 本周披露,速腾聚创计划以 5987.8 万元出售其具身机器人整机业务,未来聚焦激光雷达等核心零部件与感知方案。
值得关注的原因:
- 整机赛道"百团大战"阶段,有企业选择退场做"卖铲人",说明产业链分工正从"人人造整机"走向"本体/零部件/模型分层";
- 对照同期监管拟抬高机器人企业 IPO 门槛、超 40 家排队企业的背景,具备核心技术的供应商路径可能比整机贴身肉搏更稳。
9. 中国自动驾驶欧洲双响:全无人 Robotaxi 首次落地欧洲载客
事件: 9 月 10 日前后,小马智行(Pony.ai)与 Verne 在克罗地亚萨格勒布启动欧洲首个全无人 Robotaxi 载客试点,运营 22 公里线路;同期文远知行(WeRide)与 Uber、AVOMO 拿下西班牙首个 L4 载客运营许可,其 Q2 海外 L4 收入同比增长 164%。
值得关注的原因:
- Robotaxi 竞争重心转向海外市场:中国团队在欧洲的许可与运营节奏明显快于美国本土玩家;
- 文远知行+Uber 的合作模式(技术方+出行平台+本地持牌方)正在成为可复制的出海模板。
10. 梅卡曼德 CEO 公开指控同行数据造假:行业进入"挤水分"时刻
事件: 9 月 10 日前后,工业机器人与 3D 视觉公司梅卡曼德(Mech-Mind)CEO 邵天兰在上市 9 天后公开指控部分同行企业借"数据采集中心"和关联交易虚增收入,并在评论区点名具身智能公司 Galbot。
值得关注的原因:
- 新股上市即"开炮"极为罕见,直指具身智能行业商业化数据的水分问题;
- 与证监会 IPO 窗口指导(要求证明持续收入、减亏或真技术创新)、宇树股价较峰值蒸发超 2400 亿元相互印证:具身智能正从资本狂热期进入证伪与洗牌期,真实场景收入将是下一阶段的分水岭。
四、产业趋势总结
- 编码模型进入"性价比 Pareto 前沿"竞争:SWE-2 用 1/3 价格贴住前沿性能,effort levels、更少轮次成为新指标,“更聪明"让位于"更划算”。
- 中国开源模型成为全球 AI 产品底座:Cognition 基于 Kimi K3、OpenCode 订阅接入 DeepSeek Flash v4.1,中国开源权重正在为全球编码工具降本。
- Agent 从 IDE 渗透到一切软件:达芬奇接入编码 Agent、Lovable 进驻 Slack,凡是可脚本化的软件都在成为 Agent 的宿主。
- 具身智能从"秀肌肉"转向"作业模式":经济日报发文强调防"重展示轻应用",工信部实景实训专项推动人形机器人批量进厂,落地质量取代参数演示。
- 出海成为具身智能第二增长曲线:优必选订单、无界动力交付法国、Robotaxi 欧洲载客,海外溢价与真实订单正在兑现商业价值。
- 行业挤水分与洗牌并行:IPO 门槛抬高、速腾退出整机、梅卡曼德公开指控造假,资本从追逐故事转向验证收入。
五、值得持续关注的信号
- DeepSeek V4.1-Flash 全量路由:9 月 14 日起所有 Pro 档请求将自动路由至 Flash 并按 Flash 计价,等于"一刀切降价",届时观察 API 生态与竞品定价的连锁反应;
- Cognition SWE-2 免费期(至 10 月上旬)结束后的定价策略,以及 Cursor、Copilot 是否跟进 $20 档放行前沿模型;
- 证监会机器人 IPO 窗口指导对超 40 家排队企业的实际影响,宇树市值(上市峰值蒸发超 2400 亿元)能否企稳;
- 宇树 UnifoLM-WLA-1.0 开源生态:基于该基座模型的二次开发、微调项目数量,是判断"具身安卓时刻"成色的先行指标;
- 梅卡曼德指控事件后续:是否引发监管问询或行业自查,数据造假争议将如何改变具身智能公司的披露口径。
本日报基于公开报道整理,仅供参考。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)