主题: 编码模型掀"性价比贴身战",具身智能开源、出海与行业洗牌三线并进
编制时间: 2026-09-11
本期看点: SWE-2 性价比冲击 宇树开源 WLA 基座模型 具身智能出海提速


一、要闻速览(Top Stories)

序号事件标签关键词
1Cognition 发布编码模型 SWE-2,距前沿仅 1 分、成本降 64%,Pro 订阅免费一个月AI CodingSWE-2、Kimi K3、FrontierCode、Pareto 前沿
2谷歌推出 Google Cloud 开发者插件,面向 AI 编码助手AI CodingGoogle Cloud、编码助手、插件生态
3Meta 发布 Muse Spark 1.3,长程 Agent 与编码任务性能提升AI CodingMuse Spark、Agentic、幻觉率下降
4DaVinci Resolve 21.1 原生接入 Claude Code 与 ChatGPT CodexAI Coding达芬奇、垂直软件 Agent 化、自动化脚本
5SWE-Bench Pro Verified 研究证实基准泄露:部分模型分数含 21.48 分"读答案"水分AI Coding基准污染、可信评测、统计检验
6宇树全开源人形基座模型 UnifoLM-WLA-1.0,单模型统筹 64 项真机任务具身智能UnifoLM、世界模型、开源 SOTA、6B 参数
7优必选斩获超 5000 万元海外订单,上半年营收同比增 104.2%具身智能优必选、Walker C1、技术出海
8速腾聚创 5987.8 万元出售具身机器人整机业务,聚焦感知与零部件具身智能速腾聚创、产业分工、战略收缩
9中国自动驾驶欧洲双响:小马智行克罗地亚全无人载客,文远知行获西班牙首个 L4 许可具身智能Robotaxi、L4、欧洲市场、Uber
10梅卡曼德 CEO 上市 9 天公开指控同行借数据采集中心与关联交易虚增收入具身智能梅卡曼德、商业伦理、行业挤水分

筛选标准:5-10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。


二、AI Coding 方向深度动态

在这里插入图片描述

1. Cognition 发布 SWE-2:用 Kimi K3 底座把"前沿性能"打到 1/3 价格

事件: 9 月 10 日,Devin 母公司 Cognition 正式发布自研编码模型 SWE-2,同步上线 Devin Desktop 与 CLI,并宣布对全部 Pro($20/月)、Max、Teams 订阅用户免费开放一个月。

核心能力 / 核心参数 / 产品细节:

  • FrontierCode 1.1 Main 得分 50.0%,距 Anthropic 前沿模型 Fable 5.1(50.9%)仅 1 分,超越 Grok 4.6 与 GPT-5.6 Sol,接近 GPT-6 Astra(53.3%)但成本仅约其 1/4;
  • 基于 Moonshot AI 的 **Kimi K3(2.8 万亿参数开源模型)**做后训练——这是 Cognition 首次把强化学习扩展到多万亿参数规模,延续"强开源底座 + 自研大规模 RL"路线;
  • 业界首次在单次 RL 训练中同时训练出 medium / high / max 三档推理力度(effort levels),一次训练把整条成本-性能 Pareto 曲线整体上推;
  • 效率数据亮眼:medium 档比上代 SWE-1.7 少 58% 交互轮次、平均省 81% 成本,首次真实代码修改的中位步数从 48 步缩短到 18 步;
  • 同期背景:Cognition 刚于 9 月 8 日完成超 20 亿美元 E 轮融资,估值 480 亿美元。

值得关注的原因:

  • "开源底座 + 大规模 RL 后训练"路线被再次验证:不从零训练基座,也能贴着前沿打,这将深刻改变中小 AI 公司的模型策略;
  • 中国开源模型(Kimi K3)成为全球头部编码产品的底座,中国开源权重正在影响全球 AI 产品的成本结构;
  • $20 档订阅免费送前沿级模型,编码助手的价格战进一步向订阅层蔓延,直接冲击 Cursor、GitHub Copilot 等竞品的定价逻辑。

2. SWE-Bench Pro Verified 研究揭基准污染:21.48 分来自"背答案"

事件: 9 月 10 日前后,Bespoke Labs 与研究者发布的 SWE-Bench Pro Verified 通过配对统计检验证实:在一个被广泛引用的编码基准中,部分模型的得分里有多达 21.48 个百分点来自读取了泄露的答案内容。

值得关注的原因:

  • 为近期"编码基准分数虚高"的质疑提供了实证,厂商自报分数的可信度需要重新审视;
  • 与 Cognition 自建 FrontierCode、The New Stack 的"agents building agents"基准(总通过率不足 25%)相互印证:评测体系本身正在成为 AI Coding 赛道的竞争维度
  • 提醒选型者:与其盯榜单,不如看模型在自己真实代码库上的表现。

3. Meta 发布 Muse Spark 1.3:Agent 行为更"懂事"了

事件: 9 月 10 日,Meta 发布 Muse Spark 1.3,重点提升长程 Agent 与编码任务表现,已上架 Muse Code 与 Meta Model API。

核心能力 / 产品细节:

  • 主动向用户提出澄清问题、在执行关键操作前确认,从"闷头执行"转向"协作式 Agent";
  • 幻觉率下降,内部对比显示工具调用减少 20%、token 消耗减少 25%。

值得关注的原因:

  • "先问再做"是 Agent 从 Demo 走向生产环境的关键行为特征,大厂开始把交互礼仪当作模型能力来训练;
  • 与 SWE-2 的"少走弯路"(中位 18 步出手)呼应:效率与精准正在取代"更长的思考链"成为编码模型的新竞赛点

4. DaVinci Resolve 21.1 原生接入 Claude Code 与 ChatGPT Codex

事件: 9 月 10 日前后,Blackmagic Design 在专业剪辑调色软件 DaVinci Resolve 21.1 中内置 Claude Code 与 ChatGPT Codex 接入,开发者可用自然语言让 Agent 编写脚本、插件与批量自动化流程。

值得关注的原因:

  • 标志性信号:编码 Agent 的主战场正从 IDE 渗透到一切可脚本化的垂直专业软件——Premiere、Resolve 这类重型创作工具开始原生拥抱 Agent;
  • 对开发者意味着新的生态位:垂类软件的 Agent 插件与脚本自动化,可能成为新的需求爆发点。

5. 谷歌推出 Google Cloud 开发者插件,补齐编码助手云上入口

事件: 据财联社 9 月 11 日电,谷歌推出面向 AI 编码助手的 Google Cloud 开发者插件。

值得关注的原因:

  • 云厂商开始把"编码助手 + 云资源操作"打包成标准插件,企业开发者在 IDE 里直接调度 GCP 资源将成为常态;
  • 与 Accenture×Google Cloud 组建千人 Gemini Enterprise 业务团同日呼应,大厂正加速把 Agentic AI 推向企业级落地

三、具身智能方向深度动态

在这里插入图片描述

6. 宇树全开源 UnifoLM-WLA-1.0:从"硬件平价"走向"模型开源"

事件: 9 月 10 日,宇树科技宣布全新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 全面升级并完全开源,代码、模型权重、数据集同步开放,项目主页已上线。

核心能力 / 核心参数:

  • 6B 参数,使用 5M+ 具身推理(ER)训练样本、约 2500 小时高质量真机采集数据
  • WLA = World-Language-Action:在同一多模态框架内整合具身推理、未来动态区域预测与离散动作学习,配合 MMDiT 动作专家模块;
  • 真机评测单模型统筹 64 项任务,覆盖桌面精细操作与全身移动操作,实现跨任务、跨末端执行器泛化(“一模驱动、全身协同”);
  • 在 7 项具身推理评测中领先全球开源模型,部分能力可对标头部闭源模型。

值得关注的原因:

  • 全球主流人形机器人公司核心模型多以闭源为主,宇树把基座模型全开源,大幅拉低高校与中小团队的准入门槛,是其"硬件平价 + 开源生态"打法在模型层的复刻;
  • 标志宇树从整机厂商向"硬件 + AI 模型"双轮驱动转型,与特斯拉 Optimus、Figure 的闭源路线形成鲜明对照;
  • 此前宇树已开源 UnifoLM-VLA-0 与 UnifoLM-WMA-0,开源体系成型后,国内具身智能的"安卓时刻"可能加速到来

7. 优必选超 5000 万元海外订单:人形机器人出海进入订单兑现期

事件: 9 月 10 日消息,优必选接连与欧洲、日韩客户签约,斩获超 5000 万元海外订单,产品包括工业人形 Walker C1 与消费级优世界 U1;其上半年营收 12.7 亿元,同比增长 104.2%。

值得关注的原因:

  • 叠加此前无界动力 K15 交付法国电池工厂、一季度中国人形机器人出口同比 +210%、上半年中国厂商占全球出货 97% 以上——出海正从展会展示转为真实订单兑现
  • 国内约 20 万元的人形机器人在海外部分市场可售 40 万甚至 80 万元,出海毛利率显著高于国内,将改写行业盈利模型。

8. 速腾聚创 5987.8 万元出售整机业务:具身智能产业链开始"分工细化"

事件: 本周披露,速腾聚创计划以 5987.8 万元出售其具身机器人整机业务,未来聚焦激光雷达等核心零部件与感知方案。

值得关注的原因:

  • 整机赛道"百团大战"阶段,有企业选择退场做"卖铲人",说明产业链分工正从"人人造整机"走向"本体/零部件/模型分层"
  • 对照同期监管拟抬高机器人企业 IPO 门槛、超 40 家排队企业的背景,具备核心技术的供应商路径可能比整机贴身肉搏更稳。

9. 中国自动驾驶欧洲双响:全无人 Robotaxi 首次落地欧洲载客

事件: 9 月 10 日前后,小马智行(Pony.ai)与 Verne 在克罗地亚萨格勒布启动欧洲首个全无人 Robotaxi 载客试点,运营 22 公里线路;同期文远知行(WeRide)与 Uber、AVOMO 拿下西班牙首个 L4 载客运营许可,其 Q2 海外 L4 收入同比增长 164%。

值得关注的原因:

  • Robotaxi 竞争重心转向海外市场:中国团队在欧洲的许可与运营节奏明显快于美国本土玩家;
  • 文远知行+Uber 的合作模式(技术方+出行平台+本地持牌方)正在成为可复制的出海模板。

10. 梅卡曼德 CEO 公开指控同行数据造假:行业进入"挤水分"时刻

事件: 9 月 10 日前后,工业机器人与 3D 视觉公司梅卡曼德(Mech-Mind)CEO 邵天兰在上市 9 天后公开指控部分同行企业借"数据采集中心"和关联交易虚增收入,并在评论区点名具身智能公司 Galbot。

值得关注的原因:

  • 新股上市即"开炮"极为罕见,直指具身智能行业商业化数据的水分问题;
  • 与证监会 IPO 窗口指导(要求证明持续收入、减亏或真技术创新)、宇树股价较峰值蒸发超 2400 亿元相互印证:具身智能正从资本狂热期进入证伪与洗牌期,真实场景收入将是下一阶段的分水岭。

四、产业趋势总结

  1. 编码模型进入"性价比 Pareto 前沿"竞争:SWE-2 用 1/3 价格贴住前沿性能,effort levels、更少轮次成为新指标,“更聪明"让位于"更划算”。
  2. 中国开源模型成为全球 AI 产品底座:Cognition 基于 Kimi K3、OpenCode 订阅接入 DeepSeek Flash v4.1,中国开源权重正在为全球编码工具降本。
  3. Agent 从 IDE 渗透到一切软件:达芬奇接入编码 Agent、Lovable 进驻 Slack,凡是可脚本化的软件都在成为 Agent 的宿主。
  4. 具身智能从"秀肌肉"转向"作业模式":经济日报发文强调防"重展示轻应用",工信部实景实训专项推动人形机器人批量进厂,落地质量取代参数演示。
  5. 出海成为具身智能第二增长曲线:优必选订单、无界动力交付法国、Robotaxi 欧洲载客,海外溢价与真实订单正在兑现商业价值。
  6. 行业挤水分与洗牌并行:IPO 门槛抬高、速腾退出整机、梅卡曼德公开指控造假,资本从追逐故事转向验证收入。

五、值得持续关注的信号

  • DeepSeek V4.1-Flash 全量路由:9 月 14 日起所有 Pro 档请求将自动路由至 Flash 并按 Flash 计价,等于"一刀切降价",届时观察 API 生态与竞品定价的连锁反应;
  • Cognition SWE-2 免费期(至 10 月上旬)结束后的定价策略,以及 Cursor、Copilot 是否跟进 $20 档放行前沿模型;
  • 证监会机器人 IPO 窗口指导对超 40 家排队企业的实际影响,宇树市值(上市峰值蒸发超 2400 亿元)能否企稳;
  • 宇树 UnifoLM-WLA-1.0 开源生态:基于该基座模型的二次开发、微调项目数量,是判断"具身安卓时刻"成色的先行指标;
  • 梅卡曼德指控事件后续:是否引发监管问询或行业自查,数据造假争议将如何改变具身智能公司的披露口径。

本日报基于公开报道整理,仅供参考。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐