AI 新闻日报 2026-10-11:12B 开源编码模型翻身、运行时层整合、机器人长程连续作业
主题: 编码这一侧的热度从「更大的模型」转向「更便宜、更可控的运行时」,小模型靠后训练翻身、运行时层开始整合;具身这一侧,机器人从展台走进门店、景区与家务现场,长链条连续作业成了新的验收标准。
编制时间: 2026-10-11
本期看点: 12B 开源编码模型 / 运行时整合 / 世界动作模型 / 机器人长程连续作业
一、要闻速览(Top Stories)
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | JetBrains 开源 Mellum2.1:架构不变,靠后训练把 SWE-bench 从 2% 推到 47% | AI Coding | 12B MoE / RL 后训练 / 每 token 2.5B 激活 / 可自托管 |
| 2 | Cloudflare 收购 Deno:Deno Deploy 半年后关停,团队并入 workerd | AI Coding | celld / 自托管运行时 / 两个月倒计时 / 生态整合 |
| 3 | 星动纪元 VPP2 登顶 RoboDojo 并开源,压过 GPT-6 Astra 与 π0.5 | 具身智能 | 世界动作模型 / 32.26% 成功率 / 分阶段训练 / ALOHA 58.5% |
| 4 | 德塔智能发布原生人形基础模型 Delta-0:210 秒规划 32 步、连做 9 项家务 | 具身智能 | 大脑-小脑-力位 / 全身动作目标 / 真实仿真真机 / 长任务链 |
| 5 | 西湖机器人 WR1 演示全身协同自主叠衣并完成亿元级 A 轮 | 具身智能 | 大小脑双预训练 / 通用动作大模型 GAE / 双机协同 / 柔性衣物 |
| 6 | 高德「途途」进驻澳门金沙度假区,成为 001 号机器狗导览员 | 具身智能 | 开放环境全自主 / 11 小时 214 次指引 / 文旅场景 / 多机协同 |
| 7 | 光轮智能完成 10 亿元战略融资,物理 AI 数据基建成资本焦点 | 具身智能 | 物理 AI 数据 / 仿真评测 / 数据复售 / 具身独角兽 |
| 8 | 广东定下 2028 年人形机器人产量突破 8 万台的目标 | 具身智能 | 1000 家智能工厂 / AI 普及率 50% / 具身产业高地 / 政策牵引 |
| 9 | Claude Code 2.1.296:子代理可先于主会话自动压缩上下文 | AI Coding | autoCompactWindow / allow_large / 工作流单模型 / 权限修复 |
| 10 | 中国 AI 编码模型月度看点:Qwen-Image-2.1-Turbo 与端侧范式持续热 | AI Coding | 8 步生成 / 端侧代理 / 开源生态 / 工程提速 |
筛选标准:5-10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。
二、AI Coding 与智能体工程

1. JetBrains 开源 Mellum2.1:架构一行没改,分数却跳了一个量级
事件: 10 月 8 日,JetBrains 在其 AI 博客公布 Mellum2.1 与 Mellum2.1 Thinking,模型卡同日上线 Hugging Face,延续 6 月开源的 Mellum2 的 12B 混合专家架构,总参数 12B、每 token 激活约 2.5B,许可证仍是 Apache 2.0,可商用。10 月 10 日起,海外科技媒体与开发者社区集中解读这次「同架构、不同训练」的发布。
核心能力 / 核心参数:
- 唯一的大改动在后训练:JetBrains 把强化学习从训练末尾的一小段,提到了训练主体,并为此搭了内部 RL 环境,训练期间启动数百万个沙箱、覆盖数千种环境。
- 官方口径的分数变化:SWE-bench Verified 从 Mellum2 的 2.0% 升到 47.0%,Terminal-Bench 2.1 从 0.6% 升到 17.4%,LiveCodeBench v6 达 82.0%,HumanEval+ 达 91.5%,AIME 25/26 数学达 83.3%。
- 架构细节:28 层、hidden size 2304、64 个专家每 token 激活 8 个、Q 32 头 / KV 4 头(GQA)、词表 98304、上下文 131072、bfloat16 精度,每 4 层里有 3 层用 1024 滑动窗口。
- 速度侧:单请求靠多 token 预测(MTP)约快 1.6 倍;官方称高负载下吞吐接近 Qwen3.5-9B 的两倍。权重已在 Hugging Face,vLLM 今天就能跑,GGUF(llama.cpp / Ollama / LM Studio)与 vLLM 的 MTP 组件均在「稍后发布」清单里。
值得关注的原因:
- 这次发布真正说明的问题是:专用小模型的能力增量,正在从预训练转到真实环境后训练。算力储备不及前沿实验室的厂商,正好能在这个环节发力。
- 数据也很直白。JetBrains 说公开 RL 数据常见毛病是测试用例本身坏的、答案无法验证、题目太简单或根本做不出来,所以每个来源进训练前都要筛一遍。
- 但要看清边界。同一批评测里,阿里 Qwen3.5-9B 的 SWE-bench Verified 是 50.0、SWE-bench Pro 是 38.0、Terminal-Bench 2.1 是 21.7,都高于 Mellum2.1;Mellum2.1 赢的是编程题和工具调用,以及高负载吞吐。分数全部来自厂商自评,JetBrains 未公开原始提示、种子与服务配置,图表里的数字只存在于图里,也没有随发布附上独立评测。
- 对团队来说更实用的一条是部署形态:模型可以在自有 GPU 上常驻,代码一行不出内网,这对金融、医疗、政务这类卡在数据主权上的团队,是可以真正落地的那一类选项。
2. Cloudflare 收购 Deno:Deno Deploy 进入半年倒计时,运行时层完成一次整合
事件: 10 月 9 日,Cloudflare 宣布收购 Deno,整个 Deno 团队加入 Cloudflare,由 Node.js 创造者 Ryan Dahl 与联合创始人 Bert Belder 牵头,把 celld 并入 Cloudflare 的开源 Workers 运行时 workerd。消息由 The New Stack 首发,随后云厂商博客与 Deno 官网同步确认。
要点:
- 时间表很硬:Deno Deploy 半年后关停,付费用户获迁移支持转到 Cloudflare Workers;Deno 独立运行时只保留一年月度维护与安全更新,之后停止官方开发,保持开源;JSR 包注册表继续运营,基础设施迁到 Cloudflare。
- 真正的收购标的是 celld。这是 Deno 团队 8 月按 Apache-2.0 放出的 Rust 单文件二进制,可以在自己的物理机或虚拟机上运行 Workers 应用,带 Durable Objects,指向已有 wrangler.json 即可执行,不碰 Cloudflare 边缘网络。
- 官方对动机说得不含糊。Cloudflare 首席工程师 Kenton Varda 承认,此前的自托管运行时一直没能真正跑通,「我们发了运行时,然后就指望社区自己把它适配到各种环境」;而 Deno 团队补齐的正是开发者体验这一块。
- 背景是那笔 2600 万美元的融资。Deno 2022 年完成红杉领投的 2100 万美元 A 轮,筹资用途写得很清楚,就是商业化 Deno Deploy,四年后这台商业引擎被关掉,公司股价在公告当天涨 5.6%。
值得关注的原因:
- Dahl 自己的措辞很有意思:Deno 工程质量没问题,但「被吸进了 Node 兼容性的引力井」,他不再认为这里能做最重要的工作。这句话比收购本身更能说明开源运行时的处境。
- 对开发者来说,这是一道半年内必须做的选择题。正在用 Deno Deploy 的团队只有两条路,迁到 Workers,或赌社区接手这个运行时;写在产品清单里的 Fresh 框架与 Deno Subhosting 在公告中都没被提及。
- 智能体时代让运行时这一层突然变得关键。代理要跑代码、要跑持久化对象、要自托管,谁掌握这层底座,谁就掌握了代理的执行环境。用 Dahl 的话说,只有开放版本能赢,因为「任何这么基础的东西,都需要可检验、可移植、能在单一厂商平台之外使用」。
3. Claude Code 2.1.296:让子代理自己决定什么时候压缩上下文
事件: 10 月 9 日,Claude Code 发布 2.1.296,官方说明里除了约 80 项修复,还带来一组编排与网关相关的新能力,10 月 10 日的社区日报做了逐条拆解。
要点:
- 子代理的 frontmatter 与
--agents定义新增autoCompactWindow,可以为单个子代理设一个比主会话更早的压缩阈值。此前子代理与主会话共享压缩门槛,一个反复做短任务的子代理会一直攒着大量上下文,直到最后才压缩。 - Read 工具加了
allow_large选项,上下文有余量时可以在一次调用里读完整份大文件,不必再分段拼。 - 新增环境变量
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL,让工作流里每个代理跑在同一个指定模型上,工作流之外的普通子代理仍用各自原本的模型。 - 其余是权限与稳定性修复,集中在托管设置的钩子行为、网关登录、自托管 runner 的 git 操作、以及大量插件与会话边界问题。
值得关注的原因:
- 这三项看似琐碎,指向的是同一件事:多代理编排已经从「能跑起来」进入「按 token 精打细算」的阶段。上下文什么时候压、哪个阶段用哪个模型,直接决定一次编排花多少钱。
- 配合 Claude Code 近几个版本的节奏看更清楚。同一个 2.1.296 里,Sonnet 5.5 的缓存读取价从每百万 token 0.20 美元降到 0.10 美元,官方称大多数代理工作成本下降约 20%。
- 把模型固定到工作流的做法,本质是承认一件事:工作流里的多数步骤不需要最强模型,用便宜模型统一跑完,比混着用更容易估成本和查问题。
4. 当天的模型层还有一处看点:小模型与端侧范式同时被押注
事件: 10 月 11 日前后,模型发布面延续了本周的密度。Fast 版的 Qwen-Image-2.1-Turbo 把生成与编辑压到 8 步去噪;扩散语言模型方向的公司继续拿到大额融资;中国头部实验室的规划里出现万亿参数模型与双线技术策略的消息。
要点:
- Qwen-Image-2.1-Turbo 是同一套 7B 生成与编辑模型,把去噪步数砍到 8 步,走的是「同质量、少步骤」的工程提速路线。
- 端侧这一侧,非自回归的并行生成路线在持续被验证,落点明确指向 AI PC、汽车、机器人与智能家居,与自回归逐词生成形成对照。
- 这一批发现在同一天被多个聚合渠道收录,是当前模型迭代密度的写照。
值得关注的原因:
- 「同架构、改训练」和「同模型、减步骤」是同一类做法:参数不动,改的是工程效率。Mellum2.1 与 Qwen-Image-2.1-Turbo 放在一起看,方向是一致的。
- 对应用侧而言,这比多几个点的基准分数更有意义,因为决定能不能上生产的通常是延迟、成本与部署位置。
- 该警惕的是来源强度。这类聚合条目给出的数字通常是厂商口径,未附独立评测,判断时先把口径分层。
三、具身智能方向

5. 星动纪元 VPP2 登顶 RoboDojo 并开源:世界动作模型的一次正面对比
事件: 10 月 10 日,澎湃新闻从星动纪元获悉,其世界动作模型 VPP2(Video Prediction Policy)在由香港大学 MMLab 牵头、近 20 家学术机构参与的仿真评测基准 RoboDojo 上位列榜首,平均成功率 32.26%、平均得分 39.26,在泛化、精细操作与记忆三项评测中均排第一,超过 GPT-6 Astra 与英伟达 GR00T-N1.7,并同步开源。
核心参数:
- RoboDojo 的 42 项双臂任务覆盖泛化、精细操作、长程任务、记忆与开放词表指令;官方称 VPP2 只用标准数据集,未引入额外数据,也未使用代理式递归自我改进(Agent RSI)。
- 论文里引用的最强对照是后训练评测中的 GPT-6 Astra,得分 22.48% 与 28.97 分。
- 训练分三段:事件级视频预训练基于阿里开源的 Wan2.1-I2V-14B,学会完整预测一次操作的全过程;随后把预测裁成固定 8 秒片段蒸馏成单步,耗时约 0.12 秒;最后用一个 0.9B 参数的 Action DiT 把预测转成动作,视频模型冻结、只经 LoRA 适配。一个动作块总延迟约 0.22 秒。
- 真机侧,在 ALOHA 双臂机器人上,VPP2 在 10 类零样本任务上平均 58.5%,对照的 Physical Intelligence π0.5 为 40%,其中 9 类任务表现最佳;LIBERO-Pro 45.0%、LIBERO-OOD 63.9%;接入视觉语言模型作高层规划后,部分 RoboDojo 长程任务从 27.6% 提到 57.6%。
值得关注的原因:
- 它正面回应了世界动作模型的老问题:视频预测一旦错,动作就跟着错。分阶段训练加固定时长蒸馏,就是为了把「预测」和「行动」解耦,不让误差一路传下去。
- 评估口径仍有保留。榜单数字引自论文,且上月另有企业宣称其系统登顶 RoboDojo,同名榜单上的名次还需要持续观察。
- 落地情况要说清楚,星动纪元已在五个省市、十多个物流中心与合作伙伴运行机器人,但这不等于 VPP2 已规模部署,两件事不能混为一谈。
6. 德塔智能发布 Delta-0:把「连续干活」当成模型的第一指标
事件: 近期,北京海淀具身智能企业德塔智能发布原生人形机器人基础模型 Delta-0(Δ₀)。官方信息称,搭载该模型的人形机器人在一镜到底的技术演示中,210 秒内规划 32 步,连续完成卧室、客厅、厨房等家居场景中的 9 项常见任务。
技术要点:
- 演示内容包括识别环境、放好游戏机并整理床铺、捡起地面玩偶、把衣物放进洗衣机、把杯子放进洗碗机、打开冰箱找出变质水果、踩垃圾桶脚踏板丢弃水果,最后坐到沙发上,动作之间没有中断。
- 关键点在于任务切换:机器人要根据移动中获得的信息自主切换目标、调整优先级和顺序,并让前一个动作留下的身体姿态与物体状态成为后续决策条件。
- 模型面向人形机器人完整身体构建,把视觉、语言与本体状态等输入转成统一的全身动作目标;采用「大脑-小脑-力位」协同设计,大脑指挥手脚、小脑负责平衡与运动本能并转成高频电机控制,力位混合控制兼顾位置与接触受力。
- 数据上复用既有上肢操作与跨本体数据,同时采集人类全身动作数据以补足下肢参与与移动姿态;后训练引入真实交互反馈、人工纠正与强化学习,并走「真实-仿真-真实」的评估闭环。
值得关注的原因:
- 它把验收标准从「能不能做一个动作」推到了「能不能做完一串动作」。家务不是单点技能,前一步的姿态和物体状态就是后一步的输入,链条一断整段重来。
- 德塔智能联合创始人黄思远的判断值得记住:通用大模型能帮机器人理解任务、规划步骤,但不等于能在受力、失衡和连续接触中把动作做稳,关键在模型能不能把判断落到身体控制上。
- 同一时期这家公司还与灵巧手硬件企业舞肌科技签约,共同定数据采集与模型训练标准,说明它在补的是数据与硬件这一层,而不只是模型。
7. 西湖机器人 WR1 演示全身协同叠衣,并完成亿元级 A 轮
事件: 10 月 10 日,杭州西湖机器人科技发布通用大脑 WR1 的升级演示,展示在真实家庭环境里完成折衣、下厨准备与客厅收纳等连贯家务。企业信息显示,其在 9 月完成了由海愿资本等参与的亿元级 A 轮融资,本轮资金用于人形机器人统一大模型技术突破与自研通用大脑迭代。
技术要点:
- WR1 采用通用大小脑双预训练系统架构,融合世界模型与视觉-语言-动作模型,依据视觉与语言指令统一输出包含身体移动、全身姿态与灵巧手操作的完整动作序列,全身执行交给自研的通用动作大模型 GAE。
- 最高难度的演示是柔性衣物操作:机器人先从晾衣架上取下长裤并像人一样搭在手臂上承托,取衣过程中晾衣架晃动、同架 T 恤位置偏移,机器人持续观察并实时调整。
- 双机协同是另一处看点:它把 T 恤抛送给机械臂,机械臂自主识别后折叠,人形机器人转身把长裤铺展到桌面,与另一台人形机器人配合折叠,两台机器人在协作中互相感知对方动作并调整节奏。
- 第二段是跨房间长程任务:机器人移动到冰箱前开门取出玉米,完成 U 型转弯抵达气炸锅,调整站位拉出炸篮放入食材。
值得关注的原因:
- 衣物是公认的难题,因为对象状态一直在变,拉扯会改变布料形状,晾衣架晃动会带来位置偏移,机器人和机械臂之间的动作还会互相影响。这与叠毛巾、浴巾这类规整织物的难度不在一个量级。
- 报道把 WR1 与海外同类方案做了对比,称现有海外展示更多聚焦规整物品与简单织物整理。这个对比属于企业口径,但取的场景确实选在了难处。
- 融资节奏说明资本仍在往家用与通用方向下注。要看的是长期稳定性,一次演示过关与连续几百小时不出错,仍是两件事。
8. 高德「途途」进驻澳门金沙度假区:开放环境全自主的一次实战检验
事件: 10 月 10 日,阿里巴巴旗下高德与金沙中国在澳门威尼斯人 NBA House 举行任命仪式,正式交付首批具身机器狗「高德途途」,途途获任「金沙中国 001 号机器狗导览员」,结束后进入金沙中国旗下澳门金沙度假区,承担游客导览、带路、问答与设施指引等任务。
实战数据:
- 任命仪式上没有遥控也没有牵引,途途从候场区自主走向舞台,绕过障碍物后在舞台中央停稳,在高级副总裁为其佩戴导览证时抬起前爪握手并向嘉宾致意。
- 上岗首秀在 NBA House 开放首日完成:11 小时服务时段内,针对洗手间、服务台等点位累计完成 214 次自主路线指引,面对中英文交替提问累计回答 4546 个问题,自主行进里程超过 40 公里,相当于绕篮球场 456 圈。
- 现场环境不轻松,人流持续变化、噪声干扰、任务频繁切换,途途需要主动减速避让行人并保持多轮对话不中断任务。
- 依托高德空间智能与 ABot 全栈具身体系,途途把感知、判断、应答、带路、避让贯通为长程连贯任务;双方还为度假区提供全域室内导航,并构建部分区域的三维空间模型,游客可通过高德 App 提前预览。
值得关注的原因:
- 文旅度假区是典型的开放复杂环境,服务周期长、需求分散、还要和现有人工服务流程衔接,对设备稳定性、任务调度与多机协同的要求都比单点演示高。
- 高德 CFO 周海晶的判断很务实:机器狗上岗只是长期运营的开端,高峰时段能不能稳定运作、能不能真正融入度假区的服务流程,才是合作的真正价值。
- 这类项目的价值在于积累真实运营数据。它给具身智能进文旅、赛事场馆与商业综合体提供了一个可复用的场景样本。
9. 光轮智能完成 10 亿元战略融资:数据与评测基建被当成独立赛道
事件: 近期,光轮智能完成 10 亿元战略融资,资金用于物理 AI 数据与评测基础设施的核心技术研发与开放生态建设。企业信息显示,公司同时入选 2026 年国家级独角兽企业,并被定义为物理 AI 的数据和评测基础设施。
要点:
- 公司创始人谢晨曾在英伟达、Cruise 与蔚来负责自动驾驶仿真,其模式被投资人概括为「真实数据校准、仿真数据放大」。
- 据披露,其人类视频数据累计交付超过 150 万小时,2026 年一季度新增订单达 5.5 亿元,优质场景的数据复售率最高达 10 倍。
- 公司联合黎曼动力与诺亦腾机器人共建具身智能数据底座,打通采集、仿真、训练与评测全链路,并发布 RoboFinals 仿真评测平台与 RoboStack 真实场景部署与反馈平台。
- 其联合创始人的判断是,2026 年是具身智能数据规模化元年,今年以来接到的数据与评测需求已是去年的百倍。
值得关注的原因:
- 当本体厂商的交付能力趋于接近,瓶颈就转到了数据配比与评测标准上,这两件事很难靠单家本体厂商内部解决,于是它们被拆出来成了独立生意。
- 它的价值验证点很具体:看有多少数据真正进入训练、有多少经验能跨任务复用,以及这种复用最终能否体现为更稳定的交付与更低的成本。
- 资本同时在往多个数据路线下注,数据正在成为具身智能产业新的竞争资源,而各家对这项资源的理解并不相同。
10. 广东定下 2028 年人形机器人产量突破 8 万台,政策开始对齐产能目标
事件: 10 月 9 日,广东在全国率先召开全省先进制造业大会,明确锚定智能化、绿色化、融合化方向,系统部署制造强省建设。省工信厅一级巡视员吴红介绍,力争到 2028 年打造 1000 家以上先进级、卓越级、领航级智能工厂和 1000 家绿色工厂,推动规上制造业企业人工智能技术应用普及率超过 50%,人形机器人产量突破 8 万台。
要点:
- 广东工业机器人产量占中国四成以上,服务机器人产量占中国八成以上,预计 2026 年人形机器人产量占中国三分之一左右,今年进厂「打工」的人形机器人有望突破 3000 台;今年以来全省已有超过 2000 台具身智能机器人进入工业场景。
- 应用结构在同步变化。IDC 报告显示,科研教育、展演展示、政府数采中心等传统场景占比持续回落,零售、文旅、工业制造、物流等商业场景贡献新增量。
- 工业侧的切口在收窄到具体岗位。优必选创始人周剑提到,人形机器人进入汽车、3C、精密装配、质检、物流搬运等环节时,会优先从搬运、分拣这类重复性、高强度的岗位切入。
- 同期 10 月 10 日,2026 武汉人工智能与机器人博览会在光谷启幕,15 家企业新品全国首发,包括搭载机械臂的空中具身智能机器人、全地形轮足机器人与人形温室采摘机器人等。
值得关注的原因:
- 这是把产量目标写进省级规划的一次明确表态,属于「具身智能 + 产线数据 + 场景生态」的系统竞争思路,比单个产品的参数更能说明地方产业的投入方向。
- 对制造业工人来说,替代压力会先从搬运、分拣这类岗位出现,这比商场里的导购来得更早也更实在。
- 要留意口径。机构出货统计仍包含科研采购与展示样机,纯商业化付费订单占比有待提升,产量目标与盈利之间还隔着一段距离。
四、产业趋势总结
- 小模型的增量从预训练转到后训练:Mellum2.1 架构未动、分数跳档,说明真实环境里的强化学习是资源不占优的厂商能放大的环节。
- 运行时层完成一次整合:Cloudflare 吸收 Deno 与 celld,代理的执行底座正在从「各厂一套」收敛到少数标准。
- 编排进入精算阶段:Claude Code 让子代理自己决定何时压缩上下文、把工作流固定到单一模型,都是在按 token 抠成本。
- 世界动作模型接过 VLA 的讨论位置:星动纪元 VPP2 用分阶段训练回应「预测错则动作错」,并公开榜单与权重。
- 具身的分水岭是连续作业:Delta-0 的 210 秒 32 步、WR1 的柔性衣物与双机协同,验收标准从单点技能移到了长任务链。
- 数据与评测基建成为独立赛道:光轮智能的 10 亿元融资与数据复售率,说明买方愿意为可用数据与统一口径付钱。
从当天筛选的 10 条中提炼 4-6 条跨事件共性趋势。
五、值得持续关注的信号
- Mellum2.1 的 GGUF 与 MTP 组件何时补齐,以及第三方在同一 harness 下复现 SWE-bench 与吞吐数字的结果;
- Deno Deploy 的半年关停窗口,以及第一批把 celld 的 Durable Objects 支持打包进 workerd 的版本是否按期落地;
- Claude Code 的多代理编排在真实迁移与重构任务上的成本曲线,以及工作流单模型策略的实际节省幅度;
- VPP2 的榜单名次能否被独立复现,以及长程任务接入高层规划后的稳定性;
- Delta-0 与 WR1 的连续作业在无剪辑长时段测试里的失败率与人工干预频率;
- 高德途途在度假区高峰时段的稳定运行数据,以及多机协同时的调度能力;
- 物理 AI 数据与评测的真正复用率,即多少经验能跨任务沉淀为更低的交付成本。
从当天报道中提取值得长期跟踪的信号或待验证的节点。
本日报基于公开报道整理,仅供参考。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)