AI 新闻日报 2026-09-21:AI 编程工程化、判断模型 Jev、具身智能落地
主题: 编码智能体开始扛真实工程,具身智能从展台走进乐园与客厅
编制时间: 2026-09-21
本期看点: AI 编程工程化、判断模型与上下文压缩、具身智能场景落地
一、要闻速览(Top Stories)
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | 微软用智能体把 Copilot 运行时从 TypeScript 重写为 Rust | AI Coding | Rust、15.9 倍吞吐、12 万美元 token、43 万行 |
| 2 | 判断模型 Jev 走红,Claude Code 压缩插件破 4200 星 | AI Coding | System One、非文本生成、精准删除、校准概率 |
| 3 | 腾讯混元联合清华北大发布网页生成评测 IWC-Bench | AI Coding | 369 条需求、5088 条验收、人类一致率 85.3% |
| 4 | Claude 辅助把 CADO-NFS 移植到 GPU,分解 RSA-896 | AI Coding | 896 位、2048 张 GPU、工程编排、无新数学 |
| 5 | 智谱 MaaS 上线「数据内容不留存」,ZCode 争议升级 | AI Coding | 零数据留存、例外条款、企业发函追责 |
| 6 | 智元与长隆合建全球首个大型具身智能主题乐园 | 具身智能 | 300 余台、100 余个交互点、5G-A、文旅场景 |
| 7 | 启元机器人 Q1/T1 正式发售,19999 元起 | 具身智能 | 88 厘米、形态可变、2.5 分钟下线、消费级 |
| 8 | 海光信息将于 9 月 22 日发布面向物理世界的新品类芯片 | 具身智能 | C86 架构、端侧算力、边缘智能 |
| 9 | 智身科技完成数亿元 B 轮,累计量产突破 1.5 万台 | 具身智能 | 阿联酋资本、关节模组、量产交付 |
| 10 | 阿里开源 Qwen-Image-2.1,7B 参数拿下开源生图第一 | 综合 | 7B、原生透明、10 张参考图、非商用许可 |
筛选标准:10 条,侧重 AI Coding 与具身智能方向;每条一句话概括事件 + 快速定位标签。

二、AI Coding 方向深度动态
1. 微软把 Copilot 运行时交给智能体重写成 Rust
事件: 9 月 18 日,微软对外披露,支撑 GitHub Copilot CLI、应用、SDK 与云端智能体的运行时,已从 TypeScript/Node.js 完整迁移到 Rust,绝大部分移植工作由编码智能体完成。
工程细节:
- 历时 14.5 周,分模块逐一切换,共发布 135 个版本,平均每天约 1.3 个移植 PR;约 43 万行 TypeScript 转成约 80 万行生产级 Rust。
- 核心移植阶段消耗约 12 万美元的模型 token,人类投入约三周。GPT-5.6 Sol 与 Claude Opus 4.8 按各自擅长的模块分工执行。
- 基准测试:在共享客户端、100 条并发管道的场景下跑 1000 次单轮会话,TypeScript 每秒完成 7.55 次,Rust 每秒 120 次,15.9 倍;10 客户端批量智能体的内存占用从 1383 MB 降到 126 MB。
- Rust 版本把任务留在进程内完成,不再像 TypeScript 版那样拉起外部后台进程。
- 微软杰出工程师 Stephen Toub 说明,项目要求是「通过 C ABI 嵌入、低启动与稳态开销、可预测的资源使用」,并强调这并不代表所有大型 TypeScript 程序都该改写。他也坦承过程中出现数十处回归。
值得关注的原因:
- 这是目前公开可查的最大规模「用智能体重写真实生产代码库」案例,成本、时长、发布节奏与返工量都摆出来了,可比性强。
- 智能体的行为模式值得记一笔:Toub 观察到它们把大量时间花在收集信息上,而不是直接写代码,工作方式更像「检查状态、提出假设、定点修改、清洗重试」的迭代调查。
- 15.9 倍要放回具体负载里看。有 HN 评论者指出,手工优化原有 JavaScript 或许能追回不小差距,而把 Rust 改写成地道写法还需要更多投入,瓶颈有可能被推到别处。
2. 判断模型 Jev:把「决策」从语言模型里拆出来
事件: TypeSafe AI 于 9 月 15 日发布 Jev,一个不生成任何文本的「System One」模型。社区在几天内把它的用法推到 GitHub 与 X 上,其中 fast-jev-compaction 插件已超过 4200 星。
核心能力:
- 输入是一段状态加若干带类型的问题,输出是带校准概率的结构化答案,不是自然语言。三种问题类型:Noul(真/假)、Choice(从选项里挑)、Score(按等级打分),问题并行评估。
- 定价为每百万输入 token 0.042 美元,输出不收费。LangChain 的 Jev-as-a-Judge 实验测到单次约 0.44 秒、约 0.00035 美元。
- fast-jev-compaction 的思路是把 Claude Code 自带的 /compact 摘要换掉。摘要属于重写,可能悄悄丢掉一个确切的文件路径或报错字符串;这个插件改成逐条问 Jev「这次工具调用还要不要留、结果要不要原样留」,留下的原封不动,删掉的彻底消失。有开发者实测会话从接近 100 万 token 压到 8.6 万 token,耗时约一秒。
- 国内方面,APUS 旗下 AI 实验室在 9 月 19 日公布了较早一批 Jev 的独立开源复现结果,实现国产模型的秒级决策。
值得关注的原因:
- 它点出一个常被忽略的事实:智能体栈里大量模型调用只为了产出一个词,比如下一步派给谁、是否紧急、这次调用是否安全。把这类调用从语言模型上挪走,成本和延迟结构会同时变化。
- 语境压缩的路线正在从「摘要」转向「删除」。摘要是有损改写,删除是精确取舍,两种失效方式完全不同,后者更适合需要逐字保留路径与报错的调试场景。
- 需要打个折扣:193.6 倍速度与 444.6 倍成本优势来自厂商自己的评测,参考答案取的是两个前沿模型的平均值,置信度也不等于准确率。一个 0.98 的置信度,遇到写得糟糕的问题,就是又快又自信地答错。
3. 腾讯混元 IWC-Bench:让智能体自己点一遍网页再打分
事件: 9 月 20 日,腾讯混元联合清华大学、北京大学提出 WebCraftBench(报道中也称 IWC-Bench),把软件测试的思路搬进网页生成评测。
核心参数:
- 基准收录 369 条真实用户需求与 5088 条验收标准,17 个前沿模型共生成 6273 个网页应用。
- 评测方式是让智能体真的打开页面,点击按钮、输入内容、切换页面,再检查哪些功能实际被执行过;自动插桩成功率 99.89%,覆盖率引导把函数覆盖率中位数从 91.9% 提到 94.3%。
- 打分分三个维度:美观度、易用性、需求符合度。在 197 组人工复核对比中,168 组与人类选择一致,一致率 85.3%。
- 一个反直觉的结果:GPT-5.6-Sol 的页面美观度最高,易用性只排第六;落到单个应用上,美观度与易用性的相关系数只有 0.36。
值得关注的原因:
- 网页生成评测长期停留在「看代码、看截图」,按钮点不开、表单交不了这类问题静态检查发现不了,动态验收补上了这一环。
- 好看与好用低相关,说明前端生成能力不能只靠视觉模型的口味来评判,功能链路需要独立验证。
- 国内团队开始提供生成式软件评测的公共标尺,模型选型和验收流程都会受它影响。
4. Claude 辅助把 CADO-NFS 移植到 GPU,RSA-896 被分解
事件: 9 月 19 日,Anthropic 工程师 Stephen A. Weis 公布了 RSA-896 的质因数分解结果,并说明计算过程有 Claude 参与。RSA-896 是 RSA Security 挑战数中一个 896 位(270 位十进制)的半素数,两个因子各约 448 位,结果可直接相乘验证。
技术细节:
- 数学方法没有新东西:用的是 1990 年代以来的通用数域筛法(GNFS),软件基础是开源实现 CADO-NFS。
- Claude 承担的是工程活:把面向传统 CPU 写的 CADO-NFS 移植到 GPU,再调度一批机器把任务跑完。这次动用最多 2048 张 GPU,历时约 10 天,累计约 30 GPU-years。
- 时间线对比很直观。829 位的 RSA-250 在 2020 年完成,用了约 2700 CPU-years;862 位的 RSA-260 在 9 月 3 日由 Cognition 的 Eric Lu 用 Devin 智能体完成,约 4900 GPU-days、估算成本约 40 万美元;896 位这次只隔了 16 天。
- Weis 明确表示没有新数学、没有捷径,对已部署的密钥不构成新威胁。RSA-2048 约 617 位十进制,仍远在可及范围之外。
值得关注的原因:
- 真正的看点是工程编排能力:把成熟但高度专用的科研代码搬到新硬件上,再管住上千张异构闲置算力,这类工作过去需要专职团队做上数月。
- 两家 AI 公司在同一个月里用各自的编码智能体推进同类记录,说明前沿模型已经能实质加速高专业度科学计算软件的实现与调优。
- 被推高的其实是「AI 把既有工具用得更狠」这条曲线,而非算法本身。按位长论,从 2020 年到 2026 年只涨了 67 位,这个进度对日常加密体系暂时没有冲击。
5. 智谱 MaaS 上线「数据内容不留存」,ZCode 代码上传争议同步升级
事件: 9 月 20 日,智谱 MaaS 平台公告将上线「数据内容不留存」功能,任何用户均可申请开通。生效后平台不对调用的输入输出做静态存储,数据仅用于完成当次调用。
细节与边界:
- 智谱说明这不是「任何情形都不留存」:Batch API、File API 等需要平台侧持久化任务或文件的功能不在覆盖范围;法律法规要求留存,或为核查违规与滥用行为时,平台可能按要求留存相关数据 30 天及以上。
- 零数据留存机制在 OpenAI、Anthropic、xAI、Mistral 等平台已有先例,同为用户主动申请制,也保留合规例外。
- 背景是同一周的另一件事。9 月 18 日有开发者公开排查记录,指智谱编程工具 ZCode 在用户目录的隐藏文件夹留存数据。智谱通过官方群组致歉并称问题已修复,源头指向「代码库索引」功能;随后有企业发函追责,要求说明已上传数据的去向与删除情况,函中提及涉及 32932 个文件、约 4.11 亿明文字符,含 Git 历史、数据库口令与 API 密钥。
值得关注的原因:
- 编码智能体正在成为企业最敏感的数据入口。索引、检索、记忆这些让它变好用的机制,同时也是数据外流的路径。
- 「零数据留存」回答的是未来调用怎么处理,回答不了存量数据怎么删、索引存在哪、谁看过。企业侧要的是可审计的能力,不是一句承诺。
- 时间点落在 MaaS 调用量增长期,说明数据治理正在成为 API 定价之外的第二条竞争线。

三、具身智能方向深度动态
6. 智元与长隆合建全球首个大型具身智能主题乐园,9 月 24 日启幕
事件: 9 月 20 日智元机器人宣布,与长隆集团联手打造的具身智能主题乐园将于 9 月 24 日在横琴长隆飞船乐园开园,当日部署超过 300 台智元全系机器人。
落地细节:
- 园区设 100 多个机器人交互体验点,覆盖文娱演出、科普研学、导览导购、零售服务、智能伴游、酒店服务、体育竞技七类场景,部分机器人带姓名与角色性格。
- 开园当天将上演大规模人机共演开园舞与机器人空中飞人表演,在世界人形机器人运动会获奖的同款机器人也会常态化展示。
- 智元与长隆共建的具身智能文旅联合研究院同期揭牌,双方还会展示基于 5G-A 的文旅场景应用。
- 长隆方面披露,横琴长隆飞船乐园累计接待游客已超过 1000 万人次;智元公布 2026 年上半年人形机器人出货 8400 台,占全球市场 44%。
值得关注的原因:
- 文旅是高客流、高交互、环境不可控的公开场合,几百台设备同时上线,考验多机调度、连续运行、内容更新与现场维护,与工厂里单工位试点是两种难度。
- 这更像一次压力测试而非品牌展示。从开园爆点到可持续运营,考验的是成本、可靠性与体验差异化的组合。
- 机器人走进人流量最大的公共空间,公众对具身智能的第一印象会在这里形成,真实数据和舆论评价会同步积累。
7. 启元机器人 Q1/T1 正式发售,19999 元起
事件: 9 月 20 日,上纬新材旗下消费级品牌启元机器人在上海举办全球产品发布会,正式发售 Q1 与 T1 两款个人机器人,均 19999 元起,当天开售,10 月 1 日起按订单陆续发货。
产品细节:
- Q1 身高 88 厘米、约 15 公斤,可折叠放进背包,全身 22 个柔顺力控自由度,支持 3D 打印改造外观、自定义性格与音色;探索版 26999 元,开放 SDK、HDK 与硬件拓展接口。
- T1 主打形态可变:轮足人形与四足之间自主切换,不需要更换零件,身高约 100 厘米、重约 16 公斤、续航约 2 到 3 小时,支持跟随拍摄与自动回充;Pro 版 29999 元,加入英伟达 Orin 算力芯片与 360° 全向避障。
- 支撑轻量化的是自研 QDD 准直驱关节,体积接近鸡蛋大小,直径 47 毫米、重 260 克,峰值扭矩密度 85 N·m/kg。
- 量产环节引入汽车工业的节拍与质量管理方式,目前每 2.5 分钟下线一台。公司 2026 年预计投入 5 亿元研发费用;半年度报告显示消费级具身智能机器人预收货款 2.1 亿元,首批体验店覆盖上海、广州、深圳、杭州、厦门、武汉、西安七城。
- 模型侧公布三类核心 AI 模型:PrimeMotion(柔顺安全小脑运控)、PrimeGo(多模态感知跟随)、PrimeVista(多模态交互),并计划推进 PrimeMind 家务基座大模型与基于 Harness 架构的机器人智能体。产品接入腾讯云 WorkBuddy,可调用云端技能。
值得关注的原因:
- 2 万元这个价位把个人机器人拉进高端消费电子区间,比工业级人形低一个数量级,商业化的门槛从技术问题转成了需求问题。
- 「发售即发货」意味着厂商要直面生产一致性、售后、软件更新与长期使用中的各种问题,这些是样机阶段不必承担的。
- 产品路径选择值得留意:先做可编程、可定制的有趣属性,再往有用走,避免一上来就承诺全能家务助手。
8. 海光信息将于 9 月 22 日发布面向物理世界的新品类芯片
事件: 海光信息 9 月 20 日公告,将于 9 月 22 日在深圳发布全新芯片,发布口号为「向前,再向前」「让算力,抵达物理世界」。
公开信息:
- 据媒体报道,此次将发布 1000 系列 CPU,采用 C86 架构的轻量级设计,面向低功耗、嵌入式与端侧算力需求,为边缘终端、工业设备与物联网节点提供基础算力。
- 应用方向覆盖机器人、机器视觉与智能制造。这些场景对实时性、功耗、安全与生态兼容的要求,与数据中心芯片并不相同。
- 这是海光现有产品版图的延伸。此前已有 7000、5000、3000 三个 CPU 系列,分别对应数据中心高性能、行业主流中端与多场景高性价比。公司 2026 年上半年营收 90.99 亿元,同比增长 66.52%,研发投入 26.52 亿元,占营收 29.15%。
值得关注的原因:
- 具身智能和工业视觉把算力需求推到了现场,实时控制与低功耗的约束让通用服务器芯片不总能胜任。
- 国产芯片厂商从数据中心向物理世界延伸,机器人企业与工业软件企业的选型空间在扩大,软硬件协同的接口约定也会跟着被讨论。
- 后续要看算力指标、客户验证、量产节奏与软件生态,尤其是编译器与工具链能否跟上。
9. 智身科技完成数亿元 B 轮,累计量产突破 1.5 万台
事件: 9 月 20 日,具身智能机器人企业智身科技(GENISOM AI)宣布完成数亿元人民币 B 轮融资。
细节:
- 本轮由阿联酋 Stone Venture(磊石资本)领投,洪山资本、粤科金融、吴中融玥、吴中金控等机构,以及东软集团、豪鹏科技、远见资本、日盈电子等产业投资方参与。
- 截至 2026 年 6 月,公司累计量产行业级具身智能机器人突破 15000 台,单月产能较去年月均水平提升超过 10 倍;自研 CHAMP 系列高功率密度关节模组年产能突破 100 万件。
- 产品已进入电力、石化、消防、安防、应急、教育等行业,与 500 余家生态伙伴合作。融资后将投入机器人本体、具身大小脑与任务作业,推进 GSD(Genisom Self-Driving)自主导航迭代,并围绕运动智能、空间智能、交互智能、群体智能四条路线加大研发。
- 产品矩阵包括四足机器人和人形机器人银毅 NE01(单关节峰值扭矩 180 N·m)。公司启动「万有引力」计划,首期面向开发者与高校开放千台真机及过亿元综合资源。
- 行业侧,据 IT 桔子统计,2026 年上半年国内具身智能及机器人领域共发生 288 起融资事件,涉及 226 家企业,披露融资额超 460 亿元,投资逻辑从「看团队、看演示」转向「看交付、看数据能不能持续积累」。
值得关注的原因:
- 1.5 万台量产与百万件关节模组年产能,把融资叙事从技术概念拽回交付能力,这正是当下资本筛选的主线。
- 中东资本看中的是油气、能源、安防等场景的明确需求,与公司已验证的巡检、消防场景重叠,构成出海的自然入口。
- 四足先行、人形跟进的路径能否在真实工业场景跑出稳定复购,取决于场景数据的积累速度与模型迭代效率。交付是门槛,不是终点。
四、模型与开源生态
10. 阿里开源 Qwen-Image-2.1:7B 参数拿下开源生图第一
事件: 9 月 20 日,阿里千问开源 Qwen-Image-2.1,把文生图与图像编辑整合进同一个模型,视觉生成部分仅 7B 参数,原生支持透明图像(RGBA)的生成与编辑。
核心参数:
- 结构上视觉生成部分为 32 层 Single-Stream DiT,原生支持 2K,另配 Qwen3-VL-8B 视觉语言模型提升文字排版与人物表现。
- 编辑支持最多 10 张参考图,可用于合影合成、虚拟试穿、室内设计;局部编辑支持圈选、涂抹与独立掩码。
- 推理侧采用混合粒度注意力,文本用 token 级因果掩码、图像用 chunk 级掩码,并通过 KV cache 复用把参考图与编辑指令作为静态上下文预计算。单张 RTX 4090 24GB 加 CPU offload 下,1024×1024 生成约 18.7 秒,编辑约 21.7 秒。
- 官方基准 Qwen-Image-Bench 上总分 60.28,高于 Nano Banana 2.0 的 59.82 与 GPT Image 1.5 的 59.65,第三方独立评测尚未公布。
- ComfyUI、vLLM-Omni、SGLang-Diffusion 均提供首日支持。许可为研究用途、禁止商用,企业需另行申请。
值得关注的原因:
- 7B 这个体量能在 3090、4090 级别的消费显卡上跑起来,把图像生成能力从云端 API 拉回本地设备。
- 原生透明通道与多参考图把 AI 生图往真实设计流程推进了一步,抠图、改字、多素材组合这些环节可以从拼接工具里挪出来。
- 两个待验证的点:「击败闭源模型」目前只是自家基准口径,还等第三方复测;开放权重也不等于可商用,这道门仍然关着。
五、产业趋势总结
- 编码智能体的考核标准从「写得多快」转向「改得多稳」:微软的 Rust 迁移公开了成本、版本节奏与回归数量,RSA-896 把工程编排交给模型,评价重心落在可验证、可回滚、可追责上。
- 模型栈正在被拆层,判断类调用被单独拿出来:Jev 这类不输出文本的模型,把智能体栈里那些只为了产出一个词的高频调用挪出语言模型,成本和延迟结构同时变化。
- 生成类任务的评测开始动真格:IWC-Bench 让智能体真的操作页面,说明「看起来能用」和「实际能用」之间的差距,已经大到需要专门的验收流程。
- 具身智能的落地场景从工厂扩到公共场所与家庭:主题乐园、消费级个人机器人、端侧芯片同时出现,评价维度从能做什么动作,转向能不能连续稳定运行、有没有人愿意长期用。
- 量产与交付成为具身智能融资的硬门槛:1.5 万台累计量产、百万件关节模组年产能这类数字,比演示视频更能决定融资结果。
- 数据边界成为企业采用 AI 的前置条件:编码工具的代码库索引、MaaS 平台的留存策略,都在被要求给出可审计的答案,而不是原则性表态。
六、值得持续关注的信号
- 智元机器人的上市进展与长隆项目的运营数据:据媒体报道公司已就 IPO 引入辅导机构,目标估值约 200 亿美元,2026 年营收预期 40 亿元;主题乐园能否从开园爆点变成可持续运营的模式,是券商和产业都会追问的问题。
- 智谱 ZCode 事件的后续处置:企业已发函要求说明已上传数据的去向与删除情况,「数据内容不留存」能否落到可审计的层面,比公告本身更关键。
- 启元 Q1/T1 的首批用户反馈:2 万元的价格锚点能否撬动购买,取决于实际体验是否足够差异化;2.1 亿元预收货款对应的交付节奏也是观察窗口。
- fast-jev-compaction 这类插件会否被吸收为官方能力:语境压缩从摘要转向删除,一旦成为默认行为,调试类会话的成本与可靠性都会变。
- 海光 1000 系列芯片的算力指标与软件生态:发布会之后,客户验证与工具链成熟度决定它能否真正进到机器人本体里。
- Anthropic 在上市前的产品动作:据路透社援引知情人士,公司正考虑在 IPO 前发布新一代旗舰模型,同时有消息称其年化收入预计超过 1000 亿美元,两件事的先后顺序会影响市场对它的定价逻辑。
- Noam Brown 对多智能体的判断:他称内部已出现上万智能体自发协作,同时表示解决数学难题的核心功劳在底层模型能力,多智能体只是锦上添花;1 万个智能体的协调能力是否超过 1 万个数学家,目前没有严谨的消融实验。
- 国内具身智能的产需对接节奏:世界制造业大会在合肥把 16 款机器人摆上主展台,近 20 家车企以自研、孵化或投资方式入局,累计规划投入超千亿元,这些产能能否落到真实订单上,年内会有答案。
本日报基于公开报道整理,仅供参考。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)