AI 每日简报 · 2026-09-22

覆盖日期:2026-09-21 ~ 2026-09-22 · 方向:AI Coding × 具身智能 · 简报口径:3-5 条有"范式信号"的事件


一、AI Coding(3 条)

1. xAI 发布 Grok 4.7:价格不变 + 编码"性价比冲锋"

  • 事件:9/21 马斯克旗下 xAI 正式发布 Grok 4.7,定位"编码与知识工作最强模型";定价保持 $2 / $6(输入 / 输出,每百万 token),与上代 4.6 持平,约为 GPT-5.6 Sol 的 1/3、Fable 5.1 的 1/4 ~ 1/8;同日上线 Cursor、Grok Build、GitHub Copilot、xAI API 及主流模型路由器。
  • 关键数据:CursorBench 4.0 46.3%(vs Fable 5.1 Max 51.8%)、DeepSWE v1.1 high-effort 71.0%、Terminal-Bench 4.0 38.0%(vs Fable 57.9%)、EEBench 64.0%(领先 Fable 56.4%)、Harvey Legal 19.6%(是 GPT-5.6 Sol 的 ~8 倍)。
  • 关注点:
    • 价格战扩散到"输出 token":Fable/GPT 类定价输出 $20/$50,xAI 仍守 $6,对长链路 Agent 是数量级优势;
    • 垂直领域反超:法律 +11 分、电气工程 +11 分单一版本跃升,验证"专项数据 > 通用 RL";
    • 不可忽视的负面信号:Artificial Analysis 独立测评 Terminal-Bench 仅 26%(xAI 自评 38%),差距 12 分——同一基准、不同 harness 的可复现性再次敲警钟。

2. 清科灵境 OASIS WAM 登顶 NVIDIA RoboLab:具身"大脑"路线胜出

  • 事件:9/22 凌晨,36 氪报道清科灵境(Synkrotron)联合中国科学技术大学研发的 OASIS WAM(World Action Model),在英伟达自家构建并维护的 RoboLab 高保真仿真基准(基于 Isaac + Omniverse)的 120 个视觉-语言-操作任务中拿下综合第一,超过 NVIDIA、Google、Physical Intelligence(PI)等头部团队,是榜单中唯一的中国团队。
  • 关键数据:默认语言设置下完成 468/1200 次测试,综合成功率 39.0%,综合 score 53.7(第二名 Cosmos3-Nano-Policy 36.8% / score ~48)。
  • 关注点:
    • "由东道主考试"的含金量:评测任务由英伟达出题、英伟达建考场、英伟达判卷,作弊门槛极高、可复现;Meta 副总裁唐春强、日本提雅智行、药明康德等 10+ A 股产业方 9 月扎堆到访清科灵境,是榜单之外的二次验证;
    • 范式信号:具身赛道竞争从"机器人本体"加速向"OS / 大脑"迁移——清科灵境采用"高层 VLM 拆解任务 + WAM 连续生成动作 + Speculator 推测提前准备"三层架构,瞄准的是长任务的等待空转这一行业级痛点;
    • 审慎看待:39% 成功率仍意味着 6 成失败,仿真第一 ≠ 真机可用;榜单级与 RoboArena 实机榜单 Spearman 0.94 相关性说明相对排序有意义,绝对数字不可外推。

3. 中国大模型调用量连续 21 周超美国,DeepSeek V4.1-Flash 单周 +219%

  • 事件:9/14-9/20 全球大模型总调用量 129 万亿 token,环比 +1.57%;中国大模型调用 67.46 万亿 token(+10.28%),美国 14.21 万亿 token(-34.7%);DeepSeek V4.1-Flash 单周调用量 +219% 登顶 OpenRouter。月之暗面 Kimi K3 9/21 接入 Amazon Bedrock,与海外云厂商分成模式落地。
  • 关注点:
    • 调用量取代参数规模成为新的可比指标:开发者粘性 + 模型性价比是真实护城河;
    • DeepSeek 强制路由持续发酵:9/14 V4.1-Flash 静默接管 V4-Pro 后,本周调用量再爆,"锁 model ID"是当下必做动作;
    • 出海路径被复制:海外云分发 + 分成结算 = 中国模型低成本出海范式,预计 Q4 将有更多国内模型走通 Bedrock / Vertex AI / Azure Model Catalog。

二、具身智能(2 条)

4. 9/20 双响:启元 Q1/T1 19999 元起 + 智身科技累计量产 1.5 万台

  • 事件:9/20 上纬新材旗下消费级品牌启元机器人发布 Q1 / T1 两款个人机器人,售价 19999 元起;同日志身科技(GENISOM AI)宣布 B 轮数亿元融资(阿联酋 Stone Venture 领投,东软/豪鹏/日盈等产业方跟投),累计量产突破 1.5 万台、单月产能较去年月均提升 10×。
  • 关注点:
    • 量产节拍对标汽车:启元每 2.5 分钟下线 1 台,按汽车质量管理体系 + 手机 3C 认证;智身科技三大基地 + 四大工厂,电力/石化/消防/安防/应急/教育六行业落地;
    • 资本逻辑变化:H1 国内具身融资 935 亿 +5×、322 笔 +137%,但 70%+ 资金流入前 20 家;IPO 端宇树 8 月科创板、梅卡曼德 9 月港交所、本末 9/29 港股,"上市预备梯队"近 40 家;
    • 机构预期继续上调:高盛将 2030 年全球人形出货预期从 25.6 万台上调至 89 万台;德意志银行 2026 年从 1.75 万台上调至 5 万台。

5. 《AI 安全治理框架 3.0》单列"智能体 + 具身智能"两大风险类别

  • 事件:9/14 国家网络安全宣传周(济南)发布《人工智能安全治理框架 3.0》,1.0→2.0→3.0 一年一版节奏稳定;3.0 首次把"智能体安全风险"与"具身智能安全风险"单独列为一级类别,配套新增 9 页《智能体风险管理框架》附件(拆解设计研发 / 安装部署 / 指令输入 / 推理规划 / 调用执行 / 记忆存储 / 结果输出 / 停用下线 / 其他 9 个环节);同期配套"沙箱监管环境"与 4 个科普专栏(非预期自主行为、自主网络攻击、AI 跑分竞赛损害科研、深度伪造可验证性)。
  • 关注点:
    • 监管标尺已成形:框架非强制法律,但被监管者作为衡量企业的"尺子"——上市审核、ToB 采购、政府集采都会以此对标;
    • 企业建议清单(可直接落地):
      1. 列出智能体清单,标注权限边界;
      2. 调用日志结构化并防篡改;
      3. 高风险操作设人工审批点 + 实测"暂停/终止"能力;
      4. 部署智能体企业应预留一份 3.0 自评报告作为投标/上市加分项;
    • 与今日两条新闻呼应:Coding → Agent → 具身三层攻击面同步扩大,9 月以来"安全三连击"(9/18 skill 劫持 → 9/19 Hacktron 攻破 OpenAI → 9/20 RoboHarm 具身危险指令不拒 → 9/22 治理框架 3.0)构成完整月度主线。

三、低频但重要的今日信号(顺手记)

信号内容含义
国产 AI 芯片Bernstein:华为 2026 中国 AI 芯片份额 ~50%,英伟达 ~8%;TrendForce:国产高端份额近 90%从"政策驱动"转向"算术驱动";CUDA 护城河正被工具链(CANN/DeepSeek 兼容)侵蚀
国产开源模型小米 MiMo-V2.6 Pro/Flash 发布,DeepSWE 71.9、Terminal-Bench 89.9;阿里 Qoder 上线鸿蒙 PC 成为首款 AI 编程智能体工作台国产编码 Agent 进入"模型 + 工作台"双轮;鸿蒙生态对开发者吸引力增强
中国电信 + 具身9/21 大晓机器人 × 中国石油落地首个加油站便利店具身智能项目(昆仑好客便利店试运营,75cm 通道 / 2m 货架)零售场景量化验收样板已建立,2027 年或成为便利店标配
OpenRouter + 中国模型DeepSeek V4.1-Flash 登顶 +219%,中国调用量连续 21 周超美国产模型出海由"路线之争"转入"运营之争"

四、今日可执行行动建议

  1. 立即试用 Grok 4.7:Cursor / Grok Build / GitHub Copilot 已同步上线,优先跑价格敏感 + 长时任务(夜间批量 CI、文档批量处理),对照 Claude Fable 5.1 看账单降幅;Terminal-Bench 测评差距 12 分提示务必保留主选模型,Grok 4.7 作为"专项副驾"使用。
  2. 按 3.0 框架做一次"智能体检":10 分钟内跑一遍"智能体清单 + 调用日志 + 暂停按钮"三项自检,未达标的立刻补;3.0 落地预期 Q4 进入实质审查期。
  3. 跟踪 OASIS WAM 真机对照:9/22 是仿真榜单峰值,9/25-10 月若清科灵境或第三方(智元、宇树)发布对照实验,将定义"仿真 → 真机"的可转化率;可作为 10 月份具身赛道"开学考试"准备观察。
  4. 复核 DeepSeek / Kimi K3 出海对账:若你的产品调用海外 Bedrock / Vertex AI,本周结算路径发生变化,建议与云厂商确认分成比例 + 调用计费口径,避免月末对账被多收 5-10%。

五、明日(9/23-9/24)跟踪线索

  • 9/24 横琴智元 × 长隆全球首个大型具身智能主题乐园启幕(300 台机器人 + 100+ 交互点)——文旅高客流压力测试 + 真实交互数据闭环首批观察窗口。
  • 9/22 海光信息 1000 系列物理世界 CPU 深圳发布——国产算力"端-边-云"三层矩阵又一卡位动作,重点看实时性 / 功耗 / 兼容认证三项指标。
  • 宇树股价回落 + 监管窗口指导(路透 9/21):6 家筹备 IPO 的具身企业面临收入质量重审,9/29 本末科技港股挂牌为首个压力测试。
  • Grok 4.7 独立评测陆续出:Artificial Analysis 给出 Terminal-Bench 26% 后,预计 Cognitive Atlas / LMSYS / Stanford CRFM 在 1-2 周内出独立基准,是模型能力的真实试金石。

简报基于公开网络信息整理,时间窗为 2026-09-21 ~ 2026-09-22,所有数据已标注来源机构与口径;非投资建议。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐