具身智能与工业机器人每日动态(2026-08-31)
具身智能与工业机器人每日动态(2026-08-31)
筛选范围:过去 24–72 小时内具身智能与工业机器人领域最具技术价值的进展。
说明:本周末(8/30–8/31)工业/学术一手消息较少,故纳入 8/26–8/28 最新 arXiv 预印本(目前可获取的最新研究)与 8/31 当天产业落地新闻,按技术价值优先排序,共 5 条。
1. 【标题】Riemann-1.0:统一"策略"与"世界模拟器"的具身世界动作模型(WAM)
2. 事件内容:昆仑万维旗下黎曼机器人发布 Riemann-1.0,一种完全因果自回归的"世界动作模型"(World Action Model, WAM)。它把多视角视觉、机器人本体状态、动作统一进一条因果序列,让同一个模型既能当"可执行策略"(观测→动作),又能当"动作条件视觉世界模拟器"(动作→未来观测)。
3. 技术核心:World Action Model(WAM)、完全因果自回归(动作先生成、视觉后果后生成)、Video/Action DiT 统一主干、三阶段渐进式具身预训练(人类视频 λ=0.1 → UMI/外骨骼 λ=0.5 → 机器人轨迹 λ=0.9)、200K+ 小时异构数据(人类第一视角视频 + 手持夹爪 + 机器人轨迹)、流匹配双头(视觉 latent 与动作);因果注意力掩码防止训练时"偷看未来"。
4. 为什么值得关注:代表 VLA → WAM 的范式演进——机器人不再只学"做什么",而是学"我的动作会让世界变成什么样",从而具备"预判后果—实时修正"的主动认知能力。Benchmark:RoboTwin2.0 94.3%、LIBERO 99.0%、RoboCasa-365 62.6%;真实长程操作 SR 85.0% / PSR 94.4%,比最强开源基线 G0.5 的 SR 高 15 个百分点(厨房整理 90% vs 35%)。
5. 工程视角:① 因果注意力掩码设计(干净 token 只看历史,带噪目标只看历史干净 + 同块带噪)保证训练/推理可见性一致,是自回归世界模型落地的关键工程细节;② 动作块粒度 = 1 个视觉 latent 对应 16 个低层动作步,是推理成本与闭环修正频率的折中;③ "海量人类视频预训练 + 少量机器人数据微调"路径,对工业场景(数据稀缺、动作有真实物理后果)有借鉴意义。
6. 来源:arXiv:2608.27033 / 黎曼机器人官方项目页
7. 原始链接:https://arxiv.org/abs/2608.27033 ;项目页 https://riemann-dynamics.github.io/Riemann-1.0-Website/
8. 发布时间:2026-08-27(arXiv v1,Submitted on 27 Aug 2026)
2. 【标题】GRAFT:面向精细操作的在线 VLA 高效强化适应
2. 事件内容:中科大苏州高等研究院团队提出 GRAFT 框架,让预训练 VLA 策略在真实机器人上、限定 45 分钟交互预算内,在线适应到精细生物医学操作任务(如离心管装载、移液枪头装配、精密液体转移)。
3. 技术核心:在线 VLA 适应、区域级监督学习"视角特定视觉锚点"(region-level visual anchors)、单步动作生成(single-step action generation)、VLM 前缀缓存复用(cached visual-language prefix reuse)、在 JAKA 机械臂上验证四项任务。
4. 为什么值得关注:证明"真实机器人 RL 微调"可以在不到 1 小时的墙钟预算内落地(打破 RL 样本效率太低、不能上真机的固有认知);四项任务成功率提升 25 个百分点,整体 82.5% SR;前缀复用带来 9.94× 吞吐加速(RL-FM 6.30 steps/s,RL-CP 21.96 steps/s),让实时在线学习在标准硬件上可行。
5. 工程视角:① “区域提议只用于训练、部署时完全移除”——避免在生产推理中跑额外复杂视觉模型带来的延迟与失效点,对商业化部署极关键;② 多区域分别监督(管、夹爪、装载目标分开)优于合并成单一 union mask,对需要协调多个空间线索的精细任务尤其有效;③ 单步动作 + KV cache 复用,是 VLA 这类大模型在机器人上做高频控制的实用工程手法。
6. 来源:arXiv:2608.27079 / 中国科学技术大学苏州高等研究院
7. 原始链接:https://arxiv.org/abs/2608.27079
8. 发布时间:2026-08-27(v1)/ 2026-08-28(v2)
3. 【标题】UCAG-P:一个策略、多种本体——相机中心动作几何预训练
2. 事件内容:小米具身智能团队提出 UCAG-P,用"相机中心动作几何"作为统一动作接口,让单个 checkpoint 同时在单臂、双臂、人形(含腰、臂、手)上取得竞争力,无需逐 benchmark 微调。
3. 技术核心:相机中心动作几何表征(预测腕部点 p0 与抓取中心 p1 的 3D 相机系轨迹,而非机器人专用命令)、几何条件翻译器(geometry-conditioned translator,用各本体的 Jacobian、相机-基座变换把共享预测转成可执行命令)、直接把人类视频当"一种本体"纳入共享动作空间(免去 retargeting)、三阶段解耦训练、6373 小时异构数据(11 数据集、9 本体)。
4. 为什么值得关注:直接挑战业界主流"人→机 retargeting"范式——37% 训练数据来自第一视角人类手视频(零机器人命令),证明任何第一视角操作视频都可直接成为训练数据,是数据规模化的关键解锁;结果:LIBERO 98.3%、RoboTwin Easy/Hard 88.7%/89.2%、LIBERO-Plus 零样本 82.0%、RoboCasa GR-1(人形)62.0%;分布偏移下 92.8% 鲁棒性、光照变化 98.9%。
5. 工程视角:① 共享的是"相机可观测的操作几何"而非低层控制,本体差异被隔离在翻译器——与把运动学/IK 与高层任务解耦的思想一致,便于多硬件复用同一大脑;② 三阶段训练(VLM 主干+动作头 → 仅训练翻译器 → 联合优化)隔离了运动预测误差对翻译器训练的污染;③ 对多形态机器人平台(AGV+机械臂、人形)的统一策略部署有现实价值。
6. 来源:arXiv:2608.26058 / 小米具身智能团队
7. 原始链接:https://arxiv.org/abs/2608.26058
8. 发布时间:2026-08-26
4. 【标题】Universal Robots 在协作机器人上测试"具身智能体"(Agentic Physical AI)—— MHS 标准 + PolyScope X
2. 事件内容:Universal Robots(泰瑞达机器人)技术副总裁 Anders Billesø Beck 发布博客,演示与 Anthropic 合作的 Model Hardware Standard(MHS,物理设备智能体操作标准,研究预览阶段)在其协作机器人上的验证:用自然语言指令,一个运行 Claude Opus 4.8 的智能体自动发现并协调 4 台 UR 协作机器人作为一个单元(cell)协同工作、在设备间传递负载,无需预先硬编码。
3. 技术核心:Agentic Physical AI(具身智能体)、MHS(Model Hardware Standard,对标软件界的 MCP)、自然语言重任务化(re-tasking)、多机器人协调(4 cobots 协同)、PolyScope X(API-first 下一代控制系统)、设备声明边界/互锁/急停、智能体在声明边界内运行、安全架构始终兜底。
4. 为什么值得关注:标志自动化单元(cell)的"价值单位"从单台机器转向"整个系统"——智能体跨整个单元推理,工程师从写低层代码转向设定目标、监督结果。MHS 把 MCP 的思路从软件延伸到物理设备,是 AI 智能体接入工厂物理世界的关键标准化尝试;对 UR 这类协作机器人龙头(~40–50% 市占、10 万+ 部署)是把最强 AI 模型接入物理世界的现实载体。
5. 工程视角:① 协作机器人 + 成熟安全体系(ISO/TS 15066 功率力限制)+ 开放平台,是 AI 智能体落地物理世界的现实底座;安全不降级——智能体在设备声明边界内运行,底层安全架构始终 fully in charge;② "自然语言重任务化"对缩短产品换线周期、缓解自动化人才短缺有直接工程价值;③ 多机协调把调度/任务分配推到前台,是 MES/产线编排的新接口。注意:目前为概念验证(proof of concept),MHS 尚未 GA。
6. 来源:Universal Robots 官方博客(作者 Anders Billesø Beck, VP of Technology, Universal Robots)
7. 原始链接:https://www.universal-robots.com/blog/testing-agentic-physical-ai-univeral-robots-cobots
8. 发布时间:2026-08-28
5. 【标题】人形机器人"进厂打工"走到哪一步 + 全球首个世界级人形机器人运动会全量数据集开放
2. 事件内容:① 科创板日报 8/31 报道,北京人形机器人创新中心"天工2.0"双足与"天轶2.0"轮臂机器人已在福田康明斯发动机工厂测试近一年,做物料从拖料车向料架的举升搬运(2–5kg,后续迭代到十几 kg),仅针对工况开发两套末端夹具(窄型对付 2–3cm 余量狭小货位、钩型覆盖 15kg+ 料箱);② 人民日报 8/31 报道,赛迪研究院联合北京人形、智元、银河通用等多家发布全球首个世界级人形机器人运动会全量数据集,超 2500 小时、12 个应用场景、44 项作业、万余项精细化任务,将免费向社会开放。
3. 技术核心:真实工业部署(非 POC)、末端执行器针对工况定制、人形/轮臂混合本体、长时程真实操作数据集、数据开放降低真机采集成本。
4. 为什么值得关注:给出比"元年叙事"诚实的进度答案——"能干活"已解决,"天天干活"刚开头,"算得过账"还没人做到;从实验室到商业闭环五步,国内最快一批走完第二步、敲第三步门。同时点出真问题清单:成功率需 99%+、节拍不能拖产线、灵巧手连续作业寿命仅数周、数据缺口达百倍。数据集开放直接缓解"数据从哪采"的行业核心瓶颈。
5. 工程视角:① 末端夹具"窄型/钩型"针对 2–3cm 余量货位的设计,体现"整机不改、只改末端"的务实落地思路;② 灵巧手寿命(数周)和 99% 成功率要求是硬件可靠性的真实约束,比 demo 参数更重要;③ 2500h 多场景开放数据集让团队不必从零采数据,是 sim-to-real 与策略训练的关键基础设施。
6. 来源:科创板日报(2026-08-31)/ 人民日报海外版(2026-08-31)
7. 原始链接:https://www.toutiao.com/article/7680015701070889512/ ;https://new.qq.com/rain/a/20260831A03ILB00
8. 发布时间:2026-08-31
【今日机器人技术知识点】世界动作模型(World Action Model, WAM)
它是什么:WAM 是把"动作生成"和"世界状态演化预测"放进同一条因果生成框架的模型。传统 VLA 是 Observation(+Language) → Action;WAM 进一步建模 Observation + State + Action → Future State,再形成"理解 → 预测 → 行动 → 再预测"的闭环。一个 WAM 可以同时当策略(观测→动作)和动作条件世界模拟器(动作→未来观测)。今天头条 Riemann-1.0 即此类:动作先生成、视觉后果后生成,共享同一因果主干。
为什么需要它:VLA 只学"看到什么就做什么",不显式理解"我的动作会造成什么后果"。当遇到未见过物体、新动作或不同本体时泛化困难。WAM 让机器人能预判动作后果、做前瞻(lookahead)与错误恢复(error recovery),更接近人类解决物理问题的方式——先想"如果我这样做,世界会怎样",再决定怎么做。这也是今天多份研究(Riemann-1.0、τ0-VLA 等)共同指向的 VLA→WAM 演进方向。
在机器人系统中的位置:位于感知与控制之间,既是策略模型,又是世界模拟器/评估器。典型用法:① 直接作策略(obs→action)闭环控制;② 作模型预测控制(MPC)/规划器的"前向模型",在想象中 rollout 不同动作序列、选最优;③ 作策略评估器,在仿真中筛选候选策略再上真机。对控制工程师而言,它等价于给你一个可采样/可微的"被控对象动力学模型 + 环境模型"——就是你熟悉的"状态空间 + 状态转移"的数据驱动版本。
一个实际应用案例:工业焊接。焊接可描述为复杂动态系统:当前工件状态 + 工艺参数(电流/电压/送丝速度) + 机器人动作 → 熔池/材料状态变化 → 下一时刻状态 → 焊缝质量。这与 WAM 要学的 State + Action → Future State 结构高度同构。用 WAM 可在"想象"中预演不同焊枪姿态/速度下的熔池演化,选最优参数,再上真机执行并据真实熔池反馈修正——这正是 Riemann-1.0 所代表的"工业世界模型"思路。对做伺服/焊接/装配控制的工程师,WAM 是把你熟悉的"状态转移"从手工建模升级为数据驱动学习的自然延伸。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)