别再盯着大模型了!中关村便利店里,一个机器人已经悄悄上了三个月的班

当所有人的目光都被 GPT-5、Qwen 和 Claude 的跑分吸引时,北京中关村一家全家便利店里,一个叫「小盖」的机器人已经默默干了三个月的活——取货、聊天、夸顾客裙子好看。与此同时,它的「同事」正在宁德时代的电池产线上 7×24 小时不间断搬运 50 公斤料箱,零人工干预。2026 年 8 月,具身智能正在从实验室 demo 变成真实世界的生产力。


便利店里的「小盖」

早上十点,中关村鼎好大厦一层,白领们步履匆匆。全家便利店里,一个白色外壳、线条圆润的机器人已经准备就绪。

它叫「迎宾小盖」,是银河通用开发的 Galbot G1 具身智能机器人。

「早上好!」看到有人走近,小盖主动打招呼。一位穿紫色连衣裙的女士路过,它立即说:「你今天穿的小裙子真漂亮。」发现有人举着手机,它又说:「你拿着手机在拍什么好玩的事?」

小盖不只是会聊天。它能丝滑地移动身体,挥舞两只机械臂,精准地从货架上取一瓶水、从烤箱里取一根烤肠,递到顾客手中。

这家便利店位于海淀科创核心商圈,客流密集、消费需求多变。小盖的上岗,彻底刷新了外界对服务机器人「花架子」的固有认知。

背后的核心技术是银河通用自研的 「银河星脑」(AstraBrain)——全球首创的「大脑—小脑—神经控制」端到端具身大模型架构,打通了多模态感知理解、任务规划、实时动作执行的全链路闭环。


具身智能最大的坑:实验室冠军,现实废物

「具身智能最终还是要回答一个问题:机器人如何真正走进真实世界。」银河通用联合创始人张直政说。

过去具身智能行业最大的困境:机器人在实验室里完美运行,一进真实场景就崩。 就像一个厨师在学校学会了做菜,但进入不同餐厅、不同家庭后,锅具全换了,就不会炒了。

这就是规模化部署的「天花板」——部署一台机器人到新环境,往往需要重新采集数据、重新训练模型,周期长、成本高。

银河通用的破局方案叫 WAM-TTT(World Action Model Test-Time Training),全球首个面向具身智能世界模型的测试时后训练框架。它的核心能力就一句话:机器人看一段人类操作视频,就能学会新技能。

不需要机器人本体数据,不需要动作标注。普通人用手机拍一段示范视频,就能「教会」机器人。这意味着部署成本断崖式下降。


宁德时代的产线上,另一台机器人干了三个月

同一栋大厦的训练室里,小盖的「同事」们正在备战世界人形机器人运动会。

但真正令人震撼的是 Galbot S1 重载机器人。在宁德时代的动力电池产线上,它已在模组与电池包生产环节承担物料转运任务,7×24 小时连续作业超过三个月,全程零遥操、全自主运行。

这是全球首次实现人形机器人在新能源制造产线的「常态化自主作业」。

记者在现场看到:一台 Galbot S1 稳稳走向料箱堆,精准移动到位后微调姿态,两只粗壮的机械臂同步伸展,卡入料箱两侧凹槽。一声轻微的「咔哒」锁止声后,总重 50 公斤的料箱被平稳抬起。随后快速滑向卸货区,放下料箱后机械臂自动复位——整个过程不到 30 秒。

银河通用已与博世、上汽、北汽、现代、长城、极氪等头部制造企业达成合作,机器人进入真实产线,承担自动质检、上下料、搬运与分拣等任务。


乒乓球、开易拉罐和 117 个自由度

另一家值得关注的具身智能公司是超维动力

今年 WAIC 上,他们展台最热闹的区域是一张乒乓球桌。一台全尺寸人形机器人盯着飞来的球,在极短时间内判断落点、调整步伐、挥拍回击——视觉感知、轨迹预测、动作规划和全身控制,必须连续完成。

另一项演示更耐人寻味:一台双臂机器人用开瓶器打开易拉罐。动作幅度不大,但要求机器人持续判断开瓶器、拉环和罐体之间的相对位置。末端偏离几毫米,任务就可能失败。 这项演示在四天展期内保持零失误。

而机器人学会开罐的方式更值得关注:90% 的数据来自人类第一视角。 模型先从人类操作中理解任务流程,再将人的观察视角和动作转换为机器人能用的表示,最后通过真机数据学习精细操作。

超维动力的 KAI Bot 身高 173cm、体重约 70kg,拥有 117 个全身自由度,约 80% 的体表覆盖触觉皮肤。超维联合创始人罗平这样定位公司:「我们是一家具身智能大模型公司。」他们的终点不是卖机器人,而是建立一套能适配不同机器人的模型和训练平台。


世界模型:让数据生产延伸到虚拟世界

第一视角数据提供了真实世界的人类经验,但覆盖范围受时间、场景和采集成本限制。解决方案是世界模型——在虚拟环境中生成场景、动作和失败状态,扩大模型能学习的经验范围。

高德在 8 月 3 日宣布,自研通用交互式世界模型 ABot-World-0 完成新一轮升级,在单张消费级 GPU 上首次实现连续 24 小时超长时稳定推理,画质、物理一致性与交互响应无明显衰减。相关论文登上 Hugging Face 日榜和周榜双第一。

超维动力的 KAI World Model 则走另一条路线:将系统拆分为世界模型、动作模型和评估模型。动作模型提出下一步行动,世界模型预测行动后的环境变化,评估模型判断结果是否有利于任务完成——三者构成一个闭环的虚拟训练场。


结语:当机器人走出实验室

三个信号同时出现,构成了 2026 年 8 月具身智能的真实图景:

  1. 商业落地:银河通用机器人已在便利店和产线真实运行数月
  2. 技术突破:WAM-TTT 让机器人看视频就能学技能,部署成本断崖下降
  3. 能力泛化:同一套模型正在适配不同品牌的机器人本体

过去两年,所有人都在追大模型的跑分。但具身智能正在用另一种方式证明自己——不是在排行榜上刷分,而是在便利店里卖烤肠,在宁德时代的产线上搬箱子,在乒乓球桌上接住人类的扣杀。

世界人形机器人运动会即将开幕。对银河通用和超维动力来说,每一个真实场景都是赛场。而这场比赛的门票,是能不能把实验室里的奇迹,变成每天 24 小时不打烊的生产力。


本文基于 2026 年 8 月初公开技术新闻报道撰写。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐