让机器从数据中生成本领:诺因Knowin通用具身智能生成式学习架构GLOW深度解析

一、引言:GPT-6之后,具身智能的路线之争

2026年9月,整个具身智能行业被一个问题反复叩问:当GPT-6 Astra这样的通用大模型开始展现出"理解物理世界并操控机器人"的潜力时,此前那些围绕"视觉模块+动作模块"拼接、依靠真机采集数据再模仿执行的传统具身智能路线,是否正在被历史淘汰?

这个问题的答案,在9月24日被深圳具身智能公司诺因(Knowin)以一份技术报告的形式给出了一个具体样本。诺因正式发布面向通用具身智能的生成式学习架构GLOW技术报告,完整披露了其升级后的整体技术架构,核心主张是让机器人获得"一教就会"的任务学习能力——用户只需演示一次完整操作,机器人即可跨物体、跨环境、跨任务地复用所学技能,无需重新训练或更新模型参数央广网。报告同步披露了Glow在RoboDojo、LIBERO-Pro、Embodied Arena等多项国际主流具身评测中的成绩,并宣布"三项第一"科技日报。

本文不满足于转述发布会的宣传口径,而是试图深入到GLOW的架构内部,从生成式学习范式与判别式/模仿学习范式的本质差异出发,拆解它的四个核心模块如何协同运转,剖析它在数据、世界模型、动作生成、任务规划与跨本体迁移上的技术取舍,并与行业主流方案(VLA、World Model等)横向对比。所有技术细节均以诺因官方口径及多家权威媒体交叉验证为准,不虚构任何未公开的层数与参数。

二、范式背景:生成式学习为何是具身智能的"分水岭"

要理解GLOW,首先要理解它所在的范式坐标系。具身智能(Embodied Intelligence)指AI通过感知与行动在物理世界中学习与执行任务,其核心挑战在于:真实世界无法穷举,环境、物品、状态总是在变化。

传统路线大致可以归为两类。其一是判别式/映射式路线(如行为克隆、模仿学习):收集大量"状态-动作"对,训练一个从感知到动作的映射函数。它的局限在于,模型学到的本质是"复现训练过的动作",一旦遇到分布外的物体、光照或布局,精度迅速崩坏。其二是脚本式/流程式路线:为每项任务编写固定流程或规则,只能处理确定性较高的任务。

GLOW所主张的生成式学习(Generative Learning) 则完全不同。它不是让模型去"判别"当前最像哪一个训练样本,而是让模型去"生成"任务目标、动作序列与未来状态——就像大语言模型生成下一个token、扩散模型生成下一个像素一样,具身模型生成"下一步该做什么、做了之后世界会变成什么样"。这种范式把一次人类完整操作、当前环境、机器人自身状态与执行历史放进同一条链路理解,让机器人不只是"看见动作画面",而是同步捕捉物体关系、操作顺序与状态变化,从"看过"走向"学会"光明网。

也正是基于这个判断,行业在2026年形成了共识:自回归架构正成为模型架构的收敛方向,具身智能的竞争核心正在从"谁能在设定场景里完成更多动作"转向"谁能让机器人跨越环境、物品和任务持续泛化",也就是谁掌握更高效的数据与学习方式。

三、GLOW总览:四个核心模块构成的完整闭环

GLOW的架构肉眼可见地与传统"感知—规划—控制"纵向堆叠不同,它选择了一种"一主三辅"的组织方式:一个统一的多模态自回归核心大脑,加上三个分别承担数据生成、世界推演、长程任务编排的支撑模块。诺因的技术报告将原本分散的Brain与Act能力统一进了KnowinGLOW,让其与KnowinDream、KnowinWorld、KnowinAgent构成从经验学习、任务理解到行动反馈的完整链路网易智能/中华网。

我们先看整体架构图:

plaintext


图 1:GLOW 生成式具身智能系统整体架构


                  ┌───────────────────────────────────────────────┐
                  │                用户自然语言 / 一次演示          │
                  └───────────────────────┬───────────────────────┘
                                          ▼
   ┌────────────────────────────────────────────────────────────────────┐
   │  KnowinGLOW : 统一多模态自回归"核心大脑"                              │
   │  ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐           │
   │  │视觉理解│ │语义解析│ │空间推理│ │任务规划│ │动作生成│              │
   │  └────────┘ └────────┘ └────────┘ └────────┘ └────────┘           │
   │  同一表征体系 · 自回归生成 (理解与动作共享 token 空间)                 │
   └───────┬───────────────────────────────┬──────────────────────────┘
           │ 训练经验                         │ 待推演动作
           ▼                                 ▼
 ┌────────────────────┐          ┌────────────────────┐
 │  KnowinDream       │          │  KnowinWorld       │
 │ 生成式经验引擎      │  ──────► │ 动作条件下的世界推演 │
 │ 3D结构 · 物理一致  │          │ 碰撞/接触/可达性    │
 └────────────────────┘          └─────────┬──────────┘
    生成多样化训练数据                        │ 预判/排除无效路径
           ▲                                 ▼
           │                            可执行动作序列
 ┌────────────────────────────────────────────────────────────────────┐
 │  KnowinAgent (Harness): 长程任务编排                                  │
 │  任务分解 · 进度管理 · 反馈接收 · 就地修正 · 精细微调 · 记忆存储       │
 └────────────────────────────────────────────────────────────────────┘
           │
           ▼
      ┌──────────┐
      │ 真实机器人│◄── 环境/本体反馈回流, 驱动 Dream/World/GLOW 迭代
      └──────────┘

值得注意的是,诺因官网(knowinai.com tech页面)对底层能力还有更细粒度的五模块视角:KnowinDream之外,还分化出KnowinBrain(具身认知与策略核心)、KnowinAct(生成式动作编码-解码器,含Action Tokenizer与Action Chunk)与KnowinAgent。9月24日发布的报告将Brain与Act统一进KnowinGLOW,本质上是一次"认知-动作表征对齐"的架构收紧——把"想清楚"与"做到位"放进同一个自回归序列,减少跨模块的信息损耗。理解这一点,就能读懂GLOW在"统一vs模块化"之间选择的张力。

四、KnowinGLOW:让认知与动作共享同一套token

KnowinGLOW是整套架构的核心中枢,它最鲜明的特征是原生统一的自回归设计。传统方案往往把理解与执行拆成两个模型:先用视觉模型识别场景,再用策略网络规划动作,最后交由底层运动控制执行。这种"拼接式"设计的问题在于,视觉表征、语义表征与动作表征各自为政,跨边界传递必然产生信息损耗与衔接延迟。

KnowinGLOW的答案是让视觉理解、语义解析、空间推理、任务规划与动作生成在同一模型内、同一表征体系下完成,理解与动作共享同一套离散token空间。从工程角度看,这意味着它把"看世界"“想策略”"动身体"统一成了一个自回归生成问题:给定观测历史与任务上下文,逐token生成下一阶段的意图与动作。

这种设计的直接收益,是"一次演示、举一反三"的架构基础:当人类演示一次操作(比如擦桌),模型学到的不再是"抹布经过了哪些像素位置"这种表层轨迹,而是一个可复用的目标表征——“把桌面按用户习惯的方式擦干净”。执行时,机器人结合眼前环境、本体状态、任务进展与历史反馈,实时自回归地生成下一步。用报告中的话说,它学习的不是人的手臂经过了哪些位置,而是任务要达到什么目标、物品之间存在什么关系、环境变化后该如何继续央广网。

下面用一个极简的Python伪代码勾勒这种"统一自回归"的核心思路(仅必要变量命名,便于理解数据流):

python

class KnowinGLOW:
    def __init__(self, vocab_size, d_model, n_layers):
        self.embed = nn.Embedding(vocab_size, d_model)
        self.decoder = nn.TransformerDecoder(
            nn.TransformerDecoderLayer(d_model, 8, batch_first=True),
            num_layers=n_layers)
        self.lm_head = nn.Linear(d_model, vocab_size)


    def step(self, obs_tokens, state, hist):
        seq = torch.cat([hist, obs_tokens], dim=1)
        x = self.embed(seq)
        x = self.decoder(x, memory=state.memory)
        logits = self.lm_head(x[:, -1])
        return logits  # 同一自回归头同时产出"意图token"与"动作token"

这里的要点在于:动作token与语义token共用同一词表与同一解码器,从而实现认知与动作在同一概率分布下的联合生成,这正是"生成式"区别于"判别式"的代码层体现。

接下来我们用Go写出一个"状态-动作-世界"三步的闭环调度骨架,展示GLOW在系统层如何把核心大脑与三个支撑模块串成闭环(为贴合实际工程,使用必要结构体与变量):

go


type WorldState struct {
    Objects map[string]string // objectID -> state
    Robot   RobotPose
    Phase   int
}


type GLOWRuntime struct {
    Brain       *AutoregressiveModel
    Dream       *DataGenerator
    World       *PhysicsSimulator
    Agent       *Harness
    ActionSpace []ActionChunk
}


func (g *GLOWRuntime) ExecuteTask(task *Task, obs []Frame) error {
    plan := g.Brain.Plan(task, obs)
    for _, step := range plan.Steps {
        cands := g.World.Rollout(step.ActionSet) // 预判
        safe := g.World.FilterUnsafe(cands)
        chunk := g.Brain.GenerateAction(safe[0])
        if err := g.Agent.Execute(chunk, obs); err != nil {
            g.Agent.Repair(err) // 就地修正
        }
        g.Agent.Record(step)
    }
    return nil
}

五、KnowinDream:让机器人在训练阶段就"见多识广"

传统具身智能的第一个瓶颈是数据。高质量的真机操作数据极度稀缺、采集昂贵且难以覆盖长尾场景。KnowinDream正是为破解这一瓶颈而设的生成式经验引擎。

它的工作方式建立在3D视觉生成模型之上:从有限的真实交互出发,学习场景变化规律、物体交互逻辑与任务执行模式,再合成具备三维结构与物理一致性的Ego-Centric第一人称具身训练数据,覆盖极端光照、复杂材质、多样化布局与长尾上下文中国日报网。

KnowinDream最值得玩味的组织逻辑是它的 “Home×Event×Future” 训练条件三元组机器人大讲堂:

plaintext


图 2:KnowinDream 合成经验的 "Home × Event × Future" 生成流水线


  真实交互样本(极少)
        │
        ▼
 ┌───────────────────────────────┐
 │ Home : 定义交互发生的世界       │
 │  · 家庭类型 / 布局 / 家具分布   │
 │  · 光照 · 材质 · 纹理 · 背景   │
 └───────────────┬───────────────┘
                 ▼
 ┌───────────────────────────────┐
 │ Event : 定义世界中的变化        │
 │  · 物体初始/目标状态            │
 │  · 遮挡 · 干扰 · 摆放扰动      │
 └───────────────┬───────────────┘
                 ▼
 ┌───────────────────────────────┐
 │ Future : 展开行动后的结果       │
 │  · 动作后果 · 状态转移          │
 │  · 成败回放 · 风险边界          │
 └───────────────┬───────────────┘
                 ▼
   批量合成: 3D结构 + 物理一致的 Ego-Centric 数据
        │
        ▼
   注入不同相机视角 / 不同机器人配置 / 不同用户习惯
        │
        ▼
   得到泛化的训练数据分布 → 喂给 KnowinGLOW

这个三元组的关键在于:它把"在哪里发生(Home)"“发生了什么(Event)”"做了之后会怎样(Future)"显式分离并组合成数据分布轴。通过变量化调整光照、材质、纹理与背景,把少量真实经验扩展成覆盖面极广的训练分布,让模型在训练阶段就见过足够多样的世界与变化,从而在真实世界里面对"没见过的盒子、没见过的浇水壶"时依然稳定。

诺因官方透露,其生成式数据能力已获全球顶级学术舞台验证——在CVPR 2026 EgoCross Challenge中,诺因在Source-Limited与Open-Source双赛道同时斩获全球第一中国日报网。这为KnowinDream"以身第一人称数据驱动泛化"的路线提供了来自学术界的佐证。

为了把"Home×Event×Future"的合成管线落到工程层面,下面给出一个Python实现骨架,展示如何从少量真实交互出发,通过组合世界、事件与未来三个轴,批量扩产具备三维结构与物理一致性的第一人称训练样本(仅保留变量命名与主干流程):

python


import numpy as np
from dataclasses import dataclass, field


@dataclass
class HomeContext:
    layout: str          # "living_room"/"kitchen"/"bedroom"
    lighting: float      # 0.3(昏暗) ~ 1.0(明亮)
    material: str        # "wood"/"glass"/"cloth"
    cam_pos: tuple       # 相机视角
    robot_conf: tuple    # 机器人配置(臂长/基座高度)


@dataclass
class EventSpec:
    objects: list        # 初始物体状态表
    goals: dict          # 目标状态映射
    occlusions: float    # 遮挡程度
    perturbations: int   # 摆放扰动次数


class HomeExpansionEngine:
    def __init__(self, real_rollouts, rng=None):
        self.real = real_rollouts
        self.rng = rng or np.random.default_rng(42)


    def sample_home(self):
        return HomeContext(
            layout=self.rng.choice(["living_room", "kitchen", "bedroom"]),
            lighting=round(self.rng.uniform(0.3, 1.0), 2),
            material=self.rng.choice(["wood", "glass", "cloth"]),
            cam_pos=tuple(self.rng.uniform(-1, 1, 2)),
            robot_conf=(self.rng.uniform(0.4, 0.8), self.rng.uniform(0.2, 0.5)),
        )


    def expand(self, n=4096):
        outs = []
        for _ in range(n):
            home = self.sample_home()
            ev = EventSpec(
                objects=[self.rng.choice(self.real["objs"]) for _ in range(3)],
                goals={"target": self.rng.choice(self.real["goals"])},
                occlusions=round(self.rng.uniform(0, 0.4), 2),
                perturbations=int(self.rng.integers(0, 3)),
            )
            sample = self.render_ego(home, ev)   # 3D一致的第一人称帧
            outs.append(sample)
        return outs

同理,KnowinWorld 的"候选动作预判"可以抽象为一次对多候选轨迹的打分与剪枝,下面是该推演单元的核心逻辑:

python


class KnowinWorldRollout:
    def __init__(self, dyn_model, horizon=16):
        self.dyn = dyn_model          # 数据学习到的世界动态模型
        self.horizon = horizon


    def roll(self, state, action_pool):
        scored = []
        for a in action_pool:
            traj = [state]
            cost = 0.0
            s = state
            for _ in range(self.horizon):
                s_pred = self.dyn.step(s, a)
                cost += self.risk(s_pred)
                s = s_pred
                traj.append(s)
            scored.append((cost, a, traj))
        scored.sort(key=lambda t: t[0])
        return [(a, t) for _, a, t in scored[:2]]


    def risk(self, s):
        coll = self.dyn.collision_prob(s)
        stab = 1.0 - self.dyn.contact_stability(s)
        reach = self.dyn.path_unreachable(s)
        return 0.5 * coll + 0.3 * stab + 0.2 * reach

六、KnowinWorld:让机器人"学会预判"的物理推演引擎

如果说KnowinDream解决的是"经验从哪来",那么KnowinWorld解决的是"动作会带来什么后果"。

KnowinWorld是一个基于数据学习得到的可交互世界表示系统,而非传统的物理仿真器。它聚焦空间结构、物体状态、动作影响与任务演化——判断一个动作将如何改变当前环境、任务接下来可能走向哪里。相比"无边界地复刻整个开放世界",GLOW把模型能力集中到真正影响任务成败的信息上,让机器人不仅"看见世界",更能理解如何作用于世界ZAKER/诺因融资报道。

它的工作有两个阶段、两种价值。在训练阶段,KnowinWorld可代替真机完成大量试错推演:让策略在虚拟交互世界中展开动作、评估结果、筛选有效方案,大幅降低真机试错的成本与安全风险。在运行阶段,它能在动作真正执行前预判风险——推演碰撞风险、接触稳定性、路径可达性等物理约束,排除无效路径,既提升执行安全性,又提高决策效率央广网。

plaintext

图 3:KnowinGLOW × KnowinWorld 的感知-规划-执行闭环


                  ┌────────────────────────────────────────────┐
   观测(相机/本体) │                                                │
  ───────────────►│  KnowinGLOW: 理解场景 + 长程规划 + 生成候选动作  │
                  │       │                                        │
                  │       ▼                                        │
                  │  ┌───────────────────────┐                    │
                  │  │ KnowinWorld 世界推演    │                    │
                  │  │ 推演碰撞/接触/可达性    │                    │
                  │  │ 评估动作后果            │                    │
                  │  └───────────┬───────────┘                    │
                  │               │ 安全的动作序列 + 风险标注        │
                  │               ▼                                │
                  │  KnowinAgent(Harness): 下达并管理执行           │
                  └────────┬───────────────────────────────────────┘
                           ▼
                      ┌─────────┐
                      │  真实机器人│──► 执行反馈/失败信号 ──► 回流(RL/偏好对齐)
                      └─────────┘

需要强调:KnowinWorld与KnowinDream之间不是孤立的。二者构成双引擎自增强闭环——World提供结构约束,Dream生成更优数据分布,每一次真实执行中的反馈又回流至两者,驱动整个系统迭代升级中国日报网。这正是GLOW区别于"数据-模型单向链路"的关键:它是一个"生成世界—理解世界—作用于世界—真实反馈"的可持续循环。

七、KnowinAgent(Harness):让长程任务不"断片"

具身智能的难点不只在于"会不会做动作",更在于"能不能把一个多步骤长程任务连贯做完"。人们常忽视的一点是,真实家庭任务(洗衣服→叠衣服→收纳、调酒→取杯→倾倒→回正→放回)往往长达数十步,任何一步的执行偏差都可能让后续全部失控。传统方案一旦中途出错,只能从头重来。

KnowinAgent(上层又称Harness)正是为破解"长程任务断片"而设的上下文驱动任务运行系统。它负责全程管理任务进度、执行反馈与动态调整:持续记录执行节点、接收实时反馈,出现偏差时在当前进度上就地修正,而无需从头重启任务;当接近瓶口、碗沿、抽屉把手等精细操作区域时,自动切换为小幅微调模式,边观察边校准,保障长程任务连贯、稳定、精准地完成央广网。

我们可以用Go描述Harness的"就地修正+精细微调"状态机核心逻辑,比照真实工程中的容错调度:

go

type Harness struct {
    Nodes   []TaskNode
    Cursor  int
    memory  *HomeMemory
    watch   *VisionMonitor
}


func (h *Harness) Run(done chan bool) error {
    for h.Cursor < len(h.Nodes) {
        n := h.Nodes[h.Cursor]
        if err := h.execute(n); err != nil {
            h.Recover(n, err) // 就地修正,不重启
            continue
        }
        if h.watch.IsFineGrain(n.Region) {
            h.Calibrate(n) // 精细区域微调模式
        }
        h.Cursor++
    }
    done <- true
    return nil
}

除了过程管理,KnowinAgent还承担长期记忆与演进职责:存储家庭布局、物体位置、任务历史、用户习惯与偏好,将一次操作编码为可复用技能信息,供后续任务调用。这使得机器人能在"使用中学习"——每一次完成任务都在沉淀下一次面对陌生场景时的可用资产。

八、生成式学习 vs 传统范式:本质差异与竞争力

理解了四个模块,我们可以把GLOW的生成式学习范式与传统"采集数据、模仿执行"路线做一个系统对比。

诺因官方明确点出了这个差异:相比行业主流路线,GLOW多了三步——用生成式数据扩展训练规模、在虚拟世界中展开探索试错、将每次执行结果反馈回系统持续修正中国日报网。

plaintext

图 4:生成式学习范式 vs 传统模仿/判别式范式对比


维度          传统模仿/判别式范式        GLOW 生成式学习范式
───────────  ──────────────────────   ─────────────────────────────
数据来源      真机采集、行为克隆          真实经验 + Dream 合成(3D一致)
学习目标      复现训练过的动作映射        生成任务目标/动作序/未来状态
世界理解      隐式、随样本退化            显式 KnowinWorld 预判后果
任务泛化      需为每任务重训/写流程       一次演示, 跨物/跨境/跨任务复用
跨本体迁移    难(动作空间绑定单机体)      物体关系/目标优先, 可迁移重映射
长程执行      易断片、出错需重启          Harness 就地修正 + 微调
成本曲线      数据边际成本高              合成数据边际成本趋近于零
持续演进      单向模型链路               真实反馈回流, 双引擎自增强闭环

这张对比表揭示了一个深层判断:传统范式把"泛化"当作一个单点模型指标去优化,而GLOW把泛化当作一项贯穿数据、世界理解、任务规划、动作执行与真实反馈的系统能力。这正是生成式学习范式在具身智能上最本质的竞争力——它不是某一块变得更强,而是整个学习回路被重新组织成了"生成式"的。

九、跨本体与跨场景迁移:GLOW的工程含义

"一教就会"如果只在同一台机器、同一件物品上成立,那不过是一次好的过拟合。GLOW真正值得关注的是它的跨本体迁移能力。

plaintext

图 5:跨物体/跨环境/跨任务复用拓扑


               一次人类完整演示(单个任务, 单件物品)
                          │
                          ▼
                GLOW 编码为可复用技能信息
              (目标表征, 非轨迹表征)
                          │
          ┌───────────────┼───────────────┐
          ▼               ▼               ▼
   ┌────────────┐  ┌────────────┐  ┌────────────┐
   │ 跨物体复用  │  │ 跨环境复用  │  │ 跨任务复用  │
   │ 换盒/换壶   │  │ 换光照/布局 │  │ 组合已有技能│
   │ 换抹布      │  │ 换户型      │  │ 调用新技能  │
   └────────────┘  └────────────┘  └────────────┘
          │               │               │
          └───────────────┴───────────────┘
                          │
                          ▼
           不同机器人配置 / 不同相机视角下的重映射执行

从实操案例看:浇水任务中,教学用的是黑色细嘴壶,执行时换成绿色浇水壶,机器人依然顺利完成——GLOW会把演示中"抓握方式、对准角度、倾斜幅度"等核心逻辑映射到全新器具上,自主调整抓取位置与动作姿态机器人大讲堂。擦桌任务中,用户沿心形轨迹移动抹布,机器人看过一次就能复现同样的心形擦拭——这说明GLOW不仅学到了"擦桌子"这一任务,还捕捉到了"怎样擦"这一****个性化操作特征**。

这些案例验证了GLOW学习表征的抽象层级:它学的是物体之间的关系与任务目标,而非某一件具体物品、某一条具体轨迹。编码层面,KnowinAct的Action Tokenizer从KnowinDream数据中学习可泛化的动作表征,解码为边缘端可直接执行的Action Chunk,实现"高阶策略→平滑物理动作"的转换,从而让一只手臂学到的能力能在另一组运动学参数上重映射。

十、评测体系与硬指标:三项第一到底意味着什么

技术路线之争最终要靠可量化评测来裁决。诺因报告披露了GLOW在三项国际主流具身评测中的成绩,也是其"连续三项第一"的依据央广网:

plaintext

图 6:GLOW 评测体系与成绩一览


┌────────────────────────┬────────────────────────────┬─────────────┐
│ 评测基准                 │ 核心指标                     │ GLOW 成绩    │
├────────────────────────┼────────────────────────────┼─────────────┤
│ RoboDojo(18项仿真任务)   │ 平均成功率                   │ 62.2% · 第一 │
│                        │ 平均得分                     │ 71.1分       │
│ LIBERO-Pro(六个扰动分项) │ Object/Goal/Spatial          │ 86.7% · 第一 │
│                        │ 单策略模型平均成功率           │             │
│ Embodied Arena         │ 2D-Embodied QA 综合得分      │ 65.62 · 第一 │
│ (20个参评模型)            │ (KnowinBrain-1.5)            │             │
└────────────────────────┴────────────────────────────┴─────────────┘


补充:RoboDojo 成绩较 GPT-6(Robocurve) 基线高出 40 个百分点成功率、41.3 分

具体来看:在RoboDojo的18项仿真任务中,GLOW取得62.2%的平均成功率和71.1分的平均得分,较GPT-6(Robocurve)基线分别高出40个百分点和41.3分南方+;在LIBERO-Pro的Object、Goal与Spatial六个扰动分项中,GLOW独立运行的平均成功率达到86.7%,位列单策略模型第一;在Embodied Arena的2D-Embodied QA Benchmarks榜单中,KnowinBrain-1.5以65.62的综合得分位列20个参评模型第一科技日报。

诚然,评测设置由诺因自己披露,横向对比的基础(是否同prompt、同数据、同算力)需要审慎看待;但"物理任务执行(RoboDojo)+ 泛化扰动(LIBERO-Pro)+ 具身场景问答(Embodied Arena)"三个不同维度的第一,确实在同一方向上相互印证——GLOW不仅理解物理场景,还能把理解转化为有效的任务执行。这也正面回应了"通用大模型是否已能替代专业具身模型"的争论:通用模型拓展智能的认知边界,而专业具身模型以物理交互为核心,二者是互补而非取代南方+。

十一、与行业方案的横向对比:VLA、World Model与GLOW

要判断GLOW的独特性,还需把它放到VLA(Vision-Language-Action)与世界模型(World Model)的坐标系中。

VLA路线(如谷歌RT系列)把视觉、语言、动作端到端地融合进一个模型,是近年来具身智能的主流。GLOW与VLA的最大区别在于对"世界"的处理:经典VLA往往是"感知→策略"的直接映射,世界理解是隐式的,随训练分布退化;而GLOW把KnowinWorld作为显式的物理推演单元,在动作生成前先"预判后果",相当于在VLA之上叠加了一个可校验的世界约束层。

World Model路线(如Sora等生成式世界模型)把重点放在"生成未来帧/未来世界"上,希望以视频生成驱动具身决策。GLOW的KnowinWorld与其部分同源(都强调从数据学习世界的动态表示),但GLOW刻意把能力"集中到真正影响任务成败的信息上",而不是无边界地复刻整个开放世界——这是一种工程上的务实取舍:与其生成完整的高保真视频,不如精准预测"这个动作会不会撞到、能不能稳定接触、路径可不可达"。

plaintext

图 7:GLOW vs 经典 VLA vs 生成式世界模型(World Model) 范式定位


                   纵轴: 生成"画面级未来"
                   ▲
                   │
        World Model│        ◄──── GLOW 综合定位
         (视频生成) │           (显式世界推演 + 统一自回归)
                   │                    ▲
                   │                    │ 生成"目标/动作/后果"
   ────────────────┼────────────────────┼───────────────► 生成粒度
   经典 VLA        │                    │
   (隐式世界映射)   │                    │
                   │                    │
                   ▼                    │
   横轴左端: 判别式"状态→动作"        │ 显式可校验的世界约束

简单说:VLA解决了"如何让一个模型同时理解语言与产出动作",World Model解决了"如何预测世界",而GLOW试图把两者在"生成式"这个统一框架下合并,并补上长程编排的Harness这一环。这是它在架构上相对主流方案的差异化所在。

十二、企业背景与产业化:从模型到家庭的最后一公里

架构先进不等于产品成功。GLOW想要抵达的真实目的地,是"进入每一个家庭"。诺因智能成立于2025年8月,总部在深圳,聚焦消费级家庭场景研发通用具身大模型,截至2026年中研发团队超200人,90%来自常春藤、清华、北大及C9等顶尖院校ZAKER。

在资本端,诺因于2026年8月宣布完成5亿元人民币"天使++"轮融资,由经纬创投领投,红点创投、商汤国香资本、华登科技、光源创业者基金等跟投诺因融资报道。这笔资金明确指向GLOW生成式具身大模型的研发与Knowin-X1的量产准备。

在产品端,首款机器人Knowin-X1采用全折叠双臂构型:折叠后高度控制在40厘米以内,收纳体积仅为同类产品的几分之一;展开后双臂可覆盖桌面、地面、柜体三类核心家庭操作面,承担洗衣、叠衣、搬运、收纳等完整家庭任务链。其折叠构型不是"把机器人做小",而是在保持完整双臂负载能力的前提下做到极致可收纳——这本身就是一项工程极限跃迁中国日报网WAIC报道。

在WAIC 2026上,Knowin-X1在真实家庭场景(灯光持续变化、观众随机挪动物品、人流遮挡)中现场完成了桌面收纳、洗衣闭环与衣物折叠三项全链路任务,全程依赖自然语言交互,无遥控无人工干预中国日报网。产品预计2027年正式上市,定位"数万元"价格带。

plaintext

图 8:GLOW 从模型到产品到真实反馈的产业化飞轮


  GLOW 模型系统 ──► 驱动 Knowin-X1 硬件本体
       ▲                    │
       │                    ▼
       真实家庭任务执行(Sorting/Laundry/Folding/调酒...)
       ▲                    │
       │                    ▼
  经验回流: 成功/失败/偏差 ──► 双引擎(World/Dream)迭代 ──► 模型进化

十三、冷思考:GLOW范式面临的真实挑战

作为一篇技术博客,我们也有必要对GLOW保持建设性的审慎。即便四项模块的设计逻辑相当自洽,仍有几个问题需要时间与更大规模部署来回答:

其一,合成数据的物理一致性边界。 KnowinDream通过扩大量与多样性来逼近真实,但合成数据与真实物理之间的域差(domain gap)仍是具身智能的经典难题。当训练分布过度依赖合成经验时,极端长尾的真实物理现象(打翻液体、毛发缠绕、绳结)能否被可靠覆盖,需要更大规模的实测数据。

其二,"一教就会"的上限。 报告展示的场景(开盒收纳、浇水、擦桌、调酒)都属于结构相对清晰的家庭任务。面对高度非结构化、需要深度物理推理与多轮创造性的任务(烹饪、维修、照料),"一次演示"是否依然成立,尚不确定。诺因对消费者也保持着"演示教学而非出厂即全能"的诚实定位资本报道——这既是对泛化边界清醒认知,也是产品化前的务实收敛。

其三,自回归动作生成的长程累积误差。 统一自回归虽然消除了跨模块损耗,但token级自回归在超长任务序列上不可避免地存在误差累积。Harness的就地修正能在一定程度上缓解,但"边生成边犯错边修正"的算力与延迟代价,在边缘端实时运行(Action Chunk需在本地转换为平滑臂部运动)时是否可接受,是工程化必须攻克的关隘。

其四,评测的可比性。 对标的基线(如GPT-6 Robocurve)在提示词、数据与算力上是否一致,报告并未充分展开,横向比较需谨慎采信。

十四、结语:具身智能的下半场,看的不是demo而是回路

综观GLOW架构,它给出的未必是终极答案,但确实是一份高质量的路线样本:用统一的生成式自回归对齐认知与动作,用KnowinDream打破数据稀缺的天花板,用KnowinWorld把世界从"被感知"升级为"被推演",用KnowinAgent/Harness守住长程任务的连续性——四者通过"真实反馈回流"被焊接成一个可持续自增强的学习闭环。

从"复现训练过的动作"走向"解决没有完整见过的任务",是具身智能从舞台demo走向真实家庭的关键一跃。GLOW的价值正在于它率先把这一跃迁所需的数据、世界、行动与反馈四大要素,组织成了一个可迭代的"生成式回路"。具身智能竞争的下半场,真正起决定性作用的或许不再是某一次惊艳的演示视频,而是谁能让机器在不断的使用中,把每一次真实的错误都转化成为下一次泛化的养料。

“让机器人从数据中生成本领”,这句诺因对GLOW的概括,恰恰点破了2026年具身智能最深层的范式转向:当模型自回归地生成动作、生成世界、生成经验时,机器人学习的不再是"照搬",而是"生成"。而"生成"二字,正是迈向通用具身智能的那把钥匙。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐