论文标题: τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
论文地址: https://arxiv.org/abs/2608.16885
作者单位: Shanghai Innovation Institute; Agibot Finch; The Chinese University of Hong Kong
发表时间: 2026年8月17日


背景知识

在深入解读 τ0-VLA 之前,有必要先厘清几个核心概念。

什么是 Hierarchical VLA(分层视觉-语言-动作模型)? 分层 VLA 将长程机器人控制解耦为高层策略和低层策略两个层次。高层策略负责生成语义子任务(如"拿起勺子"、“放置杯子”),低层策略负责将子任务映射为具体的机器人动作序列。这种分层架构使机器人能够在长程任务中进行抽象推理和进度跟踪,而不必在每一步都直接从原始像素和语言指令推断电机命令。τ0-VLA 中的高层策略进一步引入了测试时计算扩展能力,使推理预算可以根据每个决策的难度自适应调整。

什么是 Test-Time Computation(TTC,测试时计算)? 测试时计算指在推理阶段分配额外的计算资源来提升决策质量,而非仅依赖单次前向传播。在语言模型领域,这表现为通过链式思考、验证或搜索来改进输出。在 τ0-VLA 中,TTC 被引入到机器人高层策略:当提案模型对直接生成的子任务不够自信时,系统触发额外的 propose–predict–evaluate 循环——生成多个候选子任务、用世界模型预测每个候选的视觉结果、用价值模型评分,并通过束搜索递归扩展有前景的分支。这允许计算预算随决策难度和后果严重性而扩展。

什么是 World-Model-Guided Search(世界模型引导搜索)? 这是 τ0-VLA 的核心推理机制。在每次 TTC 触发时,系统执行一个 propose–predict–evaluate 循环:提案模型 PPP 生成开放式候选子任务;世界模型 WWW 接收当前头部相机图像和候选子任务,预测执行该子任务后的终端视觉结果;价值模型 VVV 根据全局任务指令、候选子任务和预测图像,输出标量质量分数。束搜索在此基础上递归扩展高分分支,而反思模型 FFF 最终基于保留分支生成决策。与仅在执行后验证结果的方法不同,世界模型在承诺执行前就评估候选后果。

什么是 Execution Memory(执行记忆)? 执行记忆是高层策略维护的一个状态摘要,记录已完成的阶段、当前进度和活跃子任务的细节。它使策略能够跟踪长程任务的执行历史,避免重复执行已完成的步骤或跳过必要的前置步骤。τ0-VLA 的关键创新是可纠正的记忆机制:训练时故意扰动记忆(使其滞后、超前或错误表征进度),然后训练策略根据视觉证据修复这些错误。这使系统对部署时的记忆错位具有鲁棒性。

什么是 Unified State and Action Space(统一状态动作空间)? τ0-VLA 的低层策略使用一个共享的 40 维状态动作空间,涵盖左右末端执行器位姿(位置+Rot6D 朝向)、夹爪开合、腰部姿态、平面基座速度、左右臂关节角。通过每样本的状态和动作掩码选择有效通道,同一模型可以支持固定底座操作、双臂协调和移动全身控制等多种机器人形态,无需为每种形态设计专门的输出头。

什么是 Masked Flow Matching(掩码流匹配)? 低层策略的训练目标。由于不同形态在统一动作空间中占据不同通道,τ0-VLA 在流匹配路径和训练目标上都应用掩码:仅对活跃通道计算速度场损失,非活跃通道在每次速度场评估前和最终输出后都被投影置零。这使得同一流模型可以学习异构控制接口,而不会受到缺失通道的干扰。


一、背景:为什么需要 τ0-VLA?

1.1 长程机器人操作的根本瓶颈

长程操作(如打扫房间、做饭、泡茶)要求机器人在数分钟甚至数小时内连贯执行一系列子任务。这类任务的本质不仅是长序列运动指令,更是一系列关键决策的序列。错误的高层子任务选择通常无法通过更精确的底层运动控制来纠正——机器人可能完美地执行了错误的子任务,导致环境进入不可逆的错误状态。因此,长程执行的核心瓶颈不再是分层动作接口的可用性,而是生成下一个子任务的推理过程本身

现有方法面临三个核心挑战:

  • 固定计算预算的决策局限:大多数分层 VLA 系统对每个高层决策使用单次前向传播,既不比较替代子任务,也不通过它们预期产生的物理状态来评估后果。这导致在关键决策点上无法分配额外计算,容易在歧义状态下做出错误承诺。
  • 动作级搜索的视野局限:动作级搜索(如 MCTS、值引导采样)可以解析局部控制歧义,但通常只暴露局部物理后果,难以评估跨越多个子任务的长程影响。
  • 纯语言推理的接地缺失:仅依赖语言推理规划子任务序列,虽然能操作长程时域,但无法将替代方案锚定到它们会产生的实际物理状态。模型可能在语义上合理的子任务之间选择,但忽略了视觉和物理上的可行性。

1.2 现有方法的结构性盲区

  • 执行后验证的被动性:近期一些系统使用世界模型生成子目标图像来指导低层策略执行,但视觉预测发生在子任务已经产生之后,用于条件化执行而非选择子任务。τ0-VLA 将视觉预测前置到承诺之前,支持对多个候选子任务的后果进行主动比较。

  • 缺乏可扩展的推理机制:虽然已有研究将树搜索应用于高层机器人决策(如基于场景图的成功概率预测、离散操作计划的值引导束搜索),但这些方法通常搜索结构化或离散化的子目标空间。τ0-VLA 首次将开放式语言子任务搜索视觉结果预测执行记忆结合在通用真实机器人层次结构中。

  • 记忆机制的脆弱性:现有系统的执行记忆通常被动记录历史,缺乏对记忆错误(如滞后、超前、失败未察觉)的主动修复能力。在长程执行中,记忆漂移是常见问题,没有自我纠正机制的系统会在错误记忆上累积错误决策。

τ0-VLA 的核心洞见是:高层子任务生成应被表述为计算可扩展的推理问题,在承诺执行前通过世界模型预测和评估候选后果,同时维护一个可纠正的执行记忆来跟踪长程进度。这要求系统具备四个能力:自适应的推理预算分配、物理接地的候选评估、记忆扰动下的鲁棒性、以及跨形态的统一低层控制接口。


二、核心创新:世界模型引导的测试时计算与分层控制

τ0-VLA 的技术精髓可以概括为:将高层子任务生成表述为计算可扩展的推理问题,通过世界模型引导的 propose–predict–evaluate 循环在承诺前评估候选子任务的视觉后果,利用可纠正的执行记忆跟踪长程进度,并以统一 40 维状态动作空间和掩码流匹配训练的低层策略实现跨形态通用控制

2.1 高层策略:世界模型引导的测试时计算

高层策略 μ\muμ 由四个模型组成:提案模型 PPP、世界模型 WWW、价值模型 VVV 和反思模型 FFF

提案模型与自适应路由。在每个推理步骤 ttt,提案模型接收上下文 ht=(ℓ,Mt−1,zt−1⋆,ot)h_t = (\ell, \mathcal{M}_{t-1}, z_{t-1}^\star, o_t)ht=(,Mt1,zt1,ot)(任务指令、执行记忆、上一步子任务、当前观测),更新执行记忆并生成直接提案 ztdirz_t^{dir}ztdir。同时,从该前向传播的 token 置信度统计中计算路由决策 gt∈{0,1}g_t \in \{0,1\}gt{0,1}
gt=1[utall≤δall∨utmem≤δmem]g_t = \mathbf{1}\left[u_t^{all} \leq \delta_{all} \lor u_t^{mem} \leq \delta_{mem}\right]gt=1[utallδallutmemδmem]
其中 utallu_t^{all}utall 是生成 token 的平均概率,utmemu_t^{mem}utmem 是记忆字段的平均 logit 边际。当 gt=0g_t=0gt=0 时走快速路径,直接使用提案;当 gt=1g_t=1gt=1 时触发 TTC。

Propose–Predict–Evaluate 循环。TTC 执行束搜索(分支因子 NNN,束宽 BBB,深度 DDD):

  1. Propose:对每个保留分支,独立调用提案模型 NNN 次生成候选子任务
  2. Predict:世界模型 W(o~(b),z)W(\tilde{o}(b), z)W(o~(b),z) 预测执行候选后的终端头部相机图像
  3. Evaluate:价值模型 V(ℓ,z,o^)V(\ell, z, \hat{o})V(,z,o^) 输出候选质量分数 v∈[0.05,0.95]v \in [0.05, 0.95]v[0.05,0.95](五档序数映射)
  4. Expand:累积分数 S(b⊕z)=S(b)+vS(b \oplus z) = S(b) + vS(bz)=S(b)+v,全局保留 top-BBB 分支
  5. Reflect:反思模型 F(hˉt,Ct)F(\bar{h}_t, \mathcal{C}_t)F(hˉt,Ct) 基于保留分支摘要和真实上下文生成最终子任务,输出不受限于候选集

深层意义:子任务是推理的自然单元——足够稀疏以证明额外计算的合理性,又足够时间延展以在环境中产生有意义且可区分的变化。通过预测终端视觉结果来比较候选子任务,系统可以在物理接地的基础上做出决策。

2.2 可纠正的执行记忆

τ0-VLA 的记忆机制不仅记录历史,还训练了自我修复能力。训练数据通过五种实例家族自动构造(无需额外标注):

家族 采样位置 输入→目标记忆 目标子任务 应对的失败
within-subtask 段内任意 Mn→MnM_n \to M_nMnMn nnn 正常推进(58%)
transition 段尾 Mn→Mn+1M_n \to M_{n+1}MnMn+1 n+1n+1n+1 完成后启动新子任务(15%)
catch-up 段首 Mn−1→MnM_{n-1} \to M_nMn1Mn nnn 记忆滞后(10%)
rollback 段末 Mn+1..n+3→MnM_{n+1..n+3} \to M_nMn+1..n+3Mn 重试段 nnn 记忆超前(12%)
error-think 标注失败帧 Mn→M_n \toMn 类型依赖 恢复步骤 未察觉执行失败(5%)

通过仅扰动输入记忆而保持纠正后的目标,策略学会在执行前将记忆与视觉证据协调。可恢复失败(如空抓)直接重试,撤销先前进度的失败(如掉落物体)触发回滚到前子任务。

2.3 低层策略:统一动作空间与掩码流匹配

低层策略将预训练的视觉语言主干与 MoT(Mixture-of-Transformers)动作专家耦合。在每一全注意力层,动作 token 和主干 token 通过联合注意力交互,但由独立参数化的 Transformer 流处理。

统一 40 维状态动作空间

  • 左右末端执行器位姿(位置 + Rot6D 朝向):各 9 维
  • 左右夹爪:各 1 维
  • 腰部:2 维
  • 平面基座速度:2 维
  • 左右臂关节:各 8 维
  • 总计 40 维,通过每样本掩码选择有效通道

掩码流匹配:使用线性高斯流路径的反向时间重参数化。对于动作块中的每个向量,插值和速度目标为:
at+jτ=τMϵt+j+(1−τ)Mat+j,ut+j=M(ϵt+j−at+j)\mathbf{a}_{t+j}^\tau = \tau \mathbf{M}\boldsymbol{\epsilon}_{t+j} + (1-\tau)\mathbf{M}\mathbf{a}_{t+j}, \quad \mathbf{u}_{t+j} = \mathbf{M}(\boldsymbol{\epsilon}_{t+j} - \mathbf{a}_{t+j})at+jτ=τMϵt+j+(1τ)Mat+j,ut+j=M(ϵt+jat+j)
仅监督活跃通道,在每次速度场评估前和最终输出后对非活跃通道进行掩码投影。

2.4 训练数据与三阶段训练

低层策略数据:约 40,115 小时异构真实世界数据,包括固定底座、移动和双臂形态的遥操作演示、自主策略 rollout 和 UMI 风格记录,涵盖操作、导航和全身协调。与多模态视觉语言数据(指令跟随、视觉定位、空间深度推理)共同训练。

三阶段训练

  1. 知识隔离共训练:MoT 动作专家关注 VLM 主干,但动作损失梯度在主干接口处被阻断,保护预训练知识
  2. 端到端共训练:移除知识隔离,允许动作梯度调整主干表示
  3. 任务特定适应:在少量任务特定演示上微调

高层策略数据:从现有任务/阶段/可执行子任务标注和多视角分段演示中自动派生。世界模型用子任务对齐的起止帧训练;价值和反思模型在由提案模型和世界模型递归生成的离线模拟 rollout 上训练。


三、实验验证:真实世界长程任务与跨形态部署

3.1 整体系统评估:四个长程任务

在 AGIBOT G1 人形机器人上评估四个长程家庭任务(每个 10 次独立物理试验):

任务 GR00T N1.7 LingBot-VLA π0.5 τ0-VLA (直接) τ0-VLA (分层, Plan Once)
Clean Room SR 0/10 0/10 4/10 4/10 5/10
Prepare Ingredients SR 1/10 0/10 2/10 2/10 4/10
Tomato and Egg Stir Fry SR 0/10 0/10 0/10 0/10 4/10
Make Milk Tea SR 0/10 0/10 3/10 5/10 5/10
平均 SR 2.5% 0% 22.5% 27.5% 45.0%
平均 Progress 45.3% 44.4% 73.1% 80.1% 87.9%

关键发现:

  • 分层系统显著提升长程成功率:平均成功率从直接执行的 27.5% 提升至 45.0%,进度从 80.1% 提升至 87.9%
  • 执行记忆的价值:Clean Room 中,无记忆的系统在房间转换时丢失进度;Prepare Ingredients 中早期错误(如取蛋失败)阻塞后续阶段,记忆跟踪尤为关键
  • Tomato and Egg Stir Fry 的盐调味瓶颈:加盐几乎不产生可见变化,仅依赖当前观测无法判断该步骤是否已完成。分层系统通过记录调味进度解决这一歧义

3.2 测试时计算实验:准确率与闭环成功率

开环子任务预测准确率(图 4):

任务 Plan Once Best-of-N TTC (Ours)
Make Milk Tea 64.7% 70.0% 87.3%
Book Organization (In-Domain) 66.0% 83.0% 88.0%
Book Organization (OOD) 50.0% 57.5% 74.0%
Clean Room 72.0% 74.0% 87.0%

关键发现:

  • TTC 在所有设置上均达到最高准确率,尤其在 OOD Book Organization 上,TTC(74.0%)比 Plan Once(50.0%)提升 24 个百分点
  • Best-of-N 虽然使用相同的世界模型和价值模型评估采样候选,但仅执行一步选择而无多步扩展和反思承诺,其增益始终小于 TTC
  • OOD 设置中初始书籍排列未在训练数据中出现,直接微调 VLM 预测更容易出错;TTC 通过决策时的后果评估而非仅依赖微调期间学习的模式来改善预测

闭环物理机器人评估(表 III):

任务 Plan Once SR TTC SR Plan Once Progress TTC Progress
Make Milk Tea 5/10 7/10 91.92% 95.38%
Book Organization 6/10 9/10 66.67% 93.33%
Clean Room 5/10 7/10 94.80% 97.60%

TTC 在所有评估任务上均提升了任务成功率和进度,证明开环准确率增益成功转化为闭环执行效果。

计算成本与准确率关系(图 5):

  • 准确率随测试时计算增加而快速上升,随后边际增益递减并趋于饱和
  • 拟合饱和指数函数显示:TTC 在中等计算预算下提供有利的计算-准确率权衡,收益最终饱和
  • Make Milk Tea 和 Book Organization 均表现出这种"低计算区快速上升、高计算区边际递减"的模式

3.3 跨形态直接执行评估

在短程任务上评估低层策略的跨形态泛化(无高层策略,直接执行完整指令):

任务 GR00T N1.7 LingBot-VLA π0.5 τ0-VLA
Collect Laundry SR 4/10 2/10 9/10 10/10
Tidy Makeup Table (Cotton Pad) 10/10 9/10 9/10 10/10
Tidy Makeup Table (Eyelash Curler) 8/10 3/10 8/10 9/10
Tidy Makeup Table (Makeup Puff) 7/10 3/10 7/10 10/10

关键发现:

  • τ0-VLA 在 Collect Laundry 上达到 10/10 成功率,GR00T 和 LingBot-VLA 分别在抓取和导航上失败
  • Tidy Makeup Table 基准测试语言条件下的指令跟随:LingBot-VLA 倾向于选择视觉邻近物体而非指令目标,GR00T 偶尔在抽屉运动中暂停或选错物体,π0.5 有时重新抓取或犹豫。τ0-VLA 在三个任务组上均表现最佳
  • 统一动作空间和掩码流匹配使同一模型能够在三种不同形态(人形移动、双臂、Franka)上可靠执行

3.4 执行记忆消融

在四个长程任务上对比有/无执行记忆的分层系统:

  • Clean Room:无记忆时失败集中在手提包挂放和后续房间整理,有记忆时系统能跨房间转换保持进度
  • Prepare Ingredients:早期错误(取蛋、打蛋、搅拌)阻塞大量下游进度,记忆跟踪对前置阶段尤为宝贵
  • Tomato and Egg Stir Fry:盐调味步骤几乎无视觉变化,无记忆系统反复加盐或跳过,有记忆系统记录调味进度解决歧义

四、学术洞见:τ0-VLA 揭示了哪些深层规律?

洞见一:子任务是推理的自然单元——介于动作搜索和纯语言规划之间

动作级搜索暴露的仅是局部物理后果,难以评估跨越多个动作的长程影响;纯语言推理虽能操作长程时域,但无法将替代方案锚定到物理状态。τ0-VLA 证明:子任务恰好位于这两个极端之间的"甜蜜点"——足够稀疏以证明额外计算的合理性,又足够时间延展以在环境中产生有意义且可区分的视觉变化。通过世界模型预测子任务的终端图像来评估候选,系统获得了物理接地的长程推理能力。

洞见二:视觉预测应前置到承诺之前,而非仅用于执行条件化

现有层次系统中,世界模型通常在子任务生成后用于条件化低层执行(如生成子目标图像指导策略)。τ0-VLA 将视觉预测前置到承诺执行之前,使其成为选择机制而非仅执行机制。这一转变的根本意义在于:错误决策的成本在承诺前为零,在承诺后可能不可逆。通过在"做"之前"想象",系统避免了执行错误子任务带来的环境修改成本。

洞见三:记忆的鲁棒性比记忆的完美性更重要

τ0-VLA 没有追求绝对正确的记忆,而是训练了记忆修复能力。通过五种扰动家族(滞后、超前、失败未察觉等)的训练,策略学会在执行前将记忆与视觉证据协调。这揭示了一个工程原则:在长程自主系统中,记忆漂移是不可避免的,关键不是防止漂移,而是检测并修复漂移。12% 的回滚实例和 5% 的错误思考实例表明,系统被显式训练以应对这些现实部署中的常见失败模式。

洞见四:跨形态通用控制需要统一表示而非统一输出头

τ0-VLA 通过 40 维统一动作空间和掩码机制,使同一模型支持固定底座、双臂和移动全身控制,无需形态特定的输出头。其深层洞见是:异构性应在输入/表示层统一,而非在输出层拆分。通过掩码流匹配,缺失的通道被简单地"忽略"而非"移除",这使得模型能够学习跨形态的共享表示,同时仅在相关通道上产生控制信号。40,115 小时的异构数据训练证明,这种统一表示足以支持跨形态泛化。

洞见五:测试时计算在机器人领域遵循与 LLM 相似的扩展规律

图 5 中的饱和曲线显示,子任务预测准确率随计算预算增加而快速上升后边际递减,这与 LLM 中观察到的 test-time scaling law 高度相似。关键区别在于:τ0-VLA 的"推理"不是生成更多 token,而是搜索更深、评估更多候选、反思更多分支。这表明计算可扩展的推理是一种跨域通用原则——不仅适用于文本生成,也适用于物理决策。但机器人领域的饱和可能来得更快,因为物理环境的约束比语言空间的约束更严格。


五、局限性与未来方向

论文坦诚讨论了以下局限:

  1. 世界模型的视觉预测范围:当前世界模型仅预测头部相机 RGB 图像,未覆盖多视角观测或深度信息。对于需要全身协调或精细手眼协调的子任务,单视角预测可能不足以评估后果。

  2. TTC 的计算开销:虽然 TTC 在中等预算下提供有利的计算-准确率权衡,但束搜索的延迟(约 1 秒级)限制了其在需要快速反应场景中的应用。异步流水线缓解了这一延迟,但极端实时任务仍可能受限于搜索深度。

  3. 任务范围的限制:评估集中在家庭操作任务上,工业装配、户外导航或人机协作等更广泛的任务域未覆盖。特别是涉及 deformable objects(如叠衣服)或流体操作(如倒水)的任务对世界模型提出了更高要求。

  4. 价值模型的粒度:价值模型输出五档序数分数,虽然足以进行分支排序,但可能无法捕捉子任务质量的细微差异。更细粒度的连续值预测或成对比较可能进一步提升搜索效率。

  5. 失败恢复的深度:当前记忆修复机制主要处理单步错误(如记忆滞后一步)。对于多步累积错误或级联失败(如错误子任务导致物体位置改变,进而影响后续所有子任务),系统的恢复能力尚未充分验证。

  6. 模拟 rollout 与真实部署的差距:价值和反思模型在由提案模型和世界模型生成的离线模拟 rollout 上训练。当世界模型在分布外场景上的预测质量下降时,价值模型可能继承这些误差。

未来方向包括:

  • 多模态世界模型:将深度、触觉、力反馈纳入世界模型的预测范围
  • 在线学习与自适应:在部署过程中根据真实执行结果持续更新世界模型和价值模型
  • 更高效的搜索算法:探索 MCTS、A* 等替代搜索策略,或学习神经网络策略来指导搜索
  • 长期自主与开放域:将系统扩展到数小时乃至数天的持续自主操作,处理开放式任务目标
  • 人机协作中的 TTC:在共享工作空间中,利用 TTC 预测人类反应并生成安全且高效的协作子任务

六、核心思想总结与可借鉴点

τ0-VLA 的核心思想可以用一句话概括:将高层子任务生成表述为计算可扩展的推理问题,通过世界模型引导的 propose–predict–evaluate 循环在承诺前评估候选后果,以可纠正的执行记忆跟踪长程进度,并以统一动作空间和掩码流匹配训练的低层策略实现跨形态通用控制。这个原则背后,是四层可迁移的方法论:

  • 推理前置优于执行后验证:在物理系统中,错误决策的代价在执行后可能不可逆,因此在承诺前分配计算进行后果评估是更优策略。
  • 子任务作为推理单元:在动作搜索和语言规划之间,子任务提供了稀疏性、物理接地性和长程视野的最佳平衡。
  • 记忆的鲁棒性优于完美性:训练记忆修复机制比追求零错误记忆更现实,也更适用于开放域部署。
  • 跨形态统一在表示层:通过掩码统一动作空间,使同一模型支持异构控制接口,避免为每种形态维护独立模型。

对研究者的借鉴

  1. 当设计分层机器人系统时,高层决策应被视为可扩展的推理问题而非固定的映射问题。为关键决策分配额外计算(通过搜索、模拟或验证)可能带来比扩大模型规模更大的收益。
  2. 世界模型的价值不仅在于生成未来状态,更在于支持决策前的后果比较。将视觉预测从"执行条件化"转变为"选择机制",是提升系统自主性的关键设计转变。
  3. 训练数据的扰动策略可以教授鲁棒性。τ0-VLA 的记忆扰动方法(滞后、超前、回滚)是一种通用的数据增强思路,可扩展到其他需要状态跟踪的系统(如对话管理、程序合成)。

对工程师的借鉴

  1. 如果你正在构建长程自主机器人系统,务必为高层策略配备执行记忆和测试时计算能力。τ0-VLA 的实验表明,仅添加记忆和 TTC 就能将平均成功率从 27.5% 提升至 45.0%(Plan Once)乃至更高(TTC 闭环)。
  2. 优先采用统一动作空间 + 掩码机制来处理异构形态,而非为每种机器人形态维护独立的低层策略。40 维统一空间已证明足以覆盖人形、双臂和固定臂三种形态。
  3. 异步流水线是部署 TTC 的关键工程技巧。将高层策略(慢速,1s)与低层控制(快速,30Hz)解耦为异步进程,可以避免搜索延迟影响控制频率。
  4. 自适应路由阈值应针对任务在保留验证数据上校准。τ0-VLA 共享跨任务的统计量和路由规则,但阈值需要任务特定校准,以平衡计算开销和准确率增益。

τ0-VLA 通过将世界模型引导的测试时计算引入分层 VLA 系统,在真实世界长程机器人操作任务上实现了显著的性能提升。该系统在 AGIBOT G1、ARX AC One 和 Franka Research 3 三种形态上验证了其通用性,在最长 25 步、约 12 分钟的家庭任务中展示了长程移动操作、精确执行和跨形态泛化能力。该方法为构建能够在复杂物理环境中进行深度推理和自主决策的机器人基础模型提供了从算法设计到工程部署的完整路径。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐