原文链接:https://arxiv.org/pdf/2608.15265
项目链接:https://usail-hkust.github.io/VibeWorlding-Gym/

一、研究动机

基于论文原文的引言部分,端到端交互式3D开放世界构建在游戏、仿真、具身AI领域具备重要应用价值,随着多模态大语言模型(MLLM)的发展,基于MLLM的3D世界构建智能体已成为学术与工业界的关注热点,但现有研究存在三大核心痛点,构成了本工作的研究动机:

  1. 评估场景理想化,缺乏系统的能力拆解分析
    现有方法大多仅在理想化的简单查询上验证效果,无法系统性地对比分析多模态智能体在用户意图理解、3D工具调用、文本与视觉3D信息推理等底层维度的能力差异与瓶颈。

  2. 缺乏统一开源的基准与训练框架
    绝大多数现有3D世界构建框架为闭源形态,目前仍没有统一的开源框架,能够支撑“训练(如智能体强化学习后训练)能否提升3D世界构建底层能力”这一问题的系统性研究。

  3. 技术落地存在两大核心挑战

    • 3D资产环境碎片化:高质量、物理一致性的3D资产难以大规模获取;资产检索、编辑、渲染等操作分散在互不兼容的工具中,无法支撑端到端的3D世界构建流程,暂无工作将这些能力统一到同一个沙箱接口下。
    • 3D构建效果难以验证:合格的3D世界需要同时满足物理约束(资产高度合理、布局无碰撞)与用户意图、任务要求、审美一致性,多维度的评估标准无法仅通过手工规则或通用LLM评判器完成。

在这里插入图片描述

二、论文方法概括

论文提出VIBEWORLDING——面向3D开放世界端到端构建的多模态智能体统一基准与训练框架,整体架构对应图1的上下两大部分,核心思路是将3D世界构建建模为多轮交互、多模态反馈、工具集成的智能体推理过程,同时配套标准化评测基准与可规模化训练体系。

框架包含两大核心组件:

  1. VWE-BENCH:大规模评测基准,包含高质量3D资产库、种子3D世界与反向合成的多模态用户查询,搭配“物理可行性+意图满足”双约束验证体系,可系统评估智能体的多维能力。
  2. VIBEWORLDING-GYM:联合多模态强化学习后训练框架,集成了统一工具接口的3D沙箱环境、基于评分规则的验证奖励器,以及“监督微调冷启动+多模态强化学习优化”的完整训练流水线,可规模化提升智能体的端到端构建能力。

三、论文方法详细介绍

结合图1的架构,从智能体工作流程、VWE-BENCH基准体系、VIBEWORLDING-GYM训练框架三个部分展开详细说明,所有内容均来自论文原文:

1. Vibe Worlding智能体的端到端工作流程(图1上半部分)

智能体接收两类多模态用户查询,通过多轮迭代交互完成3D世界构建,最终输出可用于仿真的交互式3D世界,完整流程分为4个阶段:

  • 输入层:多模态用户查询
    支持两种任务模式:① 纯文本查询,要求从零开始构建3D世界;② 现有3D世界(文本地图+多视角渲染图)搭配文本编辑指令,要求优化现有3D世界。

  • 阶段1:自主规划(Autonomous Planning)
    智能体自主完成用户意图理解、场景布局规划、工具调用方案设计等推理,明确构建目标与执行路径。

  • 阶段2:工具调用(Tool Use via MCP in Sandbox)
    智能体通过沙箱中的MCP工具集执行操作,包含三类核心工具:

    • 资产检索:通过文本嵌入语义匹配,从资产库中搜索符合需求的3D资产;
    • 资产编辑:对场景中的资产执行添加、删除、旋转、平移等空间编辑操作;
    • 渲染:对当前3D世界进行360°多视角渲染,生成可视化反馈。
  • 阶段3:观察与反思(Observe & Reflect)
    智能体接收环境返回的多模态反馈:包括5个固定视角的渲染图像、资产检索结果、3D世界文本地图等。基于反馈反思当前构建效果,判断是否需要进一步调整,再回到规划阶段开启下一轮迭代。

  • 阶段4:最终输出
    迭代终止后,输出物理合理、符合用户意图的交互式3D世界,可直接用于仿真场景。

2. VWE-BENCH:评测基准体系(图1左下部分)

VWE-BENCH是专门为vibe worlding智能体构建的评测基准,通过“资产-种子世界-反向查询”的流水线构建,提供标准化的测试集与评估体系。

(1)基准数据构成
  • 3D资产库:包含2616个高质量标注3D资产,覆盖20个语义类别(从小型道具、家具到大型建筑、地形),每个资产包含唯一ID、名称、类别、网格面数、物理包围盒等元信息,所有资产均经过统一的真实世界尺寸标注。
  • 种子3D世界:由专业美术人员基于资产库构建323个种子3D世界,放置资产数量从8到258不等,覆盖不同复杂度场景,作为查询合成的基础场景。
  • 反向合成用户查询:共6828条,分为两大类共10个子类型,模拟真实用户的不同表达形式:
    • 3D世界构建查询(1364条):从零开始构建场景,包含仅主题、主题+元素、完整蓝图、干扰项4个子类型,均为无真实标注的开放型查询,通过评分规则评估。
    • 3D世界优化查询(5464条):基于现有场景编辑,包含精确资产级编辑(有真实标注,可与真值地图比对)、模糊资产级编辑、场景批判、场景引导、场景重述、复杂描述6个子类型,仅精确编辑类有真实标注。
(2)双约束验证评估体系

对应图1底部的验证维度,从物理可行性与意图满足两大维度进行系统评估:

  • 物理可行性(基于几何规则):包含两项硬约束
    • 碰撞检测:校验资产之间是否出现穿透、重叠,预留合理容差避免误判接触性放置;
    • 高度校验:校验资产是否贴合地面或合理支撑面,排除无支撑悬浮、穿模等问题。
  • 意图满足(MLLM评判):包含四项能力维度
    • 生态合理性:场景整体风格统一,资产组合符合常识与场景逻辑;
    • 3D理解:智能体正确识别查询需求与场景信息;
    • 3D推理:智能体正确调用工具完成空间编辑,实现构建目标;
    • 资产检索使用:智能体合理选择检索结果,正确调用匹配的资产。
3. VIBEWORLDING-GYM:多模态强化学习后训练框架(图1右下部分)

这是面向智能体训练的完整基础设施,实现了可规模化的多模态RL后训练,包含沙箱环境、奖励验证器、训练流水线三部分。

(1)3D沙箱环境(Sandbox Environment)

基于Blender构建统一的仿真环境,将资产检索、编辑、渲染封装为标准化MCP工具,提供统一的交互接口:

  • 5种原子3D工具:资产检索、资产添加、资产旋转、资产平移、资产删除,覆盖所有基础编辑操作;
  • 统一渲染服务:每轮编辑后自动渲染5个固定视角的1280×720分辨率图像,作为多模态视觉反馈;
  • 资产检索服务:基于Qwen3Embedding-4B训练的检索模型,采用InfoNCE损失优化,保证检索结果与资产库ID体系对齐,所有返回资产均可直接放置。
(2)基于规则的验证奖励器(Rubric-based Verifier)

同时作为评估工具与RL训练的奖励信号来源:

  • 对于无真实标注的查询:先执行物理可行性几何校验,通过后再由MLLM评判四个意图维度,全部通过则判定为成功,获得二值奖励(0/1);
  • 对于有真实标注的查询:直接将智能体编辑结果与真值地图对比,按正确修改资产的比例给出[0,1]区间的连续奖励;
  • 内置严格的奖励校验机制,禁止未授权的额外编辑(即“过度编辑”),避免智能体通过破坏场景其他部分来换取局部正确。
(3)联合多模态RL后训练流水线

采用“冷启动SFT + 多模态RL”的两阶段训练方案:

  • 阶段1:冷启动监督微调(SFT)
    针对不同查询类型合成高质量训练轨迹:无真实值查询通过Gemini 3.1-pro多次构建、筛选出高质量结果,再反向合成完整的推理轨迹;有真实值查询直接从真值地图反向生成推理轨迹。基于这些轨迹做全参数监督微调,让模型快速掌握3D工具使用与多轮推理的基础能力。

  • 阶段2:联合多模态强化学习
    以冷启动模型为初始策略,采用GRPO算法进行智能体强化学习训练。训练同时覆盖纯文本构建任务与多模态编辑任务,基于双约束验证器的结果提供奖励:无真实值查询为二值奖励,有真实值查询为连续比例奖励。通过基于最终结果的奖励设计,避免手工中间奖励带来的奖励破解问题,让智能体真正学习到端到端的3D世界构建能力。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐