(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!


论文标题:UnifoLM-WLA-1.0
论文作者:宇树
发表时间:2026年9月


本文要点
(1)UnifoLM-WLA-1.0是宇树2026年9月发布的人形基础模型,6B参数,路线叫世界-语言-动作。
(2)约2500小时真机数据,一张权重覆盖64项任务,10项全身操作加54项桌面操作。具身推理主干在16项评测里开源模型7项领先。
(3)做法上两点最值得看,用光流加VQ-VAE预测未来会动的区域,以及在UnifoLM-ER-Flow上再挂MMDiT动作专家。
(4)短板是64项任务没有公布成功率,WLA-Base和后训练代码在GitHub开源计划里还没勾。
(5)文末按模型卡config.json的Qwen3-VL架构,附一段Transformers加载示例。


宇树在2026年9月放出了UnifoLM-WLA-1.0的项目页。GitHub仓库11日创建,截至16日122个星。我把项目页、README、两张Hugging Face模型卡和仓库里的动作空间文档对了一遍。

CSDN上前代UnifoLM-WMA-0和UnifoLM-VLA-0已经有人写过。这一代名字换成WLA,我想看这三步是怎么收束的。

6B参数,约2500小时真机数据,一张权重覆盖64项任务。项目页英文写平行夹爪加两类灵巧手,中文写成二指夹爪及多种五指灵巧手。两类具体是哪两款,官方材料没有点名。

GitHub封面,拼了多张G1真机操作画面

一、从WMA到VLA再到WLA三代演进

WMA-0是2025年9月的世界模型-动作。世界模型干两件事,按动作生成未来环境当仿真器,再把未来交互预测接到动作头上帮决策。Base在Open-X上微调,Dual在五份宇树开源数据上同时训决策和仿真。

VLA-0是2026年1月29日放出的视觉-语言-动作。底座Qwen2.5-VL-7B,真机12类任务共用一张策略,LIBERO仿真均分98.7。训练和推理代码都开了。

WLA-1.0把前两代想做的事塞进同一个多模态主干。项目页的说法是具身推理、未来动态区域预测、离散动作学习,再加一个MMDiT动作专家出连续动作。MMDiT是按流匹配生成连续动作的专家网络。

代际发布时间参数量路线真机任务真机数据训练推理代码
UnifoLM-WMA-02025年9月未报告世界模型-动作未报告未报告小时已开源
UnifoLM-VLA-02026年1月底座Qwen2.5-VL-7B,VLA总量未报告视觉-语言-动作12类未报告小时已开源
UnifoLM-WLA-1.02026年9月6B世界-语言-动作64项(10+54)约2500小时ER-1和ER-Flow已放,WLA-Base和后训练未放

前两代的权重和代码都能下。这一代能下的是4B的推理主干,6B那张完整权重还在开源计划的空框里。

二、ER-1在Where2Place等空间评测

UnifoLM-ER-1基于Qwen3-VL-4B,超过500万条样本,覆盖点预测、检测、多图推理、2D轨迹、3D检测、多图空间问答,再和通用图文混训。模型卡和项目页都写,16项评测里开源模型7项领先。

对照模型卡加粗的那七项。RefSpatial-Bench 61.7,Where2Place 82.0,Pixmo-Point 73.8,BLINK 93.4,EmbSpatial 88.9,RoboSpatial 73.1,VSR 88.1。

Where2Place上底座Qwen3-VL-4B是63.0,EmbSpatial底座79.6,Pixmo-Point底座48.3。BLINK他们只报相对深度和空间关系两个子任务的平均,自己测的。

项目页具身推理评测表截取,UnifoLM-ER-1-4B在Where2Place和Pixmo-Point上标成最高

输的项目也在同一张表里。Ego-Plan2是55.1,Thinker-4B拿到63.7。VSI-Bench是54.2,Molmo2-ER-4B是74.5。MMMU_VAL是54.7,Qwen3-VL-8B是62.3。空间专项涨了,通用多模态题没有跟着涨。

模型参数Where2PlaceEmbSpatialPixmo-PointEgo-Plan2VSI-BenchMMMU_VAL
UnifoLM-ER-14B82.088.973.855.154.254.7
Qwen3-VL-4B4B63.079.648.340.759.357.8
Thinker-4B4B72.080.257.463.765.446.2
Molmo2-ER-4B4B54.078.8未报告未报告74.5未报告

闭源那边GPT-6-Astra的ERQA是77.7,UnifoLM-ER-1是50.0。项目页说整体可比肩国外闭源大模型,分项看这句话只在空间指点上站得住。

三、光流与VQ-VAE动态区域预测

WMA-0生成的是整段未来视频。WLA把这件事收窄了。

两帧之间算光流,抽出发生变化的区域,再用VQ-VAE编成定长离散token。VLM看当前图,再看任务描述或动作,直接预测未来动态区域的mask token。官方把这套叫做以交互为中心的世界建模,盯的是交互主体和它引起的场景变化。

Hugging Face模型卡里的动态区域预测流程,光流得到mask,VQ-VAE编成未来mask token

项目页给了一组摆盘子的例子。t0右臂还举着盘子,t1盘子已经靠近沥水架,光流把右臂和盘子点亮,红色mask扣在会动的手臂、盘子和沥水架上。

项目页动态区域示例,t0、t1、光流和动态区域mask

背景墙和静止桌面都不必生成。手臂和物体往哪挪,策略才用得上。

四、与GE-Act 2.0的WAM路线对照

同月智元放了GE-Act 2.0,路线叫世界-动作模型WAM。它的生成模块和动作模块都在操作数据上从零初始化,不继承现成的视频生成器。

三块。CoAE把图压成给控制用的连续潜变量。SVP用单步MeanFlow一次生成完整未来状态。IDM从状态转移里恢复动作。

联合训练从300小时扩到30000小时,G1-OP零样本分布外成功率从17.1%到44.1%,G2-90D从13.4%到31.1%。100项任务,20类技能。单卡RTX 5090每段动作104毫秒。

项目UnifoLM-WLA-1.0GE-Act 2.0
定位WLA,VLM主干加动作专家WAM,生成与动作模块从零训
世界预测光流动态区域,VQ-VAE离散mask tokenCoAE连续潜变量,SVP生成完整未来状态
动作RVQ离散token加MMDiT连续动作IDM从状态转移恢复动作
数据约2500小时真机联合训练扩到30000小时
评测64项真机任务,成功率未报告100项OOD任务,G1-OP成功率44.1%
延迟未报告单卡RTX 5090每段104毫秒

差别落在压缩方式上。GE-Act要生成完整未来画面,WLA只预测动态区域的离散mask。GE-Act的动作从视觉未来里反推,WLA的连续动作交给MMDiT,离散动作先在VLM里学。

数据量差一个数量级,评测口径也不同。不能拿44.1%去打64项任务的演示视频。两边都还没把对方的协议复现一遍。

五、RVQ与MMDiT覆盖夹爪和灵巧手

动作空间切成三块,末端位姿、末端关节、下肢关节,各训一个残差向量量化模型RVQ。token按同一时间步送进VLM,得到UnifoLM-ER-Flow。仓库文档把每个未来动作写成54维,当前状态写成60维,默认30赫兹、每段30步,大约一秒。

Hugging Face模型卡里的离散动作编码,末端位姿、手部、下肢三条RVQ同步送进VLM

UnifoLM-WLA-1.0在ER-Flow上面加MMDiT动作专家,把噪声解成连续动作。训练数据约2500小时,写明包括宇树开源数据和BitRobot-HIW-500。

64项任务的视频在项目页上。全身10项是扔垃圾、衣服放进洗衣机、整理鞋架、收拾卫生间、收拾厨房。还有整理床铺、购买蔬菜、文件夹放进柜子、物品放到货架、整理抱枕。桌面54项从叠毛巾、插插头、倒药片到传送带抓零食。成功率一项都没给。

开源数据这边,UniBot-V1 Challenge Dataset已经勾上。Unitree-WBT-Dataset和Unitree-Manipulation-Dataset还是空框。项目页顶部的Code、Models、Datasets现在链到仓库和Hugging Face,不再写Coming soon。没放出来的东西改到README的开源计划里了。

六、本地部署与推理实践

后训练代码和UnifoLM-WLA-Base在GitHub开源计划里还没勾。能下的是UnifoLM-ER-1和UnifoLM-ER-Flow,模型卡写Apache 2.0,体量都标4B。

GitHub README没有推理示例。UnifoLM-ER-1的config.jsonarchitecturesQwen3VLForConditionalGenerationtransformers_version5.5.3。下面这段按Qwen3-VL官方Transformers用法,只把模型名换成ER-1。来源是config.json的架构名,不是官方机器人推理脚本。

pip install git+https://github.com/huggingface/transformers
from transformers import Qwen3VLForConditionalGeneration, AutoProcessor

model_id = "unitreerobotics/UnifoLM-ER-1"
model = Qwen3VLForConditionalGeneration.from_pretrained(
    model_id, dtype="auto", device_map="auto"
)
processor = AutoProcessor.from_pretrained(model_id)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": "scene.jpg"},
            {"type": "text", "text": "Point to the handle of the mug."},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

generated_ids = model.generate(**inputs, max_new_tokens=128)
trimmed = [out[len(inp):] for inp, out in zip(inputs.input_ids, generated_ids)]
print(processor.batch_decode(trimmed, skip_special_tokens=True)[0])

这段只能测空间问答和指点,不能出机器人动作。连续动作在未放出的WLA-Base和MMDiT专家上。

仓库目前能直接读的是动作空间文档。默认配置如下,来源docs/robot_action_state_processing_en.md

target_fps: 30
chunk_size: 30
norm_type: minmax_q
rel_norm_type: zscore
state_norm_type: minmax_q
gripper_norm_type: minmax_q

想看仓库现状,官方README给的入口就是克隆。里面现在只有许可证、中英文README、封面图和动作空间文档。

git clone https://github.com/unitreerobotics/unifolm-wla.git

七、总结与思考

三代名字换来换去,收束方向其实清楚。先有一个能预演未来交互的世界模型,再有一个能听指令动手的VLA,这一代把未来变化收成离散token塞进VLM,连续动作另外交给流匹配专家。

动态区域这个压缩我觉得比生成整段未来视频更适合操作。手臂和物体动了才是策略要盯的,背景重建是视频模型的负担。

短板也硬。64项任务只有演示视频,没有成功率,也没有和前代VLA-0那12类任务的对照。封面写全开源,仓库里WLA-Base、后训练代码、两份数据集都没勾。截至9月16日GitHub 122个星,前代WMA-0是1151,VLA-0是621,和开放程度匹配。

和GE-Act 2.0放在一起看更明显。智元愿意报分布外成功率和单卡延迟,宇树愿意报任务覆盖面和夹爪灵巧手兼容。读者现在没法判断这张6B权重到底稳不稳。


参考链接

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐