具身智能专题:宇树UnifoLM-WLA-1.0用同一套权重覆盖64项真机任务
(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!
论文标题:UnifoLM-WLA-1.0
论文作者:宇树
发表时间:2026年9月
目录
本文要点
(1)UnifoLM-WLA-1.0是宇树2026年9月发布的人形基础模型,6B参数,路线叫世界-语言-动作。
(2)约2500小时真机数据,一张权重覆盖64项任务,10项全身操作加54项桌面操作。具身推理主干在16项评测里开源模型7项领先。
(3)做法上两点最值得看,用光流加VQ-VAE预测未来会动的区域,以及在UnifoLM-ER-Flow上再挂MMDiT动作专家。
(4)短板是64项任务没有公布成功率,WLA-Base和后训练代码在GitHub开源计划里还没勾。
(5)文末按模型卡config.json的Qwen3-VL架构,附一段Transformers加载示例。
宇树在2026年9月放出了UnifoLM-WLA-1.0的项目页。GitHub仓库11日创建,截至16日122个星。我把项目页、README、两张Hugging Face模型卡和仓库里的动作空间文档对了一遍。
CSDN上前代UnifoLM-WMA-0和UnifoLM-VLA-0已经有人写过。这一代名字换成WLA,我想看这三步是怎么收束的。
6B参数,约2500小时真机数据,一张权重覆盖64项任务。项目页英文写平行夹爪加两类灵巧手,中文写成二指夹爪及多种五指灵巧手。两类具体是哪两款,官方材料没有点名。

一、从WMA到VLA再到WLA三代演进
WMA-0是2025年9月的世界模型-动作。世界模型干两件事,按动作生成未来环境当仿真器,再把未来交互预测接到动作头上帮决策。Base在Open-X上微调,Dual在五份宇树开源数据上同时训决策和仿真。
VLA-0是2026年1月29日放出的视觉-语言-动作。底座Qwen2.5-VL-7B,真机12类任务共用一张策略,LIBERO仿真均分98.7。训练和推理代码都开了。
WLA-1.0把前两代想做的事塞进同一个多模态主干。项目页的说法是具身推理、未来动态区域预测、离散动作学习,再加一个MMDiT动作专家出连续动作。MMDiT是按流匹配生成连续动作的专家网络。
| 代际 | 发布时间 | 参数量 | 路线 | 真机任务 | 真机数据 | 训练推理代码 |
|---|---|---|---|---|---|---|
| UnifoLM-WMA-0 | 2025年9月 | 未报告 | 世界模型-动作 | 未报告 | 未报告小时 | 已开源 |
| UnifoLM-VLA-0 | 2026年1月 | 底座Qwen2.5-VL-7B,VLA总量未报告 | 视觉-语言-动作 | 12类 | 未报告小时 | 已开源 |
| UnifoLM-WLA-1.0 | 2026年9月 | 6B | 世界-语言-动作 | 64项(10+54) | 约2500小时 | ER-1和ER-Flow已放,WLA-Base和后训练未放 |
前两代的权重和代码都能下。这一代能下的是4B的推理主干,6B那张完整权重还在开源计划的空框里。
二、ER-1在Where2Place等空间评测
UnifoLM-ER-1基于Qwen3-VL-4B,超过500万条样本,覆盖点预测、检测、多图推理、2D轨迹、3D检测、多图空间问答,再和通用图文混训。模型卡和项目页都写,16项评测里开源模型7项领先。
对照模型卡加粗的那七项。RefSpatial-Bench 61.7,Where2Place 82.0,Pixmo-Point 73.8,BLINK 93.4,EmbSpatial 88.9,RoboSpatial 73.1,VSR 88.1。
Where2Place上底座Qwen3-VL-4B是63.0,EmbSpatial底座79.6,Pixmo-Point底座48.3。BLINK他们只报相对深度和空间关系两个子任务的平均,自己测的。

输的项目也在同一张表里。Ego-Plan2是55.1,Thinker-4B拿到63.7。VSI-Bench是54.2,Molmo2-ER-4B是74.5。MMMU_VAL是54.7,Qwen3-VL-8B是62.3。空间专项涨了,通用多模态题没有跟着涨。
| 模型 | 参数 | Where2Place | EmbSpatial | Pixmo-Point | Ego-Plan2 | VSI-Bench | MMMU_VAL |
|---|---|---|---|---|---|---|---|
| UnifoLM-ER-1 | 4B | 82.0 | 88.9 | 73.8 | 55.1 | 54.2 | 54.7 |
| Qwen3-VL-4B | 4B | 63.0 | 79.6 | 48.3 | 40.7 | 59.3 | 57.8 |
| Thinker-4B | 4B | 72.0 | 80.2 | 57.4 | 63.7 | 65.4 | 46.2 |
| Molmo2-ER-4B | 4B | 54.0 | 78.8 | 未报告 | 未报告 | 74.5 | 未报告 |
闭源那边GPT-6-Astra的ERQA是77.7,UnifoLM-ER-1是50.0。项目页说整体可比肩国外闭源大模型,分项看这句话只在空间指点上站得住。
三、光流与VQ-VAE动态区域预测
WMA-0生成的是整段未来视频。WLA把这件事收窄了。
两帧之间算光流,抽出发生变化的区域,再用VQ-VAE编成定长离散token。VLM看当前图,再看任务描述或动作,直接预测未来动态区域的mask token。官方把这套叫做以交互为中心的世界建模,盯的是交互主体和它引起的场景变化。

项目页给了一组摆盘子的例子。t0右臂还举着盘子,t1盘子已经靠近沥水架,光流把右臂和盘子点亮,红色mask扣在会动的手臂、盘子和沥水架上。

背景墙和静止桌面都不必生成。手臂和物体往哪挪,策略才用得上。
四、与GE-Act 2.0的WAM路线对照
同月智元放了GE-Act 2.0,路线叫世界-动作模型WAM。它的生成模块和动作模块都在操作数据上从零初始化,不继承现成的视频生成器。
三块。CoAE把图压成给控制用的连续潜变量。SVP用单步MeanFlow一次生成完整未来状态。IDM从状态转移里恢复动作。
联合训练从300小时扩到30000小时,G1-OP零样本分布外成功率从17.1%到44.1%,G2-90D从13.4%到31.1%。100项任务,20类技能。单卡RTX 5090每段动作104毫秒。
| 项目 | UnifoLM-WLA-1.0 | GE-Act 2.0 |
|---|---|---|
| 定位 | WLA,VLM主干加动作专家 | WAM,生成与动作模块从零训 |
| 世界预测 | 光流动态区域,VQ-VAE离散mask token | CoAE连续潜变量,SVP生成完整未来状态 |
| 动作 | RVQ离散token加MMDiT连续动作 | IDM从状态转移恢复动作 |
| 数据 | 约2500小时真机 | 联合训练扩到30000小时 |
| 评测 | 64项真机任务,成功率未报告 | 100项OOD任务,G1-OP成功率44.1% |
| 延迟 | 未报告 | 单卡RTX 5090每段104毫秒 |
差别落在压缩方式上。GE-Act要生成完整未来画面,WLA只预测动态区域的离散mask。GE-Act的动作从视觉未来里反推,WLA的连续动作交给MMDiT,离散动作先在VLM里学。
数据量差一个数量级,评测口径也不同。不能拿44.1%去打64项任务的演示视频。两边都还没把对方的协议复现一遍。
五、RVQ与MMDiT覆盖夹爪和灵巧手
动作空间切成三块,末端位姿、末端关节、下肢关节,各训一个残差向量量化模型RVQ。token按同一时间步送进VLM,得到UnifoLM-ER-Flow。仓库文档把每个未来动作写成54维,当前状态写成60维,默认30赫兹、每段30步,大约一秒。

UnifoLM-WLA-1.0在ER-Flow上面加MMDiT动作专家,把噪声解成连续动作。训练数据约2500小时,写明包括宇树开源数据和BitRobot-HIW-500。
64项任务的视频在项目页上。全身10项是扔垃圾、衣服放进洗衣机、整理鞋架、收拾卫生间、收拾厨房。还有整理床铺、购买蔬菜、文件夹放进柜子、物品放到货架、整理抱枕。桌面54项从叠毛巾、插插头、倒药片到传送带抓零食。成功率一项都没给。
开源数据这边,UniBot-V1 Challenge Dataset已经勾上。Unitree-WBT-Dataset和Unitree-Manipulation-Dataset还是空框。项目页顶部的Code、Models、Datasets现在链到仓库和Hugging Face,不再写Coming soon。没放出来的东西改到README的开源计划里了。
六、本地部署与推理实践
后训练代码和UnifoLM-WLA-Base在GitHub开源计划里还没勾。能下的是UnifoLM-ER-1和UnifoLM-ER-Flow,模型卡写Apache 2.0,体量都标4B。
GitHub README没有推理示例。UnifoLM-ER-1的config.json里architectures是Qwen3VLForConditionalGeneration,transformers_version写5.5.3。下面这段按Qwen3-VL官方Transformers用法,只把模型名换成ER-1。来源是config.json的架构名,不是官方机器人推理脚本。
pip install git+https://github.com/huggingface/transformers
from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
model_id = "unitreerobotics/UnifoLM-ER-1"
model = Qwen3VLForConditionalGeneration.from_pretrained(
model_id, dtype="auto", device_map="auto"
)
processor = AutoProcessor.from_pretrained(model_id)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": "scene.jpg"},
{"type": "text", "text": "Point to the handle of the mug."},
],
}
]
inputs = processor.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
generated_ids = model.generate(**inputs, max_new_tokens=128)
trimmed = [out[len(inp):] for inp, out in zip(inputs.input_ids, generated_ids)]
print(processor.batch_decode(trimmed, skip_special_tokens=True)[0])
这段只能测空间问答和指点,不能出机器人动作。连续动作在未放出的WLA-Base和MMDiT专家上。
仓库目前能直接读的是动作空间文档。默认配置如下,来源docs/robot_action_state_processing_en.md。
target_fps: 30
chunk_size: 30
norm_type: minmax_q
rel_norm_type: zscore
state_norm_type: minmax_q
gripper_norm_type: minmax_q
想看仓库现状,官方README给的入口就是克隆。里面现在只有许可证、中英文README、封面图和动作空间文档。
git clone https://github.com/unitreerobotics/unifolm-wla.git
七、总结与思考
三代名字换来换去,收束方向其实清楚。先有一个能预演未来交互的世界模型,再有一个能听指令动手的VLA,这一代把未来变化收成离散token塞进VLM,连续动作另外交给流匹配专家。
动态区域这个压缩我觉得比生成整段未来视频更适合操作。手臂和物体动了才是策略要盯的,背景重建是视频模型的负担。
短板也硬。64项任务只有演示视频,没有成功率,也没有和前代VLA-0那12类任务的对照。封面写全开源,仓库里WLA-Base、后训练代码、两份数据集都没勾。截至9月16日GitHub 122个星,前代WMA-0是1151,VLA-0是621,和开放程度匹配。
和GE-Act 2.0放在一起看更明显。智元愿意报分布外成功率和单卡延迟,宇树愿意报任务覆盖面和夹爪灵巧手兼容。读者现在没法判断这张6B权重到底稳不稳。
参考链接
- UnifoLM-WLA-1.0项目页 unigen-x.github.io/unifolm-wla.github.io,2026年9月
- 代码与开源计划 unitreerobotics/unifolm-wla
- 具身推理权重 unitreerobotics/UnifoLM-ER-1
- 动态区域与离散动作主干 unitreerobotics/UnifoLM-ER-Flow
- 前代 UnifoLM-WMA-0,2025年9月;UnifoLM-VLA-0,2026年1月
- 对照方案GE-Act 2.0 arXiv 2609.05588,2026年9月
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)