视启未来刘昊:世界模型与具身智能的融合之路
演讲嘉宾:刘昊(视启未来联合创始人,世界模型与具身智能负责人)
所属大会:2026 奇点智能技术大会 · 北京
一、引言:从"看"到"做"的 AI 进化
在人工智能的发展历程中,“理解世界"与"改变世界"一直是两个相对独立的研究方向。计算机视觉让机器能够"看见”,自然语言处理让机器能够"理解",而具身智能(Embodied AI)则让机器能够"行动"。视启未来(Visionary Future) 作为一家专注于世界模型与具身智能的创业公司,正在推动这两个方向的深度融合。
2026 年 11 月,视启未来联合创始人 刘昊 将出席奇点智能技术大会,分享他在世界模型与具身智能领域的最新研究成果和工程实践。
二、世界模型:让 AI 理解物理世界
2.1 什么是世界模型
世界模型(World Model)是指 AI 系统对物理世界的内部表征和预测能力。一个完善的世界模型能够:
- 感知当前状态:通过视觉、触觉、本体感觉等传感器获取环境信息
- 预测未来状态:基于当前动作预测环境的下一步变化
- 模拟反事实:想象"如果采取不同行动,结果会怎样"
# 世界模型核心接口示意
class WorldModel:
def __init__(self, perception_net, dynamics_net, reward_net):
self.perception = perception_net # 感知编码器
self.dynamics = dynamics_net # 动力学预测器
self.reward = reward_net # 奖励预测器
def encode(self, observation):
"""将原始观测编码为隐状态"""
return self.perception(observation)
def predict(self, state, action):
"""预测下一状态和奖励"""
next_state = self.dynamics(state, action)
reward = self.reward(state, action)
return next_state, reward
def imagine(self, initial_state, action_sequence):
"""想象一条动作序列的未来轨迹"""
trajectory = [initial_state]
for action in action_sequence:
next_state, _ = self.predict(trajectory[-1], action)
trajectory.append(next_state)
return trajectory
2.2 世界模型的三代演进
| 代际 | 代表工作 | 核心特点 | 局限 |
|---|---|---|---|
| 第一代 | Ha & Schmidhuber (2018) | 变分自编码器 + RNN | 视觉简单、泛化差 |
| 第二代 | DreamerV2/V3 (2020-2023) | 离散隐变量 + RSSM | 复杂场景建模不足 |
| 第三代 | Sora/GAIA-1 (2024) | 扩散模型 + Transformer | 计算成本高、可控性差 |
| 第四代 | 视启未来方案 (2025) | 神经辐射场 + 物理约束 | 正在探索中 |
2.3 视觉感知的世界模型
刘昊团队的核心创新在于将视觉感知深度融入世界模型。传统世界模型通常使用低维状态表示(如位置、速度),而视启未来的方案直接从高维视觉输入(RGB-D 图像、点云)中学习世界模型。
关键技术挑战:
- 高维状态空间:视觉数据的维度远高于传统状态向量,需要高效的压缩表征
- 部分可观测性:单视角图像无法完整描述三维场景,需要多视角融合
- 动态物体:场景中可能存在多个运动物体,需要实例级跟踪
# 视觉世界模型:基于 NeRF 的场景表征
class NeuralWorldModel:
def __init__(self):
self.nerf = NeRFNetwork() # 神经辐射场
self.dynamics = TransformerDynamics() # 动力学预测
def render(self, camera_pose, time_step):
"""从任意视角渲染场景"""
scene_repr = self.nerf.encode_scene(time_step)
return self.nerf.volume_render(scene_repr, camera_pose)
def step(self, action):
"""执行动作并更新世界状态"""
self.dynamics.predict_next_state(action)
return self.get_current_observation()
三、具身智能:从仿真到现实
3.1 具身智能的三层架构
视启未来的具身智能系统采用三层架构设计:
┌─────────────────────────────────────────┐
│ 决策层:大语言模型 + 任务规划器 │
│ 输入:自然语言指令 │
│ 输出:子任务序列 + 目标状态描述 │
├─────────────────────────────────────────┤
│ 技能层:视觉运动策略网络 │
│ 输入:视觉观测 + 目标状态 │
│ 输出:末端执行器轨迹 / 关节角度序列 │
├─────────────────────────────────────────┤
│ 控制层:低层控制器 + 安全监控 │
│ 输入:期望轨迹 + 实时传感器反馈 │
│ 输出:电机力矩指令 │
└─────────────────────────────────────────┘
3.2 Sim-to-Real 迁移的工程实践
从仿真环境训练到真实机器人部署,是具身智能面临的最大工程挑战之一。刘昊团队在实践中总结出以下关键经验:
1. 域随机化(Domain Randomization)
在仿真中引入大量随机扰动,使策略对真实环境的变化具有鲁棒性:
# 域随机化配置示例
randomization_config = {
"visual": {
"lighting": {"intensity": (0.5, 1.5), "color_temp": (3000, 7000)},
"texture": {"randomize": True, "pool_size": 1000},
"camera": {"position_noise": 0.02, "fov_range": (50, 70)}
},
"dynamics": {
"friction": {"range": (0.3, 1.2)},
"mass": {"scale_range": (0.8, 1.2)},
"joint_damping": {"range": (0.01, 0.1)}
},
"action": {
"latency": {"range_ms": (0, 100)},
"noise": {"std": 0.05}
}
}
2. 系统辨识与参数适配
在部署前对真实机器人进行系统辨识,获取准确的动力学参数,并据此微调仿真环境:
| 辨识参数 | 方法 | 精度要求 |
|---|---|---|
| 关节摩擦 | 恒速运动测试 | ±5% |
| 质量分布 | 摆动实验 | ±3% |
| 刚度矩阵 | 力控接触实验 | ±10% |
| 执行器延迟 | 阶跃响应测试 | ±10ms |
3. 渐进式部署策略
不直接将在仿真中训练的策略部署到真实机器人,而是采用渐进式策略:
- 仿真验证:在多种仿真环境中验证策略鲁棒性
- 硬件在环:将真实传感器接入仿真循环,验证感知模块
- 受限真实环境:在简化真实场景(固定物体、已知光照)中测试
- 完整真实环境:逐步增加场景复杂度,最终部署
3.3 世界模型驱动的机器人学习
视启未来的核心创新是用世界模型替代传统强化学习中的环境交互。传统 RL 需要机器人在真实环境中进行大量试错,成本高、风险大。而世界模型允许机器人在"想象"中学习:
# 世界模型驱动的强化学习
class WorldModelRL:
def __init__(self, world_model, policy_network):
self.world_model = world_model
self.policy = policy_network
def train_in_imagination(self, initial_states, num_episodes):
"""在世界模型中训练策略"""
for episode in range(num_episodes):
state = random.choice(initial_states)
trajectory = []
for step in range(self.max_steps):
action = self.policy.sample(state)
next_state, reward = self.world_model.predict(state, action)
trajectory.append((state, action, reward, next_state))
state = next_state
# 基于想象轨迹更新策略
self.policy.update(trajectory)
def deploy_to_real(self, real_robot):
"""将训练好的策略部署到真实机器人"""
# 仅需少量真实环境微调
real_trajectories = real_robot.collect(100)
self.policy.finetune(real_trajectories)
四、技术挑战与解决方案
4.1 视觉泛化
真实世界的视觉多样性远超仿真环境。视启未来采用以下策略提升视觉泛化能力:
- 多模态融合:结合 RGB、深度、触觉等多模态信息
- 自监督预训练:在大规模无标注视频数据上预训练视觉编码器
- 持续学习:部署后持续收集数据,在线更新视觉模型
4.2 长程任务规划
复杂任务(如"整理房间")需要多步规划和错误恢复能力。解决方案包括:
- 分层强化学习:高层策略负责任务分解,低层策略负责具体执行
- 大语言模型规划:利用 LLM 的常识推理能力生成任务计划
- 重规划机制:当执行失败时,基于当前状态重新生成计划
4.3 安全与可靠性
机器人与物理世界交互必须保证安全:
| 安全层级 | 机制 | 响应时间 |
|---|---|---|
| 硬件急停 | 物理按钮 / 力矩限制 | < 1ms |
| 控制层安全 | 碰撞检测 / 速度限制 | < 10ms |
| 策略层安全 | 危险动作过滤 | < 50ms |
| 任务层安全 | 人工监督 / 任务边界 | < 1s |
五、应用场景与商业化路径
5.1 工业质检
世界模型可以预测产品的正常外观,通过对比实际观测与预测结果的差异检测缺陷。相比传统视觉检测,世界模型能够处理更复杂的缺陷类型和光照变化。
5.2 家庭服务机器人
具身智能的终极场景之一是家庭服务机器人。世界模型让机器人能够理解家庭环境的三维结构,预测物体运动,规划安全高效的行动路径。
5.3 自动驾驶
世界模型在自动驾驶中的应用包括:
- 场景理解:从多视角图像构建三维场景表征
- 轨迹预测:预测其他交通参与者的未来行为
- 决策规划:基于世界模型进行反事实推理,选择最优驾驶策略
六、总结与展望
刘昊在视启未来的工作展示了世界模型与具身智能融合的巨大潜力。从仿真到现实,从感知到行动,这一技术路线正在推动 AI 从"数字世界"走向"物理世界"。
2026 年 11 月,奇点智能技术大会,聆听刘昊分享世界模型与具身智能的最新突破。
大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
参会报名:https://boolan.com/enroll/c1051/event/1162?channel=seo

立即报名,探索世界模型与具身智能的融合未来!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)