演讲嘉宾:刘昊(视启未来联合创始人,世界模型与具身智能负责人)
所属大会:2026 奇点智能技术大会 · 北京

一、引言:从"看"到"做"的 AI 进化

在人工智能的发展历程中,“理解世界"与"改变世界"一直是两个相对独立的研究方向。计算机视觉让机器能够"看见”,自然语言处理让机器能够"理解",而具身智能(Embodied AI)则让机器能够"行动"。视启未来(Visionary Future) 作为一家专注于世界模型与具身智能的创业公司,正在推动这两个方向的深度融合。

2026 年 11 月,视启未来联合创始人 刘昊 将出席奇点智能技术大会,分享他在世界模型与具身智能领域的最新研究成果和工程实践。

二、世界模型:让 AI 理解物理世界

2.1 什么是世界模型

世界模型(World Model)是指 AI 系统对物理世界的内部表征和预测能力。一个完善的世界模型能够:

  • 感知当前状态:通过视觉、触觉、本体感觉等传感器获取环境信息
  • 预测未来状态:基于当前动作预测环境的下一步变化
  • 模拟反事实:想象"如果采取不同行动,结果会怎样"
# 世界模型核心接口示意
class WorldModel:
    def __init__(self, perception_net, dynamics_net, reward_net):
        self.perception = perception_net      # 感知编码器
        self.dynamics = dynamics_net          # 动力学预测器
        self.reward = reward_net              # 奖励预测器
    
    def encode(self, observation):
        """将原始观测编码为隐状态"""
        return self.perception(observation)
    
    def predict(self, state, action):
        """预测下一状态和奖励"""
        next_state = self.dynamics(state, action)
        reward = self.reward(state, action)
        return next_state, reward
    
    def imagine(self, initial_state, action_sequence):
        """想象一条动作序列的未来轨迹"""
        trajectory = [initial_state]
        for action in action_sequence:
            next_state, _ = self.predict(trajectory[-1], action)
            trajectory.append(next_state)
        return trajectory

2.2 世界模型的三代演进

代际 代表工作 核心特点 局限
第一代 Ha & Schmidhuber (2018) 变分自编码器 + RNN 视觉简单、泛化差
第二代 DreamerV2/V3 (2020-2023) 离散隐变量 + RSSM 复杂场景建模不足
第三代 Sora/GAIA-1 (2024) 扩散模型 + Transformer 计算成本高、可控性差
第四代 视启未来方案 (2025) 神经辐射场 + 物理约束 正在探索中

2.3 视觉感知的世界模型

刘昊团队的核心创新在于将视觉感知深度融入世界模型。传统世界模型通常使用低维状态表示(如位置、速度),而视启未来的方案直接从高维视觉输入(RGB-D 图像、点云)中学习世界模型。

关键技术挑战

  1. 高维状态空间:视觉数据的维度远高于传统状态向量,需要高效的压缩表征
  2. 部分可观测性:单视角图像无法完整描述三维场景,需要多视角融合
  3. 动态物体:场景中可能存在多个运动物体,需要实例级跟踪
# 视觉世界模型:基于 NeRF 的场景表征
class NeuralWorldModel:
    def __init__(self):
        self.nerf = NeRFNetwork()           # 神经辐射场
        self.dynamics = TransformerDynamics()  # 动力学预测
    
    def render(self, camera_pose, time_step):
        """从任意视角渲染场景"""
        scene_repr = self.nerf.encode_scene(time_step)
        return self.nerf.volume_render(scene_repr, camera_pose)
    
    def step(self, action):
        """执行动作并更新世界状态"""
        self.dynamics.predict_next_state(action)
        return self.get_current_observation()

三、具身智能:从仿真到现实

3.1 具身智能的三层架构

视启未来的具身智能系统采用三层架构设计:

┌─────────────────────────────────────────┐
│  决策层:大语言模型 + 任务规划器            │
│  输入:自然语言指令                        │
│  输出:子任务序列 + 目标状态描述             │
├─────────────────────────────────────────┤
│  技能层:视觉运动策略网络                   │
│  输入:视觉观测 + 目标状态                  │
│  输出:末端执行器轨迹 / 关节角度序列         │
├─────────────────────────────────────────┤
│  控制层:低层控制器 + 安全监控              │
│  输入:期望轨迹 + 实时传感器反馈             │
│  输出:电机力矩指令                        │
└─────────────────────────────────────────┘

3.2 Sim-to-Real 迁移的工程实践

从仿真环境训练到真实机器人部署,是具身智能面临的最大工程挑战之一。刘昊团队在实践中总结出以下关键经验:

1. 域随机化(Domain Randomization)

在仿真中引入大量随机扰动,使策略对真实环境的变化具有鲁棒性:

# 域随机化配置示例
randomization_config = {
    "visual": {
        "lighting": {"intensity": (0.5, 1.5), "color_temp": (3000, 7000)},
        "texture": {"randomize": True, "pool_size": 1000},
        "camera": {"position_noise": 0.02, "fov_range": (50, 70)}
    },
    "dynamics": {
        "friction": {"range": (0.3, 1.2)},
        "mass": {"scale_range": (0.8, 1.2)},
        "joint_damping": {"range": (0.01, 0.1)}
    },
    "action": {
        "latency": {"range_ms": (0, 100)},
        "noise": {"std": 0.05}
    }
}

2. 系统辨识与参数适配

在部署前对真实机器人进行系统辨识,获取准确的动力学参数,并据此微调仿真环境:

辨识参数 方法 精度要求
关节摩擦 恒速运动测试 ±5%
质量分布 摆动实验 ±3%
刚度矩阵 力控接触实验 ±10%
执行器延迟 阶跃响应测试 ±10ms

3. 渐进式部署策略

不直接将在仿真中训练的策略部署到真实机器人,而是采用渐进式策略:

  1. 仿真验证:在多种仿真环境中验证策略鲁棒性
  2. 硬件在环:将真实传感器接入仿真循环,验证感知模块
  3. 受限真实环境:在简化真实场景(固定物体、已知光照)中测试
  4. 完整真实环境:逐步增加场景复杂度,最终部署

3.3 世界模型驱动的机器人学习

视启未来的核心创新是用世界模型替代传统强化学习中的环境交互。传统 RL 需要机器人在真实环境中进行大量试错,成本高、风险大。而世界模型允许机器人在"想象"中学习:

# 世界模型驱动的强化学习
class WorldModelRL:
    def __init__(self, world_model, policy_network):
        self.world_model = world_model
        self.policy = policy_network
    
    def train_in_imagination(self, initial_states, num_episodes):
        """在世界模型中训练策略"""
        for episode in range(num_episodes):
            state = random.choice(initial_states)
            trajectory = []
            
            for step in range(self.max_steps):
                action = self.policy.sample(state)
                next_state, reward = self.world_model.predict(state, action)
                trajectory.append((state, action, reward, next_state))
                state = next_state
            
            # 基于想象轨迹更新策略
            self.policy.update(trajectory)
    
    def deploy_to_real(self, real_robot):
        """将训练好的策略部署到真实机器人"""
        # 仅需少量真实环境微调
        real_trajectories = real_robot.collect(100)
        self.policy.finetune(real_trajectories)

四、技术挑战与解决方案

4.1 视觉泛化

真实世界的视觉多样性远超仿真环境。视启未来采用以下策略提升视觉泛化能力:

  • 多模态融合:结合 RGB、深度、触觉等多模态信息
  • 自监督预训练:在大规模无标注视频数据上预训练视觉编码器
  • 持续学习:部署后持续收集数据,在线更新视觉模型

4.2 长程任务规划

复杂任务(如"整理房间")需要多步规划和错误恢复能力。解决方案包括:

  • 分层强化学习:高层策略负责任务分解,低层策略负责具体执行
  • 大语言模型规划:利用 LLM 的常识推理能力生成任务计划
  • 重规划机制:当执行失败时,基于当前状态重新生成计划

4.3 安全与可靠性

机器人与物理世界交互必须保证安全:

安全层级 机制 响应时间
硬件急停 物理按钮 / 力矩限制 < 1ms
控制层安全 碰撞检测 / 速度限制 < 10ms
策略层安全 危险动作过滤 < 50ms
任务层安全 人工监督 / 任务边界 < 1s

五、应用场景与商业化路径

5.1 工业质检

世界模型可以预测产品的正常外观,通过对比实际观测与预测结果的差异检测缺陷。相比传统视觉检测,世界模型能够处理更复杂的缺陷类型和光照变化。

5.2 家庭服务机器人

具身智能的终极场景之一是家庭服务机器人。世界模型让机器人能够理解家庭环境的三维结构,预测物体运动,规划安全高效的行动路径。

5.3 自动驾驶

世界模型在自动驾驶中的应用包括:

  • 场景理解:从多视角图像构建三维场景表征
  • 轨迹预测:预测其他交通参与者的未来行为
  • 决策规划:基于世界模型进行反事实推理,选择最优驾驶策略

六、总结与展望

刘昊在视启未来的工作展示了世界模型与具身智能融合的巨大潜力。从仿真到现实,从感知到行动,这一技术路线正在推动 AI 从"数字世界"走向"物理世界"。

2026 年 11 月,奇点智能技术大会,聆听刘昊分享世界模型与具身智能的最新突破。


大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
参会报名:https://boolan.com/enroll/c1051/event/1162?channel=seo

在这里插入图片描述

立即报名,探索世界模型与具身智能的融合未来!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐