WAIC前沿报告分享-物理原生智能Phi的概念定义、核心特征与技术体系
物理原生智能Phi的概念定义、核心特征与技术体系
2026年7月 世界人工智能大会(WAIC)创新发展论坛上,清华大学李升波教授发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的主题演讲,介绍了”物理原生智能”(Physics-native Intelligence, Phi)的概念与定义,并系统阐述其核心特征与技术体系,为破解物理世界的泛在智能开发难题提供了新型范式。

李升波指出,物理原生智能需要具备三项核心特征。第一,状态解耦表征(State-decoupled latent representation):利用状态而不是观测表征世界的运动特性,而且状态需要解耦为两个部分,即由物理模型的”显状态”和神经网络的”隐状态”两部分构成,兼顾描述的准确性与场景的泛化性。第二,时序因果优先(Temporality and causality as priorities):模型结构满足时序性和因果性,遵循事件发生时序优先的原则,且动作规划尽量减少对未来”预测”信息的依赖,减少模型推理过程的幻觉风险。第三,物理定律约束(Comply with underlying physical principles):训练算法嵌入底层物理规律的约束,包括训练动力学的对称守恒性以及辛几何结构等,同时满足人机物交互过程的硬性安全约束,即“绝对安全性”,且具有对小样本数据的持续学习能力。
下文根据会议演讲内容进行整理,根据演讲者的建议,略有增补删减:
各位嘉宾,大家上午好!今天诸位同仁汇聚一堂,共同探讨人工智能的技术发展与应用前景,我想是因为大家都看到了这一趋势:人工智能时代已然来临了。过去十年,以ChatGPT为代表一系列具有通用能力的人工智能技术不断涌现,不断推动智能系统由专用化走向通用化。

发展人工智能的核心目标是通用化。从视觉智能、语言智能起步,到融合视频、图像和文本的多模态智能,再到今天广泛热议的具身智能,技术演进的目标是一致的,就是不断提升智能的通用化水平。过去十年人工智能研究的经验是,通用化不仅仅是一个目标,而且是一类手段,通用化的智能反而可以解决各类“专用智能”无法解决的难题。另外,从应用的需求看,唯有广泛适用于各类不同的场景,才能使智能化系统从实验室的象牙塔真正走进千家万户,融入人们的日常生产生活。

具身智能是当前的研究热点,但它的基本概念并不复杂:人类是最典型的具身智能体。类似于人类与周围世界的交互,智能体通过感知获取环境信息,经过决策之后形成动作,再通过动作影响物理世界。具备这一完整感知、决策与动作过程,且与物理世界进行交互的智能体,我们称之为”具身智能”。

虽然当前各界讨论更多的是机器人,但汽车无疑是具身智能的先行领域。自动驾驶汽车可视为第一个规模化量产的具身智能系统,围绕自动驾驶开展研究的工程师和学者们也是具身智能的开拓者与先行者。随着智能化技术的不断发展,我们相信不远的未来,不仅仅是汽车和机器人,一切能够感知环境、推理决策、实施动作与物理世界交互的实体,都有可能成为智能的载体。这正是具身智能广受关注的重要原因。

问大家一个问题,具身智能的研究、开发与产业落地究竟难不难?从过去汽车领域的实践看,研发难度很大,也极具挑战。自动驾驶从上个世纪60年代就开始进入学术界的视野,至今已有数十年的研究历史。过去十年,以端到端模型训练为代表的技术体系虽然取得了长足地进步,但到目前为止大规模量产的系统仍以L2级驾驶辅助为主,且主要应用于高速公路和城市快速路。面向城区主干道路以及交叉路口、匝道、环岛等复杂工况,智能驾驶系统的场景泛化能力仍然相对薄弱。尽管不少人对与L4级自动驾驶的规模化应用持有十分乐观的态度,例如无人驾驶出租车,但这类系统的可靠性与安全性仍有待进一步提升,近两年不断出现的自动驾驶事故都证明了这一判断。
从这个例子看出,开发具身智能与现有的语言智能、视觉智能是存在显著性差异的。一个突出的区别是具身智能系统对安全性和可靠性的要求极高,甚至到了十分苛刻的程度。语言或视觉模型的输出主要作用于信息空间,容许一定的幻觉现象存在,甚至部分人认为”幻觉”本身就是创造性的一部分。而具身模型产生的动作将直接作用于物理世界,比如说高速行驶的汽车或家庭服务的机器人,每一次幻觉性动作都有可能导致重大的安全事故,这是不能被允许的。因此,如何构建高安全、高可靠、高泛化的具身智能系统,是摆在学术界和工业界面前的一项重大课题。

我们以汽车与机器人的对比进一步说明困难的产生原因。与汽车相比,机器人的自由度更高、系统结构更加复杂,交互对象和任务类型也更加多样。从模型、数据和训练三个维度看,现有自动驾驶模型达到百亿级参数规模,训练数据达到亿级驾驶片段。按照同样的技术路线,结合家居服务场景的要求进行预估,机器人的具身模型或许需要万亿级神经网络参数和千亿级真机交互片段,训练难度将比汽车领域高一个数量级甚至更多。这意味着训练一个实用性的具身智能模型将极具挑战性。如果仍然沿用现有视觉、语言和多模态大模型的训练思路,主要依赖更大的参数、更多的数据和更强的算力,我们能否经济、高效地实现泛在场景的具身智能呢?答案几乎是否定的。

从学术上说,具身智能归属为Safety-critical Intelligence,与人类交互的场景越多,对安全性要求越高。用于家居服务领域的机器人,尤其是面向老人、小孩等安全敏感对象,将比自动驾驶汽车将更加困难。幸运的是,过去六十余年中,人工智能的先驱者已经为我们提供了许多思想方面的启发,使我们能够从物理的视角重新思考具身智能的开发范式。例如,人工智能之父McCarthy强调建立世界的一般性表征;图灵奖获得者Pearl提出,要重视人类认知中因果关系的建模、分析与逻辑推断;诺贝尔奖获得者Hopfield则指出,应当关注物理系统所呈现出的集体属性。这些哲学式思考分别从世界表征、因果认知和物理结构等方面,为今天的具身智能研究提供了重要启发。

以这些重要思想为基础,结合近十年大模型领域的技术进展以及具身智能的客观需求,我与清华大学研究团队的同事们形成了”物理原生智能”的概念与定义,并逐步凝练了它的核心特征与技术体系。本次报告我们将对这一技术体系进行系统性地介绍。
物理原生智能是一类更加遵循物理世界的底层运行逻辑,且以实现与物理世界高质量交互为目标的具身智能。它仍然以数据驱动的端到端模型训练为基本架构,从世界模型、数据结构和训练算法三个维度体现物理实体对智能系统开发的要求。这些客观要求包括:第一,物理世界的高质量交互数据是十分稀缺的,而不是完备或富裕的,甚至不少领域几乎无真机数据;第二,与人类打交道的自动驾驶、机器人等具身智能系统对功能安全性的要求极高,任何一次幻觉性动作都可能引发重大事故;第三,考虑数据闭环的重要作用以及真实数据只能逐步累积的客观事实,具身模型的训练算法需要具有更强的稳定性、持续性和长期进化能力。
那么物理原生智能具备什么特征呢?包括三类核心特征:(1)以解耦的状态表征系统动力学,而不能直接采用传感器观测值描述世界,即物理世界的真实性是隐藏在观测之下的;(2)设计满足时序性与因果性的隐式模型结构,尽量减少对未来”预测”信息的依赖;(3)采用底层物理规律规范模型的训练过程,要求满足绝对安全性,且对小样本数据的持续学习能力。我们将这类具身智能称为Physics-native Intelligence,简称Phi。
世界模型使用状态而非观察的好处在于该模型将可直接嵌入物理层面的动力学模型,一方面有利于提升动作推理的准确性,进一步提升策略训练的准确性,另一方面对世界模型的可溯源性也有帮助。通常而言,预测信息,尤其是长时域的预测,又增加了一个不确定性环节,它的准确性是比较差的,这导致高质量的轨迹或者动作输出更加困难。

具体来说,物理原生智能的第一个特征,是利用状态对物理世界进行表征,而不是直接采用观测值,且要求显状态与隐状态两者是解耦的。系统状态由两个部分构成:显状态服从系统动力学与物理约束,从而保证状态转移的长期稳定;隐状态用于描述难以显式建模的因素,并服从物理规律驱动的受控转移,以降低长程推演过程中的信息失真。
第二个特征,是满足物理世界的时序性和因果性,具体包括三个方面。一是时序优先,即原因必须先于结果,二者的次序不能颠倒,系统动作生成尽量不要依赖状态的预测值;二是干预敏感,即当动作输入发生变化时,后续状态应当产生合理且可解释的差异;三是具备反事实推理的能力,不仅关注成功样本和正向经验,也重视失败样本、负向经验及其所带来的信息增益。
第三个特征,是将更加底层的物理规律嵌入模型与训练过程。一方面,由广义对称性决定的虚拟物理量应当保持广义的守恒性;另一方面,训练动力学应当保持相应的辛几何结构。也就是说,物理原生智能不能只是关注某一条具体的物理方程,还应该关注时空对称性、能量守恒性和辛几何结构保持等具有更强普适性的底层规律。同时以硬约束为代表的交互安全性(人机之间、机机之间、机环之间)是真实世界的基本要求,训练算法只能设法满足,不能无视违背。这类要求称之为“绝对安全性(Absolute Safety)”。

物理原生智能Phi还需要新的训练范式。一方面,采用虚实混合数据(hybrid data),利用仿真数据或互联网数据缓解真实物理世界数据稀缺的问题;另一方面,采用阶梯训练(staged training)方法,以步步为营、逐级提升的方式持续改善模型性能,一般来说都是先监督学习,后强化学习,而不是寄希望于通过某一种训练方法,一次性将模型性能提升至目标水平。我们团队的实践经验建议将训练过程至少划分为三个阶段:首先采用监督学习进行预训练,建立基础模型的初步通用能力;随后采用强化学习进行后训练,进一步提升特定任务的性能;最后在实车或真机上开展强化学习微调,使模型满足实际应用的性能与安全要求。每个阶段所使用的数据类型、性能指标和训练算法均有所不同,需要根据具体任务和约束条件进行调整。

当然,仅有上述基本特征和训练范式仍然不够,我们还需要进一步回答开发物理原生智能的具体措施。下面将从世界模型、数据结构和训练算法三个层面,介绍物理原生智能Phi的技术路径。世界模型是物理原生智能的核心。无论朴素世界模型NWM,还是世界动作模型WAM和受控世界模型CWM,面向具身智能的世界模型都面临一个核心问题,是如何引入动作信息,使模型不仅能够预测世界的状态演化,还能够推断动作对物理世界的影响,并进一步支撑对物理世界的干预。世界动作模型WAM通常通过引入逆动力学模型,将未来状态与动作建立关联;受控世界模型CWM则直接增加动作维度,将动作看做世界状态转移的条件。然而,这两类方法在长时程、精细化和高稳定性的动作输出方面仍然存在不足,与强化学习后训练、强化学习微调等类脑训练算法之间的匹配程度也有待进一步提升。

物理原生世界模型(Phi-World Model)进一步强化了模型对物理世界因果规律的满足,并增加了评价模型,提升策略模块的可训练性。该模型以显状态和隐状态两类状态作为转移动力学的核心:显状态直接嵌入物理动力学模型,隐状态则采用神经网络构造相应的物理表征和转移关系。从观测到状态的映射,可以采用已有的编码器机制,从而更好地利用现有大模型领域的发展成果。策略模块和评价模块直接与状态相关联,而不是仅仅依赖原始观测。这种结构化的信息输入有利于提升模型的动作准确性、功能安全性与可解释性。

物理原生数据(Phi-Data)层面,从当前观测到下一时刻观测的转移数据(o,a,o’)是基础组件。在此基础上,还需要增加奖励信号 (r) 以及人类经验知识 (K),三者共同构成物理原生数据的三类基本要素。无论是互联网视频数据、Ego或UMI数据,还是真机操作数据与仿真合成数据,都可以通过一定的数据重构、时空对齐和质量增强方法,转化为结构一致的物理原生数据。

这些数据要素如何与模型训练相结合?转移数据主要用于支撑编码器、解码器和受控转移模块的训练,并为策略模块的学习提供基础。奖励信号主要与强化学习相结合,用于训练评价模块并进一步提升策略性能。人类经验知识则可以借助多模态大模型的理解与评价能力,转化为相应的监督或评价信号,嵌入受控转移模型或评价模型,为世界模型性能的提升提供支持。

将数据信息有效注入模型,还需要相应训练算法的支持。物理原生算法(Phi-Algorithm)设计的第一个要求,是嵌入训练动力学的底层规律,尤其是结构对称与守恒特性。神经网络模型的训练过程,本质上可以被视为一个动力学系统的离散状态演化过程。类似于物理世界中的动力学,训练动力学也存在广义能量关系、辛几何结构保持等底层规律。如果能够将这些性质显式嵌入训练算法的设计过程,将有助于显著提升训练系统的稳定性。

物理原生算法的第二项要求,是具备绝对安全的保障能力。”绝对安全性(Absolute Safety)”是具身模型训练的一项特殊要求,其含义是在真机训练过程中,使每一代模型都满足相应的安全”硬约束”。这类似于人类新手学习驾驶的过程:不能只要求学习完成以后才实现”安全”驾驶,在整个学习过程中同样必须保证”安全”。从理论上看,要实现这一目标,就需要同步优化每一代策略及其所对应的安全可行区域。而安全可行区域的扩大,又与智能体对环境的认知不确定性相互制约,需要通过相应的博弈机制实现均衡。这是真机训练过程保障绝对安全的基本原理。

训练算法的第三项客观需求,是抗遗忘能力。这与人类大脑的持续学习机制相类似。由于具身领域的数据相对稀缺、完备性不足、应用场景繁多,并且不同任务均具有较高的性能要求,因此训练过程往往只能采用多阶段、分步骤的方式,每次仅依赖小样本就可以使模型性能持续进化,而不能期望累积足够数据之后,通过一次性训练解决所有问题。这一过程中,如何使每一批小数据都形成有效增益,并避免后续训练破坏模型已经获得的性能,是训练算法必须解决的基本问题。其设计关键在于建立明确的抗遗忘条件,并构造相应的梯度正交机制,以降低不同阶段训练任务之间的相互干扰。

围绕上述思路,我与团队的同事们、老师们、学生们在过去十年开展了一系列面向工业具身智能的基础理论、模型结构和训练算法研究。期间,我们自主研发了面向工业对象的强化学习训练平台GOPS。该平台贯通数据生成、场景建模、任务转化、网络构建、优化求解、参数调优以及最终的模型部署与系统应用,形成了功能一体化的工具链,以更好地支撑自动驾驶和机器人等领域的具身模型开发。

GOPS内嵌了一系列具有物理原生属性的算法,例如:DSAC通过连续值分布建模缓解策略高估问题,提升中小规模强化学习的稳定性;RAD将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡;LipsNet结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡;RACS构建安全强化学习的三元迭代框架,通过可行域内外的差异化更新,实现安全区域的单调扩展与策略收敛;DACER将反向扩散模型嵌入在线策略迭代过程,支持多模态动作生成并缓解策略分叉难题;BOOM采用规划自学习驱动的世界模型强化学习机制,兼顾算法稳定性与复杂控制性能;NANO依托自然梯度下降构造几何约束的非线性高斯滤波器,提升复杂系统的状态估计能力;MVP引入瞬时速度约束和复合生成与选择机制,兼具生成式策略的高表达能力与单步生成的高时间效率。这些算法覆盖神经网络优化器、神经网络结构设计、系统状态估计滤波、小模型强化学习训练、大模型强化学习训练、世界模型增强训练等不同环节。我们希望通过这些研究更好地赋能全行业,使智能的提升不只依赖数据规模与算力规模的增长,也能够通过模型结构和训练算法的创新实现进一步的突破。

最后简要总结今天的发言。自动驾驶是具身智能的重要起点,而物理原生智能为我们从自动驾驶走向机器人、走向更加广泛的物理实体,提供了一条值得持续探索的技术路径。人工智能时代刚刚到来,模型、数据、算法等领域的研究方兴未艾,人与智能系统的连接关系也正在逐步深化,让我们期待泛在具身智能Aha moment的早日到来!

谢谢大家的关注。请各界同仁多多批评斧正,并提出您的宝贵意见。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)