SIGGRAPH 2026 英伟达技术全栈解析:DLSS 5 渲染革命、AI 物理仿真与 Cosmos 3 世界模型的深度拆解
【摘要】围绕第 53 届 SIGGRAPH 大会英伟达发布的三项核心技术成果,拆解生成式渲染、AI 驱动物理模拟与世界模型的底层架构、实现逻辑与工程落地路径,明确各技术的适用边界与产业影响,为图形开发、工业仿真与具身智能领域从业者提供完整的技术判断框架。
引言
2026 年 7 月 20 日,第 53 届 SIGGRAPH 大会在洛杉矶开幕。作为全球计算机图形学领域的顶级学术与产业会议,本届大会首次将生成式 AI 与物理世界模拟作为核心叙事主线。英伟达在主题演讲中连续放出三项技术成果,覆盖实时渲染、工业物理仿真与世界模型三大领域,跳出了过往 “升级硬件性能” 的传统路径,转向构建从数字像素到物理规律的全栈技术体系。
过去三十年,计算机图形学的发展始终围绕 “算力换真实感” 的逻辑推进。从可编程着色器到光线追踪,每一次技术跃迁都依赖硬件算力的线性增长,而真实物理世界的模拟更是长期被超级计算机垄断。生成式 AI 的爆发为行业提供了新的解题思路,但概率性生成的不可控、时序不一致、物理规律缺失等问题,始终让其难以进入对确定性要求极高的工业与实时交互场景。
本次发布的三项技术恰好对应三类核心痛点:DLSS 5 解决生成式渲染的可控性与实时性问题,AI 流体模拟解决工业仿真的算力与效率矛盾,Cosmos 3 世界模型解决物理 AI 的数据供给瓶颈。本文面向图形开发工程师、工业仿真从业者、机器人与自动驾驶技术人员,从技术原理、架构设计、工程落地与产业影响四个维度展开拆解,同时明确各项技术的适用边界与风险点,为从业者提供完整的技术判断框架。
一、🎨 DLSS 5:生成式渲染重构实时图形管线

实时渲染的核心矛盾,始终是有限的帧时间预算与无限的真实感需求之间的冲突。4K 分辨率、60 帧每秒的交互标准下,单帧的渲染预算只有 16.6 毫秒,其中还要分配给游戏逻辑、物理计算、基础光栅化等环节,留给画质增强的时间窗口不足 5 毫秒。传统图形学沿着第一性原理的路径推进,通过光线追踪、全局照明等算法逼近物理真实,但算力开销随精度呈指数级上升,始终无法在消费级硬件上实现完全的照片级实时渲染。
生成式 AI 的出现提供了另一种可能。以扩散模型为代表的生成技术,已经能够离线生成以假乱真的图像内容,但直接将这类模型引入实时渲染管线,会面临三重无法回避的技术障碍。DLSS 5 的核心目标,就是将生成式 AI 的照片级真实感能力,完整嵌入传统渲染管线,同时满足实时交互的所有约束条件。
1.1 传统实时渲染与生成式 AI 的三重矛盾
1.1.1 艺术意图的确定性与生成模型的概率性矛盾
传统渲染管线的输出是完全确定的。给定相同的场景几何、材质参数与光照条件,同一台设备在同一驱动版本下,每一帧的渲染结果都完全一致。这种确定性是游戏美术、影视特效进行艺术创作的基础 —— 角色脸上的疤痕、武器的做旧痕迹、场景的色调风格,都必须严格遵循创作者的设计,不能有任何随机偏差。
通用生成式模型的底层逻辑是概率分布采样。输入同一张参考图,模型每次输出的细节、色调甚至物体结构都会存在差异。对于离线作图场景,这种随机性可以通过多次采样筛选来规避,但在实时交互场景中,每一帧的随机变化会导致画面闪烁、物体漂移,甚至破坏角色的身份特征。早期生成式渲染原型引发的争议,核心就在于模型会自动 “优化” 掉美术设计的瑕疵细节,比如抹平角色面部的皱纹、疤痕,破坏原本的艺术表达。
创作者意图的完整保留,是生成式渲染进入工业管线的第一门槛。如果不能保证底层几何、语义与艺术方向的绝对稳定,再强的真实感也没有工程价值。
1.1.2 三维结构的一致性与二维生成的偏差
传统渲染基于完整的三维场景数据,所有像素都对应明确的空间位置、法线方向与材质属性。玩家移动视角时,场景的空间关系始终保持一致,物体的倒影、阴影会随视角变化呈现符合物理规律的运动。
通用图像生成模型本质是二维信号处理。它通过海量图片学习到了真实世界的视觉规律,但并不理解三维空间结构。当视角发生连续变化时,模型很容易出现结构错误 —— 比如倒影错位、阴影漂移、物体边缘扭曲。这类问题在单张图片生成中不易察觉,但在连续的实时画面中会非常明显,严重破坏沉浸感。
1.1.3 实时交互的低延迟与大模型的高算力矛盾
离线生成模型可以用数秒甚至数分钟生成一张高分辨率图片,因为不需要响应用户的实时操作。实时渲染则必须严格遵守帧时间约束,4K 60 帧的标准下,单帧处理必须在 16 毫秒内完成,其中留给 AI 增强的窗口通常只有几毫秒。
主流的扩散生成模型参数量普遍在数十亿到上百亿级别,单张 4K 图片的推理时间通常以秒为单位,直接放入实时渲染管线完全不具备可行性。如何在保留生成质量的前提下,将模型压缩到毫秒级推理速度,是生成式渲染落地的核心工程难题。
1.2 DLSS 5 的核心技术架构
DLSS 5 没有采用 “用 AI 直接生成画面” 的路线,而是选择了 “引擎渲染为骨架,AI 增强为皮肉” 的技术路径。整个系统完全锚定游戏引擎输出的底层渲染数据,在不改变场景结构与艺术意图的前提下,对画面质感进行精细化提升。

1.2.1 基于 G-Buffer 锚定的双层损失函数设计
DLSS 5 能够严格保留艺术意图,核心在于训练阶段的双层约束损失函数,而非单纯依赖模型的自主学习能力。第一层为几何结构约束损失,模型输出结果必须与引擎输出的深度、法线、物体 ID 缓冲完全对齐,任何偏离底层几何结构的生成结果都会被施加极高的惩罚权重。这一层损失直接锁死了场景的空间拓扑,确保物体轮廓、位置、大小不会发生任何偏移,从根源上避免了生成模型 “改结构” 的问题。
第二层为语义一致性损失,模型必须严格匹配反照率缓冲的基础色调与材质分类。引擎标注的皮肤、金属、玻璃、布料等材质标签,会强制模型在对应区域生成符合材质属性的细节,不能把塑料生成金属,也不能把皮肤生成布料。角色面部的疤痕、纹身等特殊标记,会通过物体 ID 子通道单独标注,模型只能在标记范围内增强细节,不能修改或消除标记。
双层损失的权重远高于画质提升的感知损失,相当于给模型套上了刚性框架,AI 只能在框架内做质感优化,不能突破框架修改内容。这也是 DLSS 5 和通用图像修复模型最核心的区别:通用模型以真实感为第一目标,结构一致性是附加约束;DLSS 5 以结构与语义一致性为第一目标,真实感是框架内的优化目标。
1.2.2 渐进式蒸馏的单步推理实现
主流扩散模型通常需要 20 到 50 步迭代去噪才能生成高质量结果,无法满足实时渲染的毫秒级要求。DLSS 5 的单步推理能力,来自多阶段的渐进式知识蒸馏,而非原生的单步扩散架构。
蒸馏过程分为三个阶段。第一阶段训练一个高精度的教师模型,采用多步扩散架构,保证生成质量达到照片级标准,不需要考虑推理速度。第二阶段将教师模型的多步去噪过程蒸馏为少步学生模型,把几十步的去噪过程压缩到 4 到 8 步,同时保留 95% 以上的画质。第三阶段进一步蒸馏为单步模型,通过大量配对数据训练,让单步模型直接学习从输入 G-Buffer 到最终画质增强结果的端到端映射,省略中间的迭代去噪过程。
最终落地的单步模型参数量仅为教师模型的十几分之一,所有计算都可以在 Tensor Core 上高效执行,单帧 4K 分辨率的处理时间可以控制在 3 毫秒以内,完全适配实时渲染的时间预算。这种蒸馏方案的代价是极限画质略低于多步教师模型,但在实时交互场景下,这种画质损失几乎不可感知,换来的速度收益极具工程价值。
1.2.3 多模型与逐对象的精细化调控体系
为了适配不同的美术风格与场景需求,DLSS 5 提供了三套独立的 AI 模型。三套模型的训练数据与优化方向各有侧重:Model A 更侧重高频结构细节,适合表现皮肤纹理、布料纤维、金属划痕等精细材质;Model B 更侧重整体光影氛围,适合户外大场景、黄昏夜景等氛围感强的环境;Model C 则偏向写实风格的平衡调校,适配大多数通用场景。
开发者不需要全局绑定单一模型,可以按场景、按物体灵活分配。比如过场动画可以用风格更突出的模型,战斗场景用性能更保守的模型;角色皮肤用 Model A 增强细节,背景环境用 Model B 调整氛围。
在此基础上,DLSS 5 还提供了两个核心调控滑块与一套遮罩系统。结构强度滑块控制高频细节的增强幅度,比如毛孔、微小阴影、材质纹理的清晰程度;色调强度滑块控制低频光影的调整幅度,比如整体光照氛围、环境色渗透的强度。
逐对象遮罩系统则允许开发者精确指定 AI 增强的作用范围。开发者可以在引擎中直接拉取物体 ID,指定只对某串葡萄、某个酒瓶应用 DLSS 5 增强,旁边的木板、背景的墙面完全保持原生渲染效果。这种精细化控制能力,让美术团队可以精准拿捏 AI 增强的尺度,既提升画面真实感,又不会破坏整体的艺术风格统一性。
DLSS 5 与传统超分辨率技术的核心区别十分清晰。传统 DLSS 的核心目标是提升性能,通过低分辨率渲染加 AI 超分,在保证画质的前提下提高帧率。DLSS 5 的核心目标是提升画质,它在原生渲染分辨率的基础上,对画面质感进行增强,不承担分辨率放大的职责。简单来说,传统 DLSS 是 “用更少的算力渲染同样的画质”,DLSS 5 是 “用同样的算力渲染更真实的画质”,两者属于渲染管线中不同环节的技术,可以叠加使用。
|
版本 |
核心定位 |
核心技术 |
输入数据 |
核心目标 |
|---|---|---|---|---|
|
DLSS 1.0 |
性能提升 |
超分辨率重建 |
低分辨率彩色帧 |
提升帧率 |
|
DLSS 3.0 |
性能提升 |
帧生成 + 超分 |
彩色帧 + 运动向量 |
大幅提升帧率 |
|
DLSS 3.5 |
画质辅助 |
光线重建 |
光线追踪缓存 |
优化光追质量 |
|
DLSS 5 |
画质升级 |
生成式质感增强 |
完整 G-Buffer |
照片级真实感 |
1.3 工程三角平衡:画质、一致性与性能的取舍逻辑
生成式渲染落地的核心难点,从来不是 “能不能做出好画质”,而是如何在画质、时序一致性、性能三个指标之间找到稳定的平衡点。三者构成了典型的不可能三角:追求极致画质会牺牲一致性与性能,追求极致性能会损失画质与细节,追求绝对一致性又会限制 AI 的发挥空间。
1.3.1 强度滑块背后的权重权衡
开发者控制台中的两个核心滑块,本质就是三角平衡的调节入口。结构强度滑块控制几何约束损失的权重:滑块拉满时,几何约束权重最高,AI 只能补充极细微的材质纹理,画面一致性最强,几乎不会出现任何结构漂移,但画质提升幅度有限;滑块调低时,几何约束权重下降,AI 可以补充更多光影细节,真实感更强,但小物体、边缘区域出现结构漂移的概率会上升。
色调强度滑块控制光照语义约束的权重:滑块拉满时,AI 只能在引擎原生光照的基础上做微调,整体光影氛围完全由美术团队控制,艺术方向最稳定;滑块调低时,AI 可以更自由地优化全局光影、环境色渗透与氛围效果,画面电影感更强,但可能偏离美术设定的整体色调。
实际项目开发中,不会全局使用统一的参数。通常的做法是:主角、关键道具等核心元素使用高结构强度,保证身份与设计不跑偏;背景环境、远景区域使用较低的结构强度,最大化提升整体画面质感;过场动画可以适当降低约束权重,追求最优画面表现;多人对战等强交互场景则拉高约束权重,优先保证稳定性。
1.3.2 因果约束下的时序一致性实现
实时渲染的时序一致性,和离线视频生成的一致性实现逻辑完全不同。通用视频生成模型可以同时看到前后多帧信息,通过全局对齐来保证画面稳定,属于 “上帝视角” 的处理方式。游戏渲染是严格因果的,下一帧的内容由玩家操作决定,模型绝对无法提前看到未来帧,只能基于当前帧与历史帧信息做处理。
DLSS 5 的时序稳定机制,完全依赖引擎输出的运动向量与历史帧缓存。运动向量记录了画面中每个像素从上一帧到当前帧的位移轨迹,模型根据运动向量将上一帧的生成结果对齐到当前帧,再结合当前帧的 G-Buffer 数据生成最终结果。历史帧信息的引入,大幅减少了单帧生成的随机波动,避免了画面闪烁。
这种机制也存在对应的工程风险。如果运动向量不准确,比如快速运动的物体边缘、透明物体、粒子特效,历史帧对齐会出现误差,累积多帧后就会出现拖影、残影等问题。因此 DLSS 5 针对这类特殊材质做了单独的降级处理:透明物体、粒子特效不参与历史帧累积,完全采用单帧生成,牺牲部分细节来避免残影问题。
1.4 行业路线对比与落地适配要点
1.4.1 跨平台生成式超分的路线差异
随着生成式渲染成为行业趋势,AMD、Intel 也相继推出了各自的生成式画质增强技术,三者的技术路线与产品定位存在本质区别。
|
对比维度 |
DLSS 5 |
AMD FSR 生成式增强 |
Intel XeSS 生成式版本 |
|---|---|---|---|
|
核心路线 |
硬件软件深度协同,Tensor Core 专属加速 |
跨硬件通用计算,依赖 Shader 执行 |
跨硬件通用计算,兼容 Xe 矩阵指令 |
|
输入依赖 |
完整 G-Buffer + 运动向量 + 物体 ID |
简化 G-Buffer + 彩色帧 |
简化 G-Buffer + 运动向量 |
|
可控粒度 |
逐对象、逐材质级精细控制 |
全局开关 + 简单强度调节 |
全局强度调节 |
|
画质上限 |
高,单步专用蒸馏模型 |
中,通用模型适配多硬件 |
中低,兼容优先 |
|
一致性表现 |
强,多层几何语义约束 |
中等,基础几何约束 |
中等 |
|
硬件生态 |
仅支持英伟达 RTX 平台 |
支持全品牌显卡 |
支持全品牌显卡,Intel 平台优化 |
三条路线的底层逻辑差异,本质是厂商生态定位的差异。英伟达拥有完整的硬件与软件生态,不需要考虑跨平台兼容,因此可以走极致体验路线,用专用硬件 + 专用模型换最优的画质与可控性。AMD 与 Intel 的显卡市场份额较低,必须走跨平台通用路线,通过兼容更多硬件来扩大用户基数,代价是无法做深度的硬件协同优化,画质与可控性上限更低。
生成式渲染的路线之争,本质不是技术优劣之争,而是生态策略之争。对于开发者而言,不存在绝对的最优选择,需要根据目标用户的硬件分布来做选型。如果目标用户以英伟达显卡为主,DLSS 5 是体验最优的方案;如果需要覆盖全平台用户,则需要兼容通用生成式方案。
1.4.2 项目落地的常见问题与规避方案
生成式渲染管线的落地不是简单接一个 SDK,需要对现有美术管线做针对性调整,实际项目中最常遇到三类问题。
第一类是小物体与细线结构的破碎问题。当物体尺寸小于几个像素时,G-Buffer 中的几何信息会严重不足,AI 模型很容易将细线生成断续的虚线,将小颗粒物体生成不规则斑块。规避方法是对小物体做尺寸分级,小于特定像素尺寸的物体强制关闭生成式增强,保留原生渲染结果,或者通过 LOD 策略保证近距离下物体有足够的像素覆盖。
第二类是高光与反射的漂移问题。金属、玻璃等强反光材质的高光位置对视角非常敏感,AI 生成的高光很容易出现位置偏移,导致反射画面闪烁。规避方法是将高光反射通道单独拆分,镜面反射、光线追踪反射的核心区域强制保留原生计算结果,AI 只对反射的边缘与过渡区域做质感增强,既提升真实感又保证反射位置准确。
第三类是美术资产的适配成本问题。传统管线中美术团队会制作非常精细的法线贴图、粗糙度贴图来模拟材质细节,接入 DLSS 5 后,很多细节 AI 会自动生成,过细的贴图反而会和 AI 生成的细节产生冲突,出现纹理叠加的噪点。适配过程中需要适当降低基础材质的高频细节,保留中低频结构,把高频细节交给 AI 生成,既能减少美术工作量,又能获得更好的最终效果。
生成式渲染不会完全替代传统着色器开发。传统着色器负责定义场景的基础几何、材质语义与光照框架,是整个渲染管线的骨架;生成式 AI 负责在骨架基础上补充真实感细节,提升画面质感。两者是互补关系,而非替代关系,着色器开发的核心价值会从 “模拟细节” 转向 “定义结构与语义”。
二、⚙️ AI 物理模拟:数据驱动范式重构工业仿真体系

如果说 DLSS 5 改变的是 “眼睛看到的真实感”,那么 AI 物理模拟改变的就是 “世界运行的真实规律”。在航空航天、汽车制造、气象预测、芯片散热等工业领域,物理仿真是产品设计的核心环节。传统物理仿真基于数值方法求解偏微分方程,精度越高算力开销越大,长期依赖超级计算机与大型计算集群,迭代效率极低。
英伟达在本次大会上展示的 AI 流体模拟技术,用数据驱动的方式重构了物理仿真流程。它将包含数十亿自由度的流体力学数据,压缩到仅 200MB 的模型中,在单张消费级工作站显卡上实现毫秒级的高精度仿真,将工业设计的迭代效率提升了万倍以上。
2.1 传统数值模拟的算力困局与迭代瓶颈
2.1.1 CFD 仿真的网格爆炸问题
计算流体动力学(CFD)是工业设计中最常用的物理仿真方法,用于模拟空气、水等流体的运动规律。传统 CFD 的核心思路是空间离散化:将整个模拟空间切割成无数微小的网格,然后针对每个网格,根据纳维 - 斯托克斯方程等物理公式,计算流体的速度、压力、温度等参数的变化。
模拟精度与网格密度直接相关。网格切得越细,时间步长设得越短,模拟结果就越准确,但计算量会呈指数级增长。一个高精度的飞机气动仿真,可能包含数十亿个网格自由度,需要超级计算机连续运行数天才能得到一组结果。如果要模拟复杂的湍流、边界层效应,算力开销还会进一步上升。
这种 “精度换算力” 的矛盾,是工业仿真的核心痛点。设计师为了控制计算成本,往往只能降低模拟精度,或者减少迭代次数,最终影响产品设计的优化空间。
2.1.2 工业设计的迭代效率瓶颈
工业产品的优化是一个反复试错的过程。以汽车外形设计为例,设计师调整一次尾翼角度,就要重新跑一次完整的风阻仿真,等待数小时甚至数天才能拿到结果,然后根据结果再做下一次调整。一款车型的空气动力学优化,往往要经历上百次迭代,耗时数月之久。
航空发动机、芯片散热、建筑风环境等领域的设计,都面临同样的问题。漫长的仿真周期拉长了整个产品的研发周期,也提高了试错成本。很多创新的设计思路,因为仿真成本太高而无法充分验证,最终只能停留在概念阶段。
2.2 AI 物理模拟的核心技术原理
英伟达的 AI 物理模拟,没有沿着 “更高效求解方程” 的传统路线优化,而是转向了 “从数据中学习物理规律” 的全新范式。
2.2.1 几何感知的自适应 Token 化机制
AI 能够处理流体力学问题,第一步是将传统的网格仿真数据转换为 Transformer 模型可以处理的序列数据。这个转换过程不是简单的网格平铺,而是带有物理感知的自适应 Token 化,直接决定了模型的精度与效率。
传统 CFD 仿真输出的是结构化或非结构化网格数据,每个网格点对应速度、压力、温度等物理量。如果直接把所有网格点作为 Token 输入 Transformer,计算量会随网格数量平方增长,完全无法处理大规模仿真数据。
英伟达采用的是几何感知的自适应 Token 划分方案。首先根据物体几何边界与流场梯度分布,将整个计算域划分为不同大小的 Token 区域:物体表面、边界层、激波等物理量变化剧烈的区域,划分更细的 Token,保证精度;远场、均匀来流等物理量变化平缓的区域,划分更大的 Token,减少计算量。每个 Token 对应一个局部流场区域,包含该区域的几何特征与物理状态特征,经过编码器转换为固定维度的特征向量。
这种自适应划分方式,既保留了关键区域的计算精度,又大幅减少了总 Token 数量,让 Transformer 可以高效处理大规模流场数据。和均匀网格的处理方式相比,同等精度下的计算量可以降低一个数量级以上。
2.2.2 物理归纳偏置的混合训练架构
纯数据驱动的 AI 模型很容易出现违背物理定律的结果,比如质量不守恒、能量不守恒,这也是早期 AI 流体模拟无法用于工业场景的核心原因。英伟达的方案没有完全抛弃第一性原理,而是将物理规律作为归纳偏置嵌入模型训练过程,实现数据驱动与物理定律的融合。
具体实现采用了残差学习 + 物理约束的混合训练策略。模型不直接预测完整的流场结果,而是先通过传统的低精度快速求解器得到一个基础流场,AI 模型只预测基础流场与高精度流场之间的残差部分。基础流场天然满足质量守恒、动量守恒等基本物理定律,AI 只负责补充细节、修正误差,从根源上避免了出现违背物理规律的离谱结果。
训练过程中还会加入物理守恒损失项。对模型输出的结果,直接计算质量、动量、能量的守恒误差,将误差作为损失函数的一部分反向传播。通过这种方式,模型在学习数据规律的同时,会持续受到物理定律的约束,输出结果的物理自洽性大幅提升。
这种混合路线是当前工业级 AI 仿真的主流方向。纯第一性原理方法速度太慢,纯数据驱动方法可靠性不足,两者结合可以同时兼顾效率与精度,是最适合工程落地的技术路径。
2.3 精度边界与误差控制机制
公开演示中 1%-2% 的误差是有明确适用范围的,并非所有场景都能达到这个精度。清晰理解误差的分布规律与边界,是正确应用 AI 仿真的前提。
误差水平和三个因素直接相关。第一是几何形状与训练集的相似度,和训练集中气动布局越接近的形状,预测误差越低;完全全新的构型、颠覆性的外形设计,误差会明显上升。第二是工况参数的范围,训练集覆盖的马赫数、攻角、雷诺数范围内,误差稳定在 1%-2%;超出范围的极端工况,误差可能上升到 5%-10%,甚至更高。第三是物理量的类型,压力、速度等宏观量的预测误差较低,剪切应力、热流等壁面精细量的预测误差更高。
AI 仿真的精度不是一个固定数值,而是随场景偏离训练分布的程度动态变化的。这是它和传统 CFD 最核心的区别:传统 CFD 的误差由网格与算法决定,和具体工况关系不大;AI 仿真的误差由数据覆盖范围决定,越熟悉的场景越准确,越陌生的场景越不可靠。
实际工程应用中,通常会配套一个不确定性估计模块。模型输出流场结果的同时,会给出每个区域的预测置信度。置信度高的区域可以直接使用结果,置信度低的区域则提示需要用传统 CFD 做验证。这种带置信度的输出方式,让工程师可以清晰知道哪些结果可信,哪些需要复核,避免黑盒模型带来的设计风险。
很多人会将 AI 物理模拟和传统的降阶模型(ROM)混淆,两者都可以实现快速仿真,但底层逻辑与能力边界有本质差异。
|
对比维度 |
传统降阶模型(POD/ROM) |
AI 驱动物理模拟 |
|---|---|---|
|
核心原理 |
模态分解,提取流场的主要基函数 |
特征学习,从数据中提取流场规律 |
|
几何泛化能力 |
极弱,仅适用于固定几何形状 |
强,可泛化到同类不同几何形状 |
|
参数泛化范围 |
窄,仅在小范围参数区间内有效 |
宽,可覆盖较大的工况参数范围 |
|
精度变化 |
参数越偏离中心点,误差快速上升 |
误差随偏离训练分布缓慢上升 |
|
数据需求 |
少量仿真样本即可构建 |
需要大量多样化仿真数据训练 |
|
适用场景 |
固定外形的快速参数优化 |
多方案对比、外形迭代设计 |
传统降阶模型的本质是对已知流场的线性组合,它没有学习到物理规律,只是把已有的仿真结果拆成基函数,用的时候重新加权组合。一旦几何形状发生变化,或者工况超出训练范围,结果就会完全失效。
AI 物理模拟则是通过大规模数据学习到了流场演化的内在规律,可以对从未见过的几何形状做出合理预测。它的泛化能力是降阶模型的数十倍,能够支撑真正的设计迭代,而不只是固定外形的参数微调。这也是为什么说 AI 仿真带来的是效率革命,而不是简单的优化升级。
2.4 工业落地的分层应用模式
2.4.1 合规场景下的分层落地路径
AI 物理模拟无法直接替代传统 CFD 的全部作用,尤其是在需要合规认证的场景。航空航天、汽车安全等领域的仿真结果,需要作为认证依据提交给监管机构,必须具备可追溯性、可解释性与确定性,黑盒的 AI 模型目前还无法满足这些要求。
当前行业的主流落地路径是分层应用模式,将 AI 仿真嵌入设计流程的不同阶段,而非全盘替代。在概念设计阶段,用 AI 仿真快速筛选大量方案,从几十上百个设计中快速选出几个有潜力的方向,这个阶段追求速度,允许一定误差。在详细设计阶段,用 AI 仿真辅助参数迭代,设计师实时调整参数,实时看到性能变化,快速找到最优参数区间。在最终定型阶段,用传统高精度 CFD 对最终方案做完整验证,输出合规的仿真报告,作为认证依据。
这种分层模式可以将整体研发效率提升数倍到数十倍,同时完全满足合规要求。AI 负责把 90% 的低效试错工作前置,传统方法负责最后 10% 的精准验证,两者形成互补而非替代关系。
AI 物理仿真不会取代传统 CFD 工程师。它的价值是将工程师从重复的仿真跑算工作中解放出来,让工程师将更多精力投入到设计创新、方案优化与结果验证等高价值工作中。工程师的核心竞争力会从 “熟练使用仿真软件” 转向 “理解物理规律、判断结果可靠性、主导设计优化”。
2.4.2 数字孪生等新兴场景的适配
除了产品设计,AI 仿真另一个快速落地的场景是数字孪生。工业设备的数字孪生需要实时仿真运行状态,传统 CFD 速度太慢,无法满足实时性要求。AI 仿真模型体积小、速度快,可以部署在边缘端,实时模拟设备内部的流体、温度变化,支撑实时监控、预测性维护等应用。这类场景对绝对精度要求不高,但对实时性要求很高,刚好匹配 AI 仿真的技术优势。
英伟达在演讲中也明确提到,目前的技术已经在流体力学领域验证了可行性,未来会逐步向电磁学、结构力学等更多物理领域拓展,最终目标是构建覆盖多物理场的 AI 仿真体系。
三、🌌 Cosmos 3 世界模型:构建物理 AI 的虚拟训练母体

DLSS 5 解决了视觉真实感的问题,AI 物理模拟解决了物理规律的计算效率问题,两者结合起来,就构成了构建高保真虚拟世界的基础。而构建这个虚拟世界的最终目标,是为物理 AI 提供训练环境。
物理 AI 也就是具身智能,包括机器人、自动驾驶系统等,它们需要在真实物理世界中执行任务。当前物理 AI 发展的最大瓶颈,不是算法不够先进,而是训练数据严重不足。Cosmos 3 世界模型的核心价值,就是用算力生成无限的虚拟训练数据,打破物理世界的时间与空间限制,加速物理 AI 的进化。
3.1 物理 AI 的核心死穴:数据供给的时空约束
3.1.1 具身智能的数据采集困境
语言大模型能够快速爆发,核心前提是互联网上积累了海量的文本数据,开发者可以通过爬虫快速获取大规模语料进行训练。物理 AI 没有这样的现成数据资源。机器人学习抓取物体、避障、操作工具,这些物理交互技能没有现成的数据集可以下载。
传统的数据采集方式是真实世界录制。训练机械臂抓取,需要操作人员佩戴 VR 设备,一次次演示抓取动作;训练自动驾驶,需要派出测试车队在公路上行驶几千万公里。这种方式的数据精度很高,但效率极低。真实世界的时间是匀速流逝的,一个小时的真实交互数据,就必须花一个小时去录制,没有办法快进。
更棘手的是极端场景的覆盖。比如机器人遇到意外碰撞、自动驾驶遇到鬼探头,这类场景在真实世界中发生的概率极低,可能行驶几百万公里才能遇到一次。靠真实数据采集,很难覆盖足够多的极端案例,导致物理 AI 的边界能力始终存在短板。如果只靠真实世界数据训练,物理 AI 的迭代速度会被牢牢锁死在真实时间的流速上,发展进程会极其缓慢。
3.1.2 传统虚拟训练的真实度鸿沟
行业很早就想到了用虚拟仿真来解决数据问题。在游戏引擎里搭建虚拟环境,让 AI 在虚拟环境中训练,然后迁移到真实世界。但传统虚拟仿真有两个核心问题:一是真实度不足,虚拟环境的物理规律、视觉效果和真实世界存在差异,AI 在虚拟环境中学到的技能,迁移到真实世界会出现明显的性能下降,也就是 “仿真到现实的鸿沟”;二是场景搭建成本高,每一个新的训练场景都需要美术团队手工搭建,扩展速度很慢,无法满足大规模多样化训练的需求。
生成式 AI 的出现为解决这两个问题提供了可能。用生成式 AI 构建虚拟世界,既可以实现极高的视觉与物理真实度,又可以快速生成无限多样化的训练场景,彻底解决数据供给的瓶颈。
3.2 Cosmos 3 的全模态架构设计
Cosmos 3 不是普通的视频生成模型,而是专门为物理 AI 设计的多模态世界模型。它的核心特点是将 “动作” 作为核心模态,打通了视觉理解、逻辑推理与物理执行的完整链路。
3.2.1 MoT 混合 Transformer 双塔式主干
Cosmos 3 采用 Mixture of Transformers(MoT)混合架构,由两个核心分支组成,两个分支共享中间表征,实现信息的双向流通。
第一个分支是推理塔,采用自回归 Transformer 架构,负责多模态理解与逻辑推理。它接收图像、视频、文本、音频等输入,理解当前场景的状态,分析物体之间的物理关系,预测接下来可能发生的变化,规划后续的动作序列。这个分支相当于物理 AI 的 “大脑”,负责认知与决策。
第二个分支是生成塔,采用扩散 Transformer 架构,负责生成视觉与音频内容。它根据推理塔的决策结果,生成符合物理规律的下一帧画面、环境声音等输出。这个分支负责构建虚拟世界的感官体验。
和普通视频生成模型不同,Cosmos 3 的生成不是无目的的视觉创作,而是受动作与物理规律约束的状态演化。生成的每一帧画面,都必须严格符合前序动作带来的物理结果,不能出现违背物理规律的画面内容。

3.2.2 SE (3) 统一动作模态的编码体系
Cosmos 3 最核心的创新,是将 “动作” 作为独立的核心模态引入模型,并设计了通用的几何动作表达语言。
传统的机器人控制系统,不同形态的机器人有完全不同的控制接口。四轮自动驾驶汽车、单臂工业机器人、双足人形机器人,它们的动作指令格式完全不兼容,训练数据无法通用。英伟达为 Cosmos 设计了一套统一的几何动作描述体系,以 SE (3) 特殊欧氏群作为动作的统一表达基础。SE (3) 可以完整描述刚体在三维空间中的平移与旋转,是机器人学中的标准运动表示方式。
任何机器人的动作都可以拆解为多层 SE (3) 变换:机器人整体的位姿是一个 SE (3) 变换,每个关节的运动对应末端执行器相对于机身的 SE (3) 变换,夹爪的开合可以简化为一维的状态量。无论四轮车、机械臂还是双足人形机器人,都可以统一表示为 “主体位姿 + 多个末端执行器位姿 + 执行器状态” 的组合。
这套统一表达的价值在于,它构建了一套跨形态的动作语言。所有动作数据都可以用这套标准格式存储和处理,不需要针对每种机器人单独设计接口。训练好的世界模型,可以同时支持多种形态的机器人,只需要更换对应的运动学映射层,不需要重新训练整个模型。
3.2.3 人类视频到机器人技能的迁移链路
互联网上海量的人类操作视频,能够转化为机器人训练数据,核心依赖完整的动作逆向工程链路,整个过程分为四个步骤。
第一步是人体姿态估计。从第一人称或第三人称视频中,识别出人体的骨骼关键点,得到人体各关节的运动轨迹。第二步是逆向运动学求解。根据骨骼轨迹,计算出每个关节的角度变化,还原出人类完成动作时的运动序列。第三步是动作标准化。将人体的运动序列转换为统一的 SE (3) 动作表达,提取末端执行器的运动轨迹与操作逻辑,剥离人类特有的身体结构特征。第四步是机器人重定向。将标准化的动作轨迹,根据目标机器人的运动学约束,转换为机器人可以执行的关节控制指令。
这个过程不是简单的动作复刻,而是技能层面的抽象迁移。模型学习的不是 “人的手怎么动”,而是 “完成这个操作需要末端执行器按什么轨迹运动、施加多大的力”。抽象出来的操作逻辑,可以迁移到任何形态的机器人上。比如人类颠锅的动作,既可以迁移给人形机器人的双手,也可以迁移给单臂工业机器人,核心的运动轨迹与发力逻辑是通用的。
这条链路的价值在于,它彻底打开了物理 AI 的数据来源。此前机器人训练数据只能靠人工演示,产量极低;现在互联网上所有包含操作动作的视频,都可以转化为训练数据,数据供给的规模提升了几个数量级。
Cosmos 3 和通用视频生成模型有本质区别。两者的核心目标完全不同。通用视频生成模型的目标是生成符合人类审美、视觉真实的视频内容,服务于内容创作场景。Cosmos 3 的目标是构建符合物理规律、可交互、可用于 AI 训练的虚拟世界,服务于物理 AI 训练场景。通用视频生成模型只需要画面好看,不需要对动作输入做出精准物理响应;Cosmos 3 则必须严格响应动作输入,保证物理交互的正确性,视觉真实只是基础要求,不是最终目标。
3.3 Cosmos Dreams:闭环神经模拟器的训练工作流
Cosmos 3 的能力最终落地为具体的训练工具,就是 Cosmos Dreams 闭环神经模拟器。它可以生成完全交互式的虚拟环境,让自动驾驶、机器人的 AI 算法在其中进行闭环训练与验证。
完整的闭环训练工作流分为五个核心环节,循环往复。第一环节是场景初始化,根据训练任务生成对应的虚拟环境,包括场景布局、物体属性、光照天气、初始状态等。生成式架构可以快速生成大量差异化的场景,避免 AI 过拟合单一环境。第二环节是感知输入,世界模型生成对应视角的图像、深度、点云等传感器数据,模拟真实机器人的传感器输出,同时加入合理的噪声与误差,更贴近真实硬件的表现。
第三环节是策略推理,待训练的机器人或自动驾驶算法接收传感器数据,输出动作控制指令。这个环节中,训练的算法和世界模型是完全解耦的,算法不知道自己处于虚拟环境中,和接真实传感器数据的运行逻辑完全一样。第四环节是状态演化,世界模型接收动作指令,根据物理规律演化出下一时刻的环境状态,生成新的传感器数据。第五环节是奖励与反馈,根据任务目标计算当前状态的奖励值,比如抓取成功给正奖励,碰撞物体给负奖励,奖励信号回传给策略算法用于参数更新。
和传统仿真环境相比,Cosmos Dreams 的核心优势是场景泛化能力。传统仿真器的所有资产都是人工制作的,场景数量有限,AI 很容易过拟合仿真环境的特定模式,迁移到真实世界效果大幅下降。生成式仿真环境可以无限生成全新的场景、物体、光照条件,强迫 AI 学习通用的物理技能,而不是记住特定场景的应对方式,最终训练出的策略迁移到真实世界的成功率更高。
这类神经模拟器最开始的算力需求非常高。几个月前,运行一套实时的高保真自动驾驶仿真环境,需要 64 张顶级数据中心芯片并联,成本极高,只有极少数头部企业能够负担。经过持续的架构优化,算力需求从 64 卡降到 16 卡,而在本次 SIGGRAPH 大会上,这套完整的实时高保真闭环模拟器,已经可以在单张 RTX Pro 6000 工作站显卡上流畅运行。从 64 卡到单卡,算力成本下降了两个数量级,直接将仿真门槛从超算级别拉到了工作站级别。
梦境训练的真正价值,不是训练出完美的 AI,而是用极低的成本完成 90% 的基础技能训练,剩下 10% 的真实世界微调只需要少量数据就能完成。这会大幅降低物理 AI 的训练成本,缩短研发周期。
3.4 端侧轻量化与 Sim2Real 落地边界
3.4.1 Cosmos 3 Edge 的极致优化路径
完整的 Cosmos 3 模型参数量庞大,适合云端训练与仿真。但真实世界的物理 AI 不能永远依赖云端计算,网络延迟与断网风险会严重影响执行安全性。因此英伟达推出了轻量化版本 Cosmos 3 Edge,专门针对端侧实时运行优化。
Cosmos 3 Edge 只有 40 亿参数,可以直接运行在本地边缘芯片上。在现场演示中,搭载 Jetson 系列芯片的机械臂,直接在本地运行 Cosmos 3 Edge 模型。机械臂通过摄像头观察桌面上的方块,模型在毫秒级完成物体识别、空间定位与抓取动作预测,直接输出控制信号驱动机械臂完成抓取,整个过程完全不需要云端参与。
为了进一步提升端侧推理速度,模型将扩散采样步数压缩到了四步,相比传统几十步的扩散模型,响应速度提升了一个数量级,推理成本也大幅下降。这种端侧实时运行的能力,是物理 AI 走向商用落地的关键一步 —— 机器人不需要时刻连接网络,仅凭本地算力就能完成大部分感知与决策任务。
模型的轻量化来自多维度的极致工程优化,而非单纯的模型裁剪。模型结构层面,采用了稀疏化的混合架构。推理塔保留完整的注意力机制,保证决策精度;生成塔采用局部注意力架构,只处理当前视野范围内的视觉信息,减少不必要的全局计算。针对机器人操作的特定场景,模型还做了任务定向蒸馏,丢弃了所有和物理操作无关的能力,比如生成艺术画面、理解复杂文本,只保留感知、定位、动作预测等核心能力。
推理加速层面,采用了量化与算子融合的组合优化。模型采用 4 位整数量化,权重与激活值都用低精度表示,大幅减少显存占用与计算量。针对扩散采样的四步流程,做了算子级的深度融合,将多步采样中的重复计算合并,减少内存读写开销,进一步提升推理速度。配合 Tensor Core 的专用矩阵运算加速,最终实现单帧推理时间控制在几十毫秒以内,满足实时控制的要求。
系统架构层面,采用了感知 - 决策 - 控制的流水线并行。当前帧做感知计算的时候,同时执行上一帧的决策结果,输出控制指令。通过流水线重叠,将端到端的响应延迟降低一半以上,保证机械臂运动的流畅性。
端侧模型的能力有明确边界。它擅长处理结构化的日常操作,比如抓取物体、搬运物品、简单装配,这些场景规律明确,训练数据充足。对于非结构化的复杂场景,比如从未见过的故障处理、复杂环境导航,端侧模型的能力不足,需要云端大模型提供辅助决策。实际商用落地通常采用 “端侧小脑 + 云端大脑” 的混合架构:日常操作由端侧模型实时处理,复杂问题上传云端求解,既保证响应速度,又保证智能水平。
3.4.2 Sim2Real 迁移的核心难点与缓解方案
虚拟世界训练的技能,能不能直接用到真实世界,也就是 Sim2Real 问题,是物理 AI 领域的核心难题。世界模型再真实,也不可能和真实世界完全一样,这种差异必然会导致模型性能下降。
目前行业主流的缓解路径分为三类。第一类是域随机化,在虚拟训练中大量随机化环境参数,比如物体的材质、颜色、摩擦力,光照的方向、强度,相机的参数、噪声水平。让 AI 在千差万别的虚拟环境中训练,强迫它学习最本质的物理规律,而不是过拟合虚拟环境的特定细节。这样当它进入真实世界时,只是遇到了又一种新的环境变体,不会出现严重的性能下降。
第二类是域适应,用少量真实世界数据做微调。先在虚拟环境中完成大规模预训练,得到一个基础模型,然后用几十到几百次真实世界的演示数据做微调,将模型从虚拟域适配到真实域。这种方式可以用极少的真实数据,大幅提升模型在真实世界的表现,是当前最主流的落地方案。
第三类是在线闭环适应,机器人在真实世界运行的过程中,持续收集真实数据,在线微调模型,不断缩小虚拟与真实的差距。这种方式可以持续优化模型表现,但对系统的安全性与稳定性要求很高,目前还处于研究试点阶段。
从当前的行业进展来看,简单的结构化任务已经实现了较好的 Sim2Real 效果。比如桌面物品抓取,虚拟预训练加少量真实微调,成功率可以达到 90% 以上,具备商用价值。但复杂的非结构化任务,比如精密装配、复杂地形行走、开放环境操作,虚拟与真实的差距仍然很大,还需要大量真实世界数据补充训练,完全靠虚拟训练还无法落地。
世界模型不能让机器人完全不需要真实世界训练。虚拟环境负责完成基础技能的大规模预训练,真实世界负责域适应与最终验证,两者是互补关系。虚拟训练可以大幅降低训练成本,但无法完全替代真实世界的数据与验证。
四、🔗 全栈闭环:英伟达物理 AI 生态的布局逻辑与边界

从 DLSS 5 的生成式渲染,到 AI 物理模拟的规律压缩,再到 Cosmos 3 的世界模型,三项技术不是孤立的产品,而是英伟达构建物理 AI 全栈生态的三个核心环节。三者层层递进,最终形成从像素渲染、物理规律到 AI 训练的完整技术闭环。
4.1 从像素到物理的技术栈协同逻辑
三项技术构成了清晰的技术递进关系。DLSS 5 解决了视觉层面的真实感,让虚拟世界的画面达到照片级精度,保证虚拟训练的视觉输入和真实世界一致,缩小仿真到现实的视觉鸿沟。AI 物理模拟解决了物理规律的计算效率,让虚拟世界的运行严格遵循真实物理定律,保证虚拟训练的交互反馈和真实世界一致,缩小仿真到现实的物理鸿沟。Cosmos 3 世界模型则将视觉与物理能力整合,构建完整的可交互虚拟世界,为物理 AI 提供训练母体。
更底层的支撑是英伟达的硬件与软件生态。所有这些技术都基于 CUDA 生态与 Tensor Core 算力优化,深度绑定英伟达的硬件产品。从消费级游戏显卡,到工作站专业显卡,再到数据中心级计算卡,不同层级的硬件对应不同的应用场景,形成完整的产品矩阵。
这种全栈布局的核心优势是协同优化。渲染技术的进步可以提升世界模型的视觉质量,物理模拟的进步可以提升世界模型的交互精度,世界模型产生的大量数据又可以反过来优化渲染与物理模型,形成正向循环。
4.2 产业分工的重构与开发者价值
英伟达的目标不是自己做机器人、做自动驾驶,而是做整个物理 AI 行业的基础设施提供商。就像当年 CUDA 赋能了 AI 大模型浪潮一样,现在英伟达要为物理 AI 提供底层的算力、仿真与模型工具,让所有开发者都能在其平台上开发具体的应用。
对于开发者而言,这套体系会大幅降低物理 AI 的开发门槛。以往开发机器人算法,需要自己搭建仿真环境、自己收集训练数据、自己优化推理性能。现在可以直接基于英伟达的工具链,用 Cosmos 生成训练数据,用仿真环境做验证,用 Tensor RT 做端侧部署,专注于核心算法的创新。
对于工业企业而言,AI 物理模拟工具可以直接嵌入现有的设计软件,提升研发效率。英伟达已经和多家主流工业软件厂商展开合作,将 AI 仿真能力集成到现有工作流中,不需要企业完全替换现有工具就能享受技术红利。
4.3 技术边界与行业风险
这套技术体系的发展前景广阔,但也存在明确的边界与风险。首先是虚拟到真实的迁移鸿沟。即使虚拟世界的视觉与物理真实度再高,和真实世界仍然会存在差异。AI 在虚拟环境中训练的技能,迁移到真实世界必然会有性能衰减,这个问题只能缓解,无法完全消除。实际落地中,仍然需要真实世界的数据进行微调与验证。
其次是数据分布的边界问题。所有 AI 模型的能力都受限于训练数据的覆盖范围。如果遇到完全超出训练分布的极端场景,模型可能出现不可预测的错误。在安全相关的场景中,这类黑盒模型的不可预测性会带来风险,必须配套完善的安全冗余机制。
最后是生态依赖的风险。整个技术体系深度绑定英伟达的硬件与软件生态,行业对单一厂商的依赖度会持续上升。对于开发者与企业而言,需要评估技术选型的供应商集中度风险,保留一定的技术备选方案。
结论
SIGGRAPH 2026 是计算机图形学与物理 AI 发展的一个重要节点。英伟达展示的三项核心技术,标志着生成式 AI 已经从内容创作领域,全面渗透到实时渲染、工业仿真与具身智能等核心产业领域。
DLSS 5 证明了生成式 AI 可以在严格保留创作者意图的前提下,实现实时的照片级渲染,开启了生成式渲染的新纪元。AI 流体模拟证明了数据驱动的方法可以大幅提升物理仿真的效率,将工业级仿真能力下沉到消费级硬件。Cosmos 3 世界模型则构建了物理 AI 的虚拟训练体系,用算力突破了真实世界的数据供给瓶颈。
这三项技术共同指向同一个方向:人类正在掌握用 AI 构建虚拟物理世界的能力。未来,产品设计、AI 训练、科学研究都可以在高保真的虚拟世界中快速迭代,真实世界则负责最终验证与落地。虚实结合的研发模式,会成为下一代科技创新的核心范式。
对于技术从业者而言,不需要神化技术,也不需要忽视变化。理解各项技术的原理与边界,找到其在自身业务中的落地场景,稳步推进技术升级,是最稳妥的应对方式。
📢💻 【省心锐评】
英伟达正从算力供应商转向物理世界基础设施搭建者,全栈技术闭环已成型,但虚实迁移与生态依赖仍是行业长期命题。
SEO 关键词
DLSS5 物理 AI 世界模型 流体模拟 具身智能 实时渲染
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)