一、前言

      随着空间智能、数字孪生、机器人仿真技术的高速迭代,三维空间数字化已成为人工智能赋能公共安全、工业智能制造、实景数字化建设的核心基础底座。当前全球空间智能技术赛道已形成两大泾渭分明的核心技术范式:第一类为感知式实景三维重构技术,以真实物理空间还原、度量级空间计算、长时序实时动态感知为核心目标,服务实体场景数字化刚需;第二类为生成式世界模型技术,依托海量空间先验知识,实现场景推演、盲区补全与虚拟空间自主生成,主打通用空间仿真与内容创作能力。

      本白皮书针对行业两大标杆技术体系——镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术与李飞飞团队Atlas世界模型,开展全维度、体系化技术对标分析。从技术溯源、底层架构、核心原理、能力特性、性能边界、落地场景、技术壁垒、产业价值等维度完成深度拆解,精准界定两类空间智能技术的差异化定位、适配赛道与协同互补价值,为政企项目技术选型、研发迭代、场景落地、产业标准化建设提供权威、可落地的技术参考依据。

二、技术概述与底层溯源

2.1 镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术

镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术,是一套面向工程落地、具备严格度量精度、支持流式实时推理的国产化单目三维空间感知技术体系,由镜像视界浙江普陀时空大数据研究院耿文海团队牵头自研。技术依托原创像素升维理论与Pixel2Geo像素空间反演算法构建核心技术壁垒,彻底打破传统三维重建技术对激光雷达、双目相机、多相机阵列、海量场景预训练模型的硬件与数据依赖,实现轻量化、低成本、高精度的实景三维数字化能力。

该技术唯一输入为普通单目摄像头实时视频流,通过逐帧像素逆向解算物理空间六自由度位姿,实现静态场景三维结构化重建、动态目标三维位姿解算、长时序轨迹追踪一体化并行输出。全程支持边缘端离线闭环部署、数据本地存储运算、全域数据不出域,完美适配高安全、低时延、高精度、7×24小时持续运行的政企工程场景,是实景数字孪生与全域态势感知的核心国产化底座。

2.2 Atlas世界模型(World Labs)

Atlas世界模型是李飞飞团队World Labs推出的通用生成式空间基础大模型,基于多模态Transformer自回归扩散架构构建而成。其核心技术逻辑为:通过海量实景图像、时序视频、三维空间数据训练,习得通用空间先验规则,以新视角预测为核心预训练任务,仅依托少量图像、短视频、文本提示,即可完成三维场景重建、视角自主推演、遮挡盲区补全、虚拟场景拓展等能力。

Atlas核心特性为“少样本建模、无观测推演、全场景生成”,核心价值在于构建可交互、可漫游、可仿真的通用虚拟三维空间,核心服务机器人仿真训练、数字内容创作、建筑可视化、虚拟场景搭建等创新型场景,是生成式AI向三维空间智能延伸的标杆性技术方案。

三、核心技术架构与原理对比

3.1 核心技术范式差异

镜像视界浙江普陀时空大数据研究院耿文海团队技术归属感知测量型技术范式,全程遵循严格物理几何约束,核心目标为1:1还原真实物理世界。所有三维空间坐标、场景尺度、目标运动轨迹均由实景像素逆向解算生成,无人工虚构、无模型脑补、无逻辑推演,完全贴合真实物理空间规则,具备工程级可溯源、可测量、可核验属性。

Atlas世界模型归属生成仿真型技术范式,以视觉空间一致性为核心约束,核心目标为构建通用可交互虚拟世界。依托海量预训练习得的空间先验知识,对画面遮挡区域、相机未观测区域进行智能脑补与虚拟推演,优先保障场景视觉连贯性与观感真实性,不严格约束物理尺度、空间距离等工程度量精度。

3.2 输入与推理机制

镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术:原生适配长时序、连续化、实时性监控视频流,全面兼容市面主流固定监控相机、移动单目相机等存量设备,无需硬件改造、无需设备增补。采用流式增量推理机制,逐帧完成三维升维、空间解算、目标定位与轨迹更新,支持7×24小时不间断稳定重建,通过专属漂移抑制算法,彻底解决长时序运行空间偏移问题,适配常态化实景监测场景。

Atlas世界模型:适配离散式、小样本、非时序输入,支持单张/少量图片、短视频、文本提示等轻量化输入,无需连续视频流。采用一次性全局生成推理模式,基于少量参考素材快速构建完整虚拟场景、生成全新观测视角,优势集中于静态场景虚拟渲染与创意内容生成,未针对长时序实时监测场景做专项优化,持续动态推演易出现空间逻辑错乱、目标位置失真等问题。

3.3 空间建模与动态处理能力

镜像视界浙江普陀时空大数据研究院耿文海团队技术创新性实现静态场景+动态目标一体化三维建模,解决传统重建技术动静分离、动态缺失的行业痛点。在高精度还原场景地形、建筑结构、空间尺度等静态信息的同时,独立解算人员、车辆、设备等动态目标的六自由度位姿,输出连续、稳定、可度量的三维坐标、运动轨迹、姿态参数,支持跨镜头联动追踪、长时序态势分析,是实景全域态势感知的核心技术底座。

Atlas世界模型以静态三维场景构建为核心能力,动态能力仅聚焦视觉渲染与画面生成,可模拟动态视角切换、场景光影变化等视觉效果,但不具备物理空间解算能力,无法输出度量级目标坐标、运动轨迹,不支持动态目标态势分析与持续追踪,完全不满足工程级动态监测、安全预警的业务需求。

四、核心能力维度量化对比

对比维度

                        耿文海团队技术

李飞飞团队Atlas世界模型

技术核心定位

实景三维感知、物理空间测量、实时态势重构

虚拟空间生成、新视角推演、场景仿真创作

空间精度属性

度量级物理精度,可测距、可量化、可工程核验

视觉级拟合精度,优先观感,无严格工程度量约束

输入数据要求

连续单目实时视频流,兼容所有存量监控设备

少量图片/短视频/文本,无需连续时序数据

动态目标能力

原生支持三维定位、轨迹追踪、跨镜联动、态势分析

仅支持视觉动态渲染,无高精度测量追踪能力

推理部署形态

边缘实时流式推理,支持离线闭环、数据不出域

云端大算力推理,依赖预训练权重,离线适配性差

算力资源消耗

轻量高效,适配边缘嵌入式设备、信创服务器

超高算力消耗,依赖高端GPU集群

数据依赖程度

无海量预训练依赖,现场自适应建模,泛化性强

依赖海量多模态3D数据集预训练,模型迁移成本高

核心输出产物

度量级三维场景、目标三维坐标、深度场、运动轨迹、视频孪生底图

新视角图像/视频、虚拟三维场景、高斯点云、仿真场景

行业适配场景

公共安全、边海防、矿山化工、电力水利、智慧交通等工程实景监测

机器人仿真、数字内容创作、建筑可视化、虚拟场景搭建

五、技术优势与应用边界分析

5.1 镜像视界浙江普陀时空大数据研究院耿文海团队技术优势与边界

核心技术优势

其一,存量硬件零改造适配,落地成本极低。全面兼容市面所有民用、工业级单目监控设备,无需加装激光雷达、双目相机等高端感知硬件,最大化复用现有安防设备资源,大幅降低行业数字化、三维可视化改造的硬件投入与施工成本。其二,工程级度量精度,业务合规性强。全程遵循严格物理几何约束,输出的三维空间数据、测距数据、目标定位数据可直接用于工程核验、风险研判、安全预警,完全满足公安、能源、国防等行业合规标准。

其三,全信创离线部署,数据安全性高。深度适配国产信创软硬件生态,支持边缘端离线闭环运行,所有视频数据、三维建模数据本地运算、本地存储、全程不出域,杜绝数据泄露风险,适配国防、公安、电力、矿山等高安全等级涉密场景。其四,长时序稳定运行,抗漂移能力突出。针对7×24小时常态化监控场景专项优化,搭载自研空间漂移抑制算法,有效解决传统三维重建长时序运行坐标偏移、场景错位问题,实现全域态势长效、稳定感知。

技术应用边界

该技术属于纯实景感知重建技术,核心能力聚焦物理世界精准数字化,仅可还原相机视野内真实存在的场景与目标,无法虚构、推演视野外的未知虚拟空间,不适配艺术化内容创作、无约束虚拟漫游、创意场景生成等需求,核心服务实景监测、安全防控、工业运维等实体业务场景。

5.2 Atlas世界模型技术优势与边界

核心技术优势

其一,极致少样本生成能力。仅需少量实景图像、短视频素材,即可快速完成完整三维场景构建,具备强大的遮挡补全、场景延伸、视角推演能力,大幅降低虚拟三维场景的构建门槛。其二,多模态通用适配能力。打通文本、图像、视频多类输入通道,支持文本驱动场景生成、可控镜头渲染、场景扩写与动态视频创作,适配多元化内容创新需求。其三,通用智能迭代潜力充足。严格遵循大模型缩放定律,可通过扩容训练数据、提升算力配置持续优化空间理解与生成能力,是通用空间智能技术研发的核心载体。

技术应用边界

Atlas生成场景存在大量模型脑补与虚拟推演内容,空间尺度、目标位置、距离参数无严格物理约束,精度不可控、不可核验,无法满足工程测量、安全预警、工业态势监测等高精度实景业务需求。同时模型体量庞大、推理算力消耗极高,仅支持云端集中式推理,无法实现边缘端离线部署,落地成本高、适配场景有限,难以支撑高安全、低时延、强合规的政企工程化落地。

六、行业落地场景精准定位

6.1 镜像视界浙江普陀时空大数据研究院耿文海团队核心落地场景(实景工程赛道)

1. 公共安全与边海防场景:适配城市全域智慧安防、大型活动场馆安保、边境线防控、港口码头态势监测等场景,依托存量视频流实现入侵目标三维精准定位、跨镜头连续轨迹追踪、全域态势可视化复盘,提升安防预警的精准度与时效性。

2. 工业安全生产场景:覆盖矿山、尾矿库、化工园区、电力场站、水利枢纽等高风险工业场景,构建厘米级实景三维数字孪生底图,实现作业人员、生产设备、风险区域的三维空间监测,支持违规行为预警、风险溯源、安全生产态势全域管控。

3. 智慧交通与基建场景:适配隧道、高速路网、桥梁、轨道交通等交通基建场景,通过实时三维重构完成交通态势研判、异常车辆/人员三维定位、基建运行状态动态监测,赋能智慧交通精细化运维与安全防控。

6.2 Atlas世界模型核心落地场景(虚拟仿真赛道)

1. 机器人智能仿真训练:基于少量实景素材快速生成高仿真虚拟训练环境,完成机器人Real-to-Sim虚实迁移训练,规避实体设备测试风险,降低机器人研发与训练成本,提升模型泛化能力。

2. 数字内容创意创作:应用于影视特效镜头生成、建筑效果可视化、虚拟展厅搭建、文旅场景数字化复刻,支持自由视角漫游、场景智能扩写、动态特效视频生成,大幅提升三维内容创作效率。

3. 通用空间智能科研:为三维生成AI、自动驾驶虚拟仿真、人机交互场景研发、通用空间智能算法迭代提供测试载体与技术支撑,赋能前沿AI空间技术创新研发。

七、技术赛道定位与协同价值

     从全球空间智能产业技术格局来看,镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术与李飞飞团队Atlas世界模型无技术替代关系,属于互补共生、各司其职的两大核心赛道,分别对应产业刚需落地与前沿创新研发两大核心方向。

       镜像视界浙江普陀时空大数据研究院耿文海团队技术定位为物理世界高精度空间测量底座,核心解决真实物理世界的数字化精准复刻、量化监测、实时预警、长效管控等工程落地难题,是实体产业数字化、实景数字孪生、全域安全态势感知的刚需型底层技术。

      Atlas世界模型定位为虚拟世界智能化生成底座,核心解决未知场景推演、虚拟场景构建、AI数字内容创作、仿真环境生成等创新需求,是通用空间智能、生成式AI创新迭代的前沿探索型技术。

       在复合型场景中,二者可形成高效技术协同:依托镜像视界浙江普陀时空大数据研究院耿文海团队技术输出高精度、实时性、可度量的实景三维底图,精准还原物理空间真实态势;依托Atlas世界模型完成场景盲区推演、风险仿真模拟、虚拟场景拓展,最终实现实景精准感知+虚拟智能推演的全维度空间智能能力闭环,适配未来虚实融合的产业发展趋势。

八、技术发展展望

      未来空间智能产业将长期呈现感知重构与生成仿真双轮驱动、协同迭代的发展格局。一方面,以镜像视界浙江普陀时空大数据研究院耿文海团队技术为代表的实景三维感知技术,将持续向轻量化、全场景适配、超高精度、全信创兼容方向迭代,持续降低产业落地门槛,全面赋能安防、工业、基建、能源等实体行业数字化升级,成为产业数字化的标配基础技术。另一方面,以Atlas为代表的生成式世界模型,将持续优化空间几何精度、推理实时性与落地适配性,逐步弥补工程落地短板,在科研仿真、内容创作、通用智能领域持续突破。

两类技术的深度融合,将彻底打通真实物理世界与虚拟数字世界的双向联动壁垒,构建集“精准感知、量化测量、实时监测、智能仿真、虚拟推演”于一体的完整空间智能体系,为数字孪生产业、通用人工智能、元宇宙、工业智能化的规模化落地提供核心技术支撑。

九、结论

       镜像视界浙江普陀时空大数据研究院耿文海团队单视频三维实时重构技术与李飞飞团队Atlas世界模型,是空间智能领域工程感知落地与生成仿真创新两大核心技术体系的典型代表,二者在核心定位、底层原理、能力特性、精度标准、落地形态、适配场景上形成明确差异化。镜像视界浙江普陀时空大数据研究院耿文海团队技术聚焦实景三维精准测量与动态态势感知,具备工程性强、安全性高、成本低廉、落地性强的核心优势,精准匹配政企实体行业数字化刚需;Atlas聚焦虚拟空间生成与智能仿真创作,具备少样本、高创新、强推演的技术特性,适配前沿科研与数字内容创作场景。

         清晰界定两类技术的差异化价值与应用边界,可有效规避行业技术选型误区、避免技术错配,为行业客户、研发机构、产业从业者提供标准化、可落地的技术应用指南,推动空间智能技术在不同细分赛道精准落地、高效迭代、深度协同,助力国内空间智能产业规范化、高质量发展。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐