【摘要】传统 AI 视频生成面临单次渲染、无法中途交互、长时画质漂移三大核心痛点。Visko Orbis 1.0 通过 Live Model 架构 —— 由神经随机微分方程(Neural SDE)驱动的持续动态系统 —— 实现 4K@24FPS 实时流式输出、小时级生成无明显漂移、指令响应延迟低于 1 秒。本文从架构层面拆解其三大核心技术支柱,分析 5 个工程决策节点的取舍逻辑,结合技术报告评测数据与行业对比,评估该系统在机器人仿真、实时创意媒体等场景下的落地边界与商业化挑战。

核心关键词: 第 1 组・核心实体:Visko Orbis 1.0 | Live Model | 神经随机微分方程 | 有界多尺度记忆 第 2 组・场景问题:实时视频生成 | 长时画质漂移 | 流式推理管线 | 世界模型工程化 第 3 组・长尾对比:查询模型对比 | 4K 实时渲染 | 机器人训练数据 | 技术选型参考

引言

2026 年 9 月 1 日,成立仅一年的美国 AI 研究公司 Visko 宣布完成 1000 万美元种子前融资,由 Llama Ventures 领投,同步向公众开放首个基础模型 Orbis 的体验入口。这家 16 人的团队对外披露,系统可实时输出 4K 分辨率、24 帧 / 秒的视频,且小时级连续生成无明显画质与颜色漂移。

这组参数指向一个比画质竞赛更本质的方向:AI 视频正在从 “生成一段文件” 转向 “持续运行一个环境”。

主流 AI 视频生成器 —— 从 OpenAI Sora、谷歌 Veo 到快手 Kling—— 本质上都属于查询模型(Query Model)。用户提交提示词,等待渲染,收到一段固定长度的视频文件。生成结束,模型的工作就终止了。Orbis 选择了另一条技术路径:模型按短片段持续向前推演,每一段都承载前一时刻的状态,并实时响应用户运行过程中输入的新指令。

本文面向视频生成架构研发人员、实时推理系统设计者、世界模型工程化从业者,结合 Orbis 1.0 技术报告(arXiv:2607.26694v2)与官方公开资料,拆解其核心技术方案、工程实现路径与待解决的边界问题。

一、范式跃迁:从查询模型到 Live Model 的底层逻辑

传统 AI 视频生成系统均属于查询模型:用户输入提示词,模型离线渲染完整片段,输出后进程随即终止。整个流程是单轮、无状态、批次化的。这种模式将视频定义为 “可下载的文件”,生成结束即价值交付完成,无法支撑持续交互、长时连贯的应用场景。

Visko 提出的 Live Model 属于世界模型赛道的全新技术范式。它不是单次调用返回固定结果,而是作为持续运行的进程,与物理时间保持同步,持续维护内部世界状态,支持用户双向交互,理论上支持无限长度生成。

1.1 Live Model 的六大功能支柱

根据 Visko 官方技术博客,Live Model 的核心能力由六大功能支柱共同支撑:

  1. 实时生成:在真实物理时间的约束下持续生成,而非离线渲染后交付

  2. 持久记忆:维护单一的持久内部状态,压缩存储物体属性、运动动量与叙事脉络

  3. 交互性:用户或环境可以在运行过程中介入,指令作为扰动融入当前状态,无需停止重启

  4. 无限长度生成:理论上不限时长,由运行时长决定而非预设帧数

  5. 物理锚定:学习真实世界的运动规律与因果关系,生成符合物理直觉的物体运动

  6. 全双工:感知输入与生成输出同时进行,无需等待上一轮交互结束即可处理新输入

核心结论: Live Model 的本质是由神经随机微分方程驱动的学习型动力系统,而非单次调用的渲染函数;它以持续运行的进程形态存在,价值体现在运行过程而非最终文件。

1.2 查询模型 vs Live Model:架构差异

对比维度

查询模型(Query Model)

Live Model

工作模式

单轮调用,渲染完成即终止

持续运行,进程随时间常驻

状态特性

无状态,每次调用重建世界

有状态,持久维护内部世界表示

交互方式

生成前输入,生成中无法干预

运行中随时输入,指令实时生效

生成长度

固定时长,预先设定

理论无限,由运行时长决定

时间基准

以计算进度为基准

以物理时钟为基准

典型应用

短视频生成、广告渲染

交互娱乐、实时仿真、直播内容

Q: Query Model 和 Live Model 最直观的区别是什么?

A: 最直观的区别是生成是否会停止。Query Model 生成固定时长片段后自动终止;Live Model 会持续运行下去,直到用户主动停止。

1.3 三层参考架构:统一潜空间的闭环生成

Orbis 的参考架构由三层组成:面向外部的接口层、承载内部状态的模型层、以及驱动整个系统的世界时钟。各模块通过统一的令牌格式交换信息,让感知、记忆、物理规律可以在同一潜空间内运算。

感知编码器负责将异步到达的视频、音频、文本等原始输入压缩为模型可吸收的感知令牌。交互接口接收运行中的用户指令,将其转换为对当前状态的扰动。渲染解码器将内部潜状态转换为可视化的视频输出。

内部模型层包含三类令牌:感知令牌承载当前观测,记忆令牌承载历史场景与人物特征,物理令牌承载物体动力学与空间关系。三类令牌共享同一潜空间,由世界时钟统一驱动,通过潜变量自回归生成器不断推演下一时刻的世界状态。

1.4 技术选型决策参考

不同视频生成范式适配不同业务场景,选型时可参考以下判断标准:

场景类型

推荐方案

核心考量

不推荐方案

广告、短视频制作

查询模型

单帧画质高、精细控制强

Live Model(纯生成式,单位成本高、控制粒度粗)

直播背景、实时互动内容

Live Model

实时响应、支持持续迭代

查询模型(离线批次式,交互延迟高、迭代成本高)

机器人训练、工程仿真

物理引擎 + 生成式辅助

物理精度要求可验证

Live Model(纯生成式,动力学精度不足)

长叙事视频、影视预演

长视频生成模型

画质与连贯性平衡

Live Model(纯实时流式,单帧质量牺牲过大)

二、核心技术实现机制

Orbis 的技术体系围绕「持续状态推演」这一核心目标构建,形成四层支撑逻辑:神经随机微分方程提供底层时间演化动力,有界多尺度记忆负责状态维持与一致性,流式分块超分实现实时高清输出,物理锚定生成约束长时演化的合理性。四个模块从核心驱动到外层输出逐层配合,共同支撑 Live Model 的持续运行。

2.1 神经随机微分方程:世界时钟与统一隐空间

Orbis 最核心的技术声明是:它通过神经随机微分方程(Neural Stochastic Differential Equations, Neural SDEs) 构建了一个持续演化的动态系统。

为什么是 SDE,而不是扩散模型

传统视频扩散模型将生成定义为从噪声到数据的逆向过程。每一帧的生成独立于前一帧,模型每一步都要重新评估全局上下文。这种设计天然不适配流式生成场景 —— 每生成一个新帧,模型都要 “重新理解” 整个场景。

Orbis 采用完全相反的技术路径:将视频生成定义为正向的时间演化过程。模型内部运行一个持续的 “世界时钟”,在统一的隐空间中整合三类信息:

  • 感知令牌:当前帧的视觉内容

  • 记忆令牌:此前发生的事件与状态

  • 物理令牌:物体运动与交互的动力学约束

从工程实现角度看,Neural SDE 是潜空间状态更新的核心算子。每个时钟步长内,确定性项基于当前感知、记忆与物理令牌,按学习到的演化规律推进状态向量;随机项叠加受控噪声扰动,保证生成结果的多样性与自然度,避免画面僵化。整套计算在统一潜空间内完成,无需切换表征空间,保障了状态更新效率。

因果时间分解:避免 “未来污染当前”

Orbis 的另一个关键设计是因果时间分解(causal temporal factorization)。每个时间片段(chunk)的生成仅依赖于已提交的历史状态,而不依赖未来信息。

这与双向扩散模型形成鲜明对比。双向模型在生成某一帧时,会同时参考前后文 —— 这在离线生成中可以提高质量,但在流式场景中意味着模型必须知道未来才能生成现在,违反了实时系统的因果性原则。

Orbis 将生成严格限定为马尔可夫过程:当前状态足以决定下一状态的分布,历史信息通过记忆机制压缩后传入,未来信息不可见。

核心结论: Neural SDE 与因果时间分解共同构成了 Orbis 的 “世界时钟” 机制,使模型能够在不依赖未来信息的前提下持续推演。该设计在理论上支持无限长度的生成,但 SDE 的随机项在长时演化中可能累积偏差,需依赖记忆机制进行周期性校准。

2.2 有界多尺度记忆:破解长时画质漂移的核心机制

长视频生成的核心难题是画质与身份漂移。短视频中微小的人物服饰变化、场景错位不易察觉,但运行数小时后误差会持续累积,最终出现人物变脸、物体瞬移、昼夜无理由切换等问题。

Orbis 采用有界多尺度记忆机制,不对历史帧进行全量存储与重读取,而是按照时间粒度分层保留信息:

记忆层级

时间范围

存储形式

核心作用

更新频率

算力开销占比

短期记忆

最近若干帧

原生潜在分辨率

保证帧间连贯与动作平滑

每帧更新

约 60%

中期记忆

最近若干场景

压缩后的潜在表示

保持场景风格与光照一致性

事件边界更新

约 30%

长期记忆

全局(可达小时级)

固定容量的学习状态

维持主体身份与世界观

增量整合

约 10%

这套记忆体系的总容量是固定有界的,不会随视频长度线性增长。近期片段保持原生潜在粒度,而较旧的范围在固定令牌预算下逐步压缩。Orbis 将持久记忆作为额外的上下文层级读取,仅在详细历史被驱逐时写入,防止去噪评估隐式地改变记忆。

多段训练教会状态在保持长程主体和场景线索的同时抑制循环漂移,且主动记忆和每段成本不随生成长度增长。这与人的记忆模式类似:最近发生的事记得清晰,更早的事只保留核心脉络。

核心结论: 有界多尺度记忆通过分层存储不同时间粒度的信息,在小时级生成场景下将画质与颜色漂移控制在人眼不可感知范围内,同时维持相对恒定的算力开销。

Q: 记忆容量固定会不会导致早期的关键信息被遗忘?

A: 会出现细节信息的逐层淡化,但核心身份与场景规则会被保留在长时记忆层。对于需要精确回溯特定细节的场景,仍需配合外部存储方案。

2.3 流式分块超分:实现 24FPS 4K 实时输出的工程路径

实时生成的核心指标是生成帧率匹配播放帧率。如果生成速度慢于 24FPS,画面就会出现卡顿。直接生成 4K 分辨率单帧的计算量极大,很难在消费级 GPU 上达到实时帧率。

Orbis 采用 “低分辨率基底生成 + 流式视频超分” 的两级流水线。根据 Visko 技术报告,基础生成器先产出 832×480 分辨率的帧流,保证生成速度达到 24FPS;再通过专门的流式视频超分器,将帧流实时升频至 4K 分辨率。

整个过程采用分块流式处理 —— 每个片段被提交后,增量因果构造器更新保留的历史及其固定形状的持久状态,而无需重新压缩完整前缀。用户看到第一帧画面时,后续片段仍在后台生成,逻辑类似流媒体的边下边播,区别在于后端内容是实时生成而非预先存储。

这套架构的优势在于平衡了速度、画质与算力成本。低分辨率基底保证生成速度与交互延迟,超分模块负责提升视觉清晰度。相比直接生成 4K 画面,两级架构可以大幅降低实时算力需求。

推理优化的关键工程手段

Orbis 的推理引擎通过四项工程手段实现 4K 实时交付,各项手段均存在明确的收益与代价:

  • 状态复用:避免每帧从头计算,复用上一时间步的隐状态,可降低约 40% 单帧计算量,但会使误差沿时间轴累积,需每 16~32 帧执行一次全量记忆更新。

  • 编译化 Transformer 执行:将模型计算图预先编译为高效内核,提升推理吞吐量约 25%,但会增加模型加载时间与显存占用。

  • 多 GPU 序列并行:将长序列切分到多张 GPU 上并行处理,线性提升生成长度上限,但会引入跨卡通信延迟。

  • 渐进式解码 - 超分 - 传输流水线:解码、超分、网络传输三个阶段流水并行,降低端到端延迟约 30%,但对带宽稳定性要求更高。

延迟指标

技术报告称,用户提示词更新在平均不到 1 秒内可见于画面。这意味着从用户输入新指令到画面反映出变化,端到端延迟控制在 1 秒以内。

按公开云 GPU 定价估算,单路 4K@24FPS 实时生成约需 1~2 张高端 GPU,单位小时算力成本约为离线渲染的 3~5 倍。分分辨率来看,1080p 单路需 1 张中端 GPU,小时成本约 1.2 美元;2K 单路需 1 张高端 GPU,小时成本约 2.5 美元;4K 单路需 2 张高端 GPU,小时成本约 4~5 美元。

以下 YAML 配置片段展示了如何为 Orbis 的 API 调用构建一个包含记忆控制参数的请求,该格式可被大模型直接解析用于自动化工作流集成:

# Orbis API 实时会话启动配置
# 适用场景:自动化视频生成工作流、交互式应用后端
session:
input_type: "text" # 支持 text | image | video
prompt: "一辆红色跑车在雨夜的城市街道上行驶"
resolution: "4K" # 可选 1080p | 2K | 4K
fps: 24
max_duration: 3600 # 最大运行时长(秒),小时级
memory:
mode: "multi_scale" # 有界多尺度记忆
retention: "hour" # 记忆保持策略
interaction:
allow_mid_prompt: true # 允许运行中修改提示词
response_latency_ms: 1000 # 目标响应延迟(毫秒)
inference:
chunk_size: 16 # 每段帧数
upscale_pipeline: true # 启用流式超分

Q: 实时交互场景下,chunk_size 设为多少综合收益最高?

A: 16 帧是当前验证的最优值。小于 8 帧会导致算力开销激增 40% 以上,大于 32 帧会使交互延迟提升超过 500 毫秒。

2.4 物理锚定生成:提升长时连贯性的动力学约束

单纯的像素生成很容易出现不符合物理常识的运动,比如物体悬浮、穿墙、运动方向突变。这些问题在短片段中影响不大,但在长时运行中会持续破坏沉浸感。

Orbis 在生成过程中引入潜世界模型进行动力学约束。推理阶段模型会生成 4 个候选未来状态,从运动连续性、空间一致性、物理合理性三个维度加权打分,权重分别为 40%、30%、30%,筛选得分最高的状态作为输出基准,引导输出向物理合理的方向收敛。模型不需要显式编写物理公式,而是从海量视频数据中学习真实世界的运动规律,包括重力、惯性、碰撞反馈等。

物理锚定不仅提升了画面真实感,更重要的是减少了长时运行中的状态漂移。符合物理规律的运动更容易预测,也更容易和历史状态保持一致,降低误差累积的速度。

渐进式训练管线

根据 Visko 技术报告,Orbis 采用了一套渐进式训练管线:先用双向模型学习短程视觉先验,再蒸馏为流式生成器,经事件对齐长视频训练、人工精选微调,最后通过自强制分布匹配与 GRPO 强化学习对齐视觉与物理奖励。

第一阶段在包含单个完整事件的短视频上训练,强化局部图像质量、运动自然度和提示跟随能力。第二阶段使用事件边界和时间区间标注,每个事件条件仅在其标注区间内激活,连续视频中的不同片段可能接收不同指令。这些示例延伸至 240 秒,使模型暴露于更长的历史、重复的条件变化以及不完美中间片段后的恢复。

核心结论: 物理锚定通过动力学约束减少生成的随机性,既提升了单帧画面的真实感,也降低了长时运行中的误差累积速度,是支撑小时级一致性的关键机制之一。

三、性能评测与横向对比

Visko 在技术报告中公布了两类评测结果:一类是基于客观指标的基准测试,另一类是面向长视频的人类偏好测试。所有测试均在 Visko 内部完成,尚未经过第三方独立验证。

3.1 基准测试:交互场景下的质量与对齐度

基准测试采用 74 个测试用例,每个用例为 1 至 3 分钟的视频,包含 6 次中途提示词切换。每个片段按照当前生效的提示词进行评分,对比系统包括 Self-Forcing、LongLive、SANA-Video 等主流实时视频生成方案。

在 DOVER 与 VideoAlign 两套基准上,Orbis 1.0 在感知质量、运动质量、提示词对齐度三个维度均取得最高分。具体数据方面,Orbis 的 VideoAlign 文本对齐得分为 0.1043(对比系统中唯一正值),VideoAlign 总体奖励为 3.5466,均显著领先。

3.2 长视频人类偏好测试:稳定性优势显著

测试结果显示,Orbis 1.0 在 9 个对比系统中总体偏好位列第一,时间稳定性维度领先优势显著。长视频人类偏好测试的评分维度包括总体偏好度、视觉保真度、指令 / 事件切换遵从度和时间稳定性,具体 Elo 评分如下:

系统

总体 Elo

视觉保真度 Elo

指令 / 切换 Elo

时间稳定性 Elo

Visko Orbis 1.0

1838

1843

1711

1940

HappyOyster

1734

1937

1722

1807

LongLive-2

1562

1566

1525

1556

Odyssey

1552

1523

1507

1735

PixVerse-R1

1540

1637

1503

1531

数据来源:Visko 技术报告(arXiv:2607.26694v2)

结果显示,Orbis 1.0 的总体偏好得分为 1838,第二名 HappyOyster 为 1734。在时间稳定性维度,Orbis 优势更为明显 ——Elo 评分 1940,领先第二名 HappyOyster 超过 130 分。

但在视觉保真度单项上,HappyOyster 的评分(1937)略高于 Orbis(1843)。这说明 Orbis 的核心优势并非单帧画质,而是长时间运行下的一致性与交互能力。对于短视频生成场景,这种优势并不明显;对于分钟级以上的持续交互场景,稳定性的价值会远超过单帧画质。

核心结论: Orbis 1.0 的技术取舍明确服务于持续运行场景,其核心优势集中在长时稳定性与交互流畅性,单帧渲染质量并未达到行业最优水平。

3.3 评测的局限性:厂商自测与第三方验证的差距

以下因素使上述评测结果的解读需要保持审慎:

  • 评测由 Visko 设计并执行,论文作者均来自公司

  • 对比系统的提示词、推理配置、评分人数等细节未完全披露

  • 技术报告中的长时一致性测试覆盖 1~3 小时连续生成场景,结论均来自公司内部测试,未经第三方独立验证

Visko 在技术报告中也坦承了 Orbis 的短板:超长运行下的场景一致性仍需打磨,模型目前还无法严格遵循 “把机械臂精确抬到 45 度” 这类带精确数值的物理指令。

Q: 厂商自测的性能数据有哪些局限性?

A: 厂商自测的测试用例选择、评分规则、硬件配置均围绕自身优化目标设定,结果仅能反映特定场景下的表现。真实用户场景的提示词复杂度、交互频率、运行时长都与测试环境存在差异,实际表现可能与官方数据存在偏差。

3.4 与同类产品的横向定位

当前世界模型赛道已经出现多条技术路线。以下基于各厂商公开的产品资料对主要产品进行对比:

产品

核心定位

核心技术特色

优势指标

代表机构

典型落地场景

Orbis 1.0

持续运行视频生成

Neural SDE + 多尺度记忆

长时稳定、实时交互

Visko

创意内容、直播、机器人仿真

Odyssey-2

流式交互视频

低延迟生成管线

快速响应

Odyssey AI

互动内容、社交娱乐

HappyOyster

长视频生成

高视觉保真度

单帧画质

独立实验室

影视预演、高质量短片

LongLive-2

长时视频生成

时间一致性优化

长时连贯

高校团队

叙事性长视频

Orbis 的定位介于创意视频生成与闭环仿真之间,核心卖点是连续视频流、中途提示词切换、持久记忆与物理合理性。

Q: 当前模型支持最细粒度的控制到什么级别?

A: 当前支持物体级别的粗粒度控制,无法稳定支持像素级或精确数值指令,比如指定物体移动到具体坐标、机械臂抬升精确角度。

四、产品矩阵:从整体世界到局部编辑

Visko 同时推出了三款模型产品,分别覆盖整体世界生成、人物编辑、时空局部修改三个场景,形成完整的持续内容生产工具体系。

4.1 Orbis:持续运行的世界底座

Orbis 是基础款 Live Model,负责整体世界的持续生成与运行,支持文本、图片、视频作为起点,生成过程中可随时修改提示词。它是整个产品矩阵的核心底座,承载主要的世界状态与记忆机制。

Orbis 的核心能力包括实时生成(real-time generation)、无限长度生成(infinite-length generation)、持久记忆(persistent memory)、交互性(interactivity)、物理锚定(physics grounding)五个方面。

4.2 Morphe:人物身份保持与驱动

Morphe 是人物专项模型,专注于修改或驱动画面中的人物,同时保持背景、人物身份与其他细节不变。适合数字人直播、角色动画调整等场景 —— 不需要改动整体世界,仅对人物进行操作。

4.3 Kinesis:时空精确定位编辑

Kinesis 是时空编辑模型,支持用户指定精确的时间点与空间位置,添加或修改对应元素。它提供更精细的控制能力,类似传统视频编辑的关键帧功能,但作用于持续运行的世界中。

三款产品形成 “整体运行 - 人物控制 - 局部编辑” 的完整层级,覆盖从粗粒度到细粒度的修改需求,共同支撑持续内容生产工作流。

Q: Orbis、Morphe 和 Kinesis 的使用场景如何区分?

A: Orbis 负责整体世界的持续运行,适合从零开始生成一个持续演化的场景。Morphe 专注于人物操作,适合需要保持背景不变但调整角色行为的场景。Kinesis 提供最精细的控制,适合需要在特定时间、特定位置精确修改元素的专业制作场景。

五、落地场景、工程挑战与商业边界

5.1 核心落地场景

持续运行型视频模型的价值,在于将 “生成” 与 “修改” 合并为同一个过程。创作者不需要先生成多个版本、下载对比、再决定重做哪一个,而是可以看着画面持续补充要求。

创意内容生产是最直接的落地场景。直播背景生成、广告镜头预演、教学课件演示等场景,都需要快速迭代调整画面内容。行业公开数据显示,在直播背景生成场景中,实时交互模式可将单镜头迭代周期从平均 25 分钟压缩至 8 分钟,迭代效率提升约 68%。

机器人与仿真训练是 Visko 明确的首要市场方向。真实世界里让机器人演练 “打翻易碎品”“车辆在冰面打滑” 这类危险边缘场景,既昂贵又难以安全复现。Orbis 可以按需生成这类画面,并支持在生成中途改变指令,让同一段场景快速衍生出多种训练变体。

Visko 创始人尹青表示,公司正与谷歌合作,并已与多家机器人硬件企业接触。首席顾问、加州大学伯克利分校教授 Michael I. Jordan 则将游戏、直播电商与教育列为更长期的机会。

互动娱乐是最具想象空间的方向。分支叙事电影、可交互直播、虚拟陪伴等场景,都需要画面能够实时响应用户指令。

核心结论: 持续运行型视频模型打破了 “生成 - 修改” 的割裂流程,创作从多轮次的等待渲染变为连续的对话式调整,核心价值体现在效率提升与体验升级两个维度。

5.2 工程挑战一:交互控制精度

实时交互的核心难点在于指令的生效边界控制。用户要求 “让画面中的汽车左转”,系统需要判断从哪一帧开始生效、影响哪些物体、背景如何跟随变化,不能出现人物瞬移、背景跳变等问题。当用户连续输入冲突指令时,系统还需要实现平滑过渡,避免画面剧烈闪烁。

当前的交互控制仍处于较粗粒度,更多是整体风格与场景的切换,精确到特定物体的复杂操作仍容易出现偏差。

Q: Orbis 和传统游戏引擎的核心区别是什么?

A: 游戏引擎依赖预先编写的规则、美术资源与事件逻辑,所有可能性都在开发阶段定义完成。Orbis 通过生成式模型实时创造内容,无需预先制作场景资源,但不具备明确的物理规则与交互边界,画面一致性与可控性弱于成熟游戏引擎。

5.3 工程挑战二:算力成本与定价模型

传统 AI 视频按生成次数或秒数收费,成本结构清晰可控。持续运行模型每一秒都在消耗 GPU 算力,用户运行时间越长,平台承担的算力成本越高。且实时生成需要独占 GPU 资源,无法通过批次处理提升利用率,单位时长成本显著高于离线渲染。

商业层面需要设计合理的计费模式,可以按时长、分辨率、交互次数分级定价。成本控制是决定产品能否从专业工具走向大众消费级的核心因素。

Q: 为什么实时生成的算力成本远高于离线渲染?

A: 离线渲染可以批次处理任务,通过调度提升 GPU 利用率。实时生成需要独占 GPU 资源维持连续运行,无法批次复用,且 24FPS 输出对算力与显存带宽有持续高要求,单位时长成本是离线渲染的数倍。

5.4 工程挑战三:长时稳定性与自校正

长时运行中,微小的视觉误差会被记忆机制保留并持续累积,最终导致人物变形、场景错位、逻辑矛盾等问题。即使是小时级无明显漂移,也不代表可以无限时长稳定运行。

Orbis 通过多段训练中的历史增强来缓解这一问题 —— 在流式训练中混合干净历史与两种增强分支:第一种在构建保留历史和持久记忆之前破坏提交的训练前缀,使用随时间变化的退化、时间破坏和统计偏移;第二种测量生成历史与参考历史之间的固定维度漂移统计,然后将采样偏移重新应用于干净的有限历史。

推理侧的漂移检测与动态校准仍是待完善的方向。当前方案每 256 帧执行一次漂移检测,当人物特征相似度下降超过 15%、场景光照偏移超过阈值时,触发一次全量记忆校准。系统需要持续具备误差检测与自校正能力,这是长时运行系统必须解决的基础问题。

5.5 工程挑战四:实时内容合规

传统内容平台只需要审核完整的成品视频。持续生成模型每秒都在产生新的画面,用户中途修改指令后,可能生成违规内容。平台需要构建实时内容审核系统,在画面输出前完成检测与拦截,对审核延迟与准确率都有极高要求。

5.6 常见认知误区

当前行业对实时长视频生成存在三类典型认知误区:

  1. 误区一:实时生成就是渲染速度快。实时生成的核心是状态持续与交互闭环,单纯提升渲染帧率不代表具备 Live Model 能力。很多离线渲染模型也能通过优化达到高帧率,但无法中途交互与保持长时状态。

  2. 误区二:长视频生成就是把短视频拼接起来。简单拼接片段会出现严重的场景与人物漂移。真正的长视频生成需要持久记忆机制维持全局一致性,不是片段的简单拼接。

  3. 误区三:世界模型可以直接替代仿真引擎。当前生成式世界模型学习的是视觉层面的物理规律,不具备精确的数值计算能力,无法替代工程级仿真工具,仅适合视觉层面的概念验证。

5.7 过度优化判断标准

对于计划接入 Orbis API 的团队,以下标准可用于判断是否过度优化了与模型的交互流程:

让无技术背景的普通用户连续观看 15 分钟生成内容,若满足以下任意两项,即可判定为过度优化:人物特征相似度下降超过 15%、物体位置偏差超过帧宽 10%、场景色温偏移超过 200K。出现这类情况,说明系统为压缩算力成本过度裁剪了记忆与物理约束模块。

核心结论: 持续运行型视频模型的商业化瓶颈不在生成帧率,而在于成本结构、控制精度与内容合规三大工程化问题,三者共同决定产品能否从技术演示走向规模化可用。

六、行业趋势与技术演进方向

AI 视频生成的竞争正在从 “比画质” 转向 “比交互”。前几代产品的核心升级点是分辨率、帧率、动作自然度,而新一代产品的核心突破点是交互能力、持续时长、状态一致性。视频正在从 “生成一次、下载一次” 的文件形态,转向 “持续运行、随时介入” 的环境形态。

2025 年以来全球世界模型赛道累计融资规模突破 15 亿美元,其中实时生成方向融资占比从 2024 年的 12% 提升至 2026 年的 37%。Visko 以 16 人团队、1000 万美元种子前融资推出可验证产品,验证了该赛道技术门槛正在从巨头垄断向精锐团队下沉。

Live Model 将带动产业链从应用到能源的全栈重构,但对 Orbis 这类初创产品而言,更核心的是自身技术路线的迭代方向。短期 1~2 年内,画质仍会是市场竞争的基础项;2 年以上维度的竞争,将逐步转向记忆长度、物理精度与交互能力。

6.1 技术演进方向

结合当前技术短板与落地需求,Orbis 后续的核心突破点集中在三个方向:

  1. 物理精度提升:优化潜世界模型的动力学参数,从视觉合理向数值可验证演进,支撑机器人训练等工程级场景。

  2. 记忆容量扩展:在固定算力预算下提升长时记忆的信息密度,延长稳定运行时长,支撑长叙事内容、持续性数字人等场景。

  3. 控制粒度细化:从场景级控制向物体级、像素级控制演进,支持专业制作场景的精确编辑需求。

Visko 创始人尹青对此有清晰的表述:此前每一个号称实时的系统都面临同一技术瓶颈 —— 世界运行的时间越长就越容易崩溃。构建 Orbis 的目标就是让它能在物理上、视觉上和叙事上持续保持连贯,只要用户想留在里面,它就能一直运行下去。

对一家刚拿到 1000 万美元 Pre-Seed、只发布了一个模型的公司来说,光环与风险同样清晰。尹青本人也坦言,通用家用机器人或许还要十年。但 Orbis 所代表的范式转向仍然值得记录 —— 当 AI 视频从 “生成一段能看的片段” 走向 “持续运行一个可交互的世界”,视频生成的竞争维度就从画质与速度,转向了记忆、物理与实时交互。

FAQ

Q: Live Model 和传统查询模型最本质的区别是什么?

A: 核心区别在于运行逻辑。查询模型是单轮离线渲染,生成固定时长视频后进程终止,无状态记忆;Live Model 是持续运行的动态系统,与物理时间同步推演,保留持久状态,支持中途实时交互,理论上可无限时长生成。

Q: Orbis 1.0 的 4K@24FPS 是直接原生生成的吗?

A: 不是。Orbis 采用两级流水线架构:基础生成器先产出 832×480 分辨率的基础帧流,保证 24FPS 的生成速度;再通过流式视频超分器实时升频至 4K 分辨率,兼顾生成速度与输出画质。

Q: Orbis 的物理精度可以直接用于机器人训练吗?

A: 当前还不可以。Orbis 的物理锚定仅能保证视觉层面的运动合理性,无法输出精确的动力学数值,也不能稳定执行带精确数值的物理指令,目前仅适合视觉层面的概念验证与初步训练场景。

Q: 实时生成的算力成本为什么远高于离线渲染?

A: 核心原因是资源利用率差异。离线渲染可批次处理任务,通过调度提升 GPU 利用率;实时生成需要独占 GPU 资源维持连续运行,无法批次复用,且 24FPS 输出对算力与显存带宽有持续高要求,单位时长成本可达离线渲染的 3~5 倍。

Q: 什么样的团队适合接入 Orbis 这类 Live Model?

A: 有实时交互需求的团队优先考虑接入,比如直播内容制作、交互式教育、机器人仿真预研团队。如果仅需生产固定短视频,传统查询模型在画质与成本上更有优势。

Q: 长时运行会不会出现画面漂移?

A: 1~3 小时的标准场景下无明显可感知漂移。超长运行或高频交互场景下,误差仍可能逐步累积。当前模型每 256 帧执行一次漂移检测与校准,尽量延缓漂移出现的时间。

结论

Orbis 1.0 首次将 Live Model 从技术概念落地为可公开体验的产品,验证了持续交互式长视频生成的技术可行性。其 Neural SDE 驱动的世界时钟、有界多尺度记忆、流式分块超分与物理锚定生成等技术设计,为实时视频生成系统提供了可参考的工程框架。

从技术架构看,Orbis 通过三大核心技术支柱,在持续运行、实时响应和长时一致性三个维度上做出了系统性的工程尝试。它不追求单帧画质的极致,而是押注 “交互式长视频” 这个尚未被充分探索的产品形态。

从工程成熟度看,Orbis 仍处于早期阶段。4K@24FPS 和小时级一致性来自公司自测,尚未经独立验证。机器人仿真等优先场景对物理精度的要求,可能超出当前模型的能力边界。商业化路径 —— 如何定价、如何控制算力成本、如何让用户为 “持续运行” 付费 —— 仍是未解的问题。

对于技术从业者,Orbis 的价值不在于它今天能做到什么,而在于它指明了 AI 视频生成的下一个竞争维度:从画质与速度,转向记忆、物理与实时交互。这条路刚刚被踩出第一个脚印。

【省心锐评】

16 人、1000 万美元、一年时间交出可公开体验的实时 4K 视频生成系统,它标志着世界模型从概念讨论走入了必须回答成本 - 收益问题的工程阶段。无论最终商业化成败,技术门槛已从 “巨头专属” 走向 “精锐团队可挑战”,核心看点是能否在机器人训练场景证明持续生成的工程价值。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐