paper-notes/Video DiT/Sora

Video Generation Models as World Simulators

OpenAI · 官方网页技术报告 · 2024-02-15 · Zotero 6WS6VWM6 · 无官方论文 PDF

为什么这页没有“论文 PDF”按钮

Sora 的架构材料以 OpenAI 官方网页技术报告发布,不是会议论文,也没有官方 PDF。本站将它作为 webpage/technical report 导入 Zotero并链接原始 URL;不会把第三方转载或本站打印件冒充论文附件。

§1 它提出的研究命题

主张,而不是定论

报告把大规模视频生成训练描述为通向“通用物理世界模拟器”的路径:当模型统一学习不同长度、分辨率、宽高比和内容的视频/图像后,会出现部分 3D 一致性、物体持久性与数字世界模拟能力。但这些主要由生成样例呈现,不是统一物理 benchmark 的证明。

SOURCE TYPE
官方网页报告
没有作者列表、arXiv 编号或同行评审 venue。
MODEL CLASS
Diffusion Transformer
在时空 patch token 上去噪,结构可随数据和算力扩展。
DATA
图像 + 视频
保留原始时长、分辨率与宽高比,而非统一裁成固定规格。
EVIDENCE
定性样例为主
报告展示 scale 后错误减少,但未披露完整训练数据与标准化消融。

§2 统一表示:把视觉数据变成 spacetime patches

01 · RAW VISUAL不同分辨率、宽高比、帧率和时长的图像/视频
02 · COMPRESS视频压到低维时空 latent,降低 token 数与去噪成本
03 · PATCHIFYlatent 切成 spacetime patch token,图像视作单帧特例
04 · DIFFUSION TRANSFORMER根据文本和噪声时间预测 clean patch / 去噪方向
$$x\xrightarrow{\mathcal E}z\xrightarrow{\operatorname{patchify}}\{p_i\}_{i=1}^{N}\xrightarrow{\text{DiT}}\{\hat p_i\}$$报告公开的概念流水线;未披露完整 tokenizer 与 block 细节
为什么 patch 是关键
统一接口
不同尺寸与时长只表现为 token 数不同,Transformer 主干无需固定输出网格。
原生规格训练
避免强行 resize/crop 破坏构图,让模型学习竖屏、横屏与不同镜头时长。
可扩展
patch 数仍随视频体量增长;训练需要分桶、并行与高压缩 tokenizer,报告未给完整实现。

§3 文本条件:caption 质量决定可控性

Recaptioning

报告强调用高度描述性的字幕重新标注训练视频;推理时再让语言模型把用户短 prompt 扩写成与训练 caption 分布更接近的描述。它提升文本忠实度,但也意味着“模型理解了什么”部分取决于 captioner 与 prompt rewriter。

训练到推理的 4 步

1. 保留原生视觉规格

不把所有样本压成同一长宽与时长,训练批次需处理可变 token 数。

2. 生成密集 caption

把主体、动作、环境、相机运动与时间变化写进训练条件。

3. 在时空 patch 上扩散训练

Transformer 接收 noisy patch、timestep 与文本条件,学习还原视觉 latent。

4. 用户 prompt 先扩写再生成

语言模型把短指令改写为训练风格长描述,再送入 Sora。

§4 为什么报告使用“world simulator”这个词

3D consistency镜头运动时,场景元素可在一定范围内保持三维位置关系。
Long-range coherence被遮挡物体有时会再次出现,人物/物体属性在较长片段内保持。
World interaction可生成简单动作—后果、绘画痕迹和部分接触变化。
Digital worlds能在一定程度上模拟 Minecraft 类画面和视角移动。
证据等级

这些是qualitative emergence:说明模型学到部分规律,但不能推出它拥有稳定、可查询、可干预的动力学状态。没有 action interface、counterfactual 评测和闭环控制时,它仍首先是视频生成模型。

§5 报告自己展示的失败模式

PHYSICS
因果/物理错误
玻璃破碎、吃东西、运动轨迹等可能违反真实动力学。
STATE
物体状态漂移
物体会凭空出现、消失、复制,或在交互后形状错误。
SPACE
空间关系混乱
左右、方向、轨迹与相机运动在复杂提示中可能不一致。
LONG HORIZON
长程一致性不稳定
局部逼真不等于整段事件具有稳定身份与因果链。
理解检查
为什么不能直接把 Sora 叫作机器人 WAM?

§6 对 WAM 的真正价值

地基,而不是终点

Sora 证明“时空 tokenizer + 大规模 DiT + 原生规格数据 + 密集 caption”可以承载丰富视觉动力学。WAM 可继承这套视觉生成地基,再加入动作条件、机器人状态、价值/任务信号与交互数据。

$$\underbrace{p(z_{future}\mid z_{history},l)}_{\text{Sora-like video model}}\quad\longrightarrow\quad\underbrace{p(z_{future},a\mid z_{history},l,s)}_{\text{World Action Model}}$$从视觉预测到未来—动作联合建模
这不是同一个条件分布
$z_{history}$
过去视频的 latent token,提供当前世界状态。
$l$
文本或高层任务条件;Sora 类模型据此预测“可能发生什么”。
$a$ 与 $s$
机器人动作和本体状态;加入后模型才需要刻画“执行这个动作会导致什么”。
箭头的含义
从观察相关性升级为可干预联合建模。漂亮视频是前提,但不能自动推出动作可行性或因果一致性。
阅读顺序

想看公开实现细节,接着读 Open-Sora;想看工业级完整管线,读 Wan;想看模态专家融合,读 CogVideoX