paper-notes/Video DiT/CogVideoX

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang 等 · ICLR 2025 · arXiv:2408.06072 v3 · Zotero RSHYMXS9

论文身份

这是正式 ICLR 2025 论文。CogVideoX 把 LDM 扩展到视频时,集中解决四件事:时空压缩、文本—视频深融合、混合时长/分辨率训练,以及高质量视频字幕和过滤。它是视频生成地基,不是带动作监督的 WAM。

§1 三个核心结构

TOKENIZER
3D Causal VAE
空间 $8\times8$、时间 $4\times$ 压缩,保留视频因果顺序。
BACKBONE
Expert Transformer
文本/视频 token 共同做 3D full attention,但使用不同 AdaLN 专家参数。
CURRICULUM
Progressive Training
由低分辨率、较短视频逐步迁移到高分辨率、长时长。
BATCHING
Frame Pack
按 token 预算打包不同尺寸/时长,减少 padding 浪费。

§2 一张图读完流水线

CogVideoX architecture
Fig 3 · p.3 CogVideoX 总体架构。“Expert”不是两套 Transformer,而是共享主干、分离模态调制参数。
一次训练样本怎样流动

1. 视频压成时空 latent

3D VAE 同时减少 $T,H,W$,将昂贵的像素序列变成可处理 token。

2. 文本编码并拼接

T5 embedding 与 patchified video latent 沿序列维拼接。

3. 分模态调制

文本和视频分别用 Expert AdaLN 产生调制参数,主干仍可共享知识。

4. 联合注意力预测去噪目标

3D full attention 让任意时空 token 与文本 token 交互,输出再 unpatchify。

§3 3D Causal VAE:Video DiT 的算力闸门

$$V\in\mathbb R^{F\times H\times W\times3}\longrightarrow z\in\mathbb R^{(F+1)/4\times H/8\times W/8\times C}$$§2.1 · 论文采用 8×8×4 时空压缩
设计后果
Temporal causal convolution
时间 padding 放在过去侧,生成/切块时不偷看未来。
KL regularizer
保持连续 latent 可采样,并控制尺度。
上下文并行
长视频编码沿时间切分到多设备,利用因果卷积只交换有限边界。
消融结论

更激进的 $16\times16\times8$ 压缩即使增加 latent channel,也让收敛更困难;Video VAE 仍存在“压缩率—细节—训练稳定性”三方权衡。

§4 Expert Transformer:融合,不等于完全共享

与普通 DiT 对照

普通 DiT 常用一套 AdaLN 由 timestep/条件统一调制;CogVideoX 让文本与视觉 token 各自拥有 AdaLN 参数,再共享 3D attention 与 FFN。这样既保留跨模态信息流,又允许两种统计分布独立归一化。

为什么不用空间/时间分解注意力

论文消融认为 3D full attention 在同等设置下更有利于视频质量和训练收敛;代价是序列长度平方级开销更重,这也是后续模型继续研究稀疏/分解注意力的原因。

§5 训练系统:模型以外的三块

Multi-Resolution Frame Pack在固定 token 预算中装入不同分辨率与帧数,提升设备利用率。
Progressive Training分辨率和时长逐级增加,避免一开始就承受最长序列。
Explicit Uniform Sampling显式均匀覆盖 diffusion timestep,减少不同时间步损失尺度导致的曲线波动。
Caption pipeline用视频 caption 模型生成密集描述,并结合质量、运动、物理与封面等过滤标签。

§6 论文证据与边界

SCALE
2B / 5B
公开视频生成权重覆盖 T2V 与 I2V;论文报告最高约 10 秒、16 fps、768×1360。
EVAL
自动 + 人评
FVD、CLIP 类指标之外,增加感官质量、指令遵循和物理合理性人工维度。
ABLATION
架构与采样都有贡献
Expert AdaLN、3D full attention、uniform timestep sampling 均被单独验证。
LIMIT
开放视频 ≠ 世界模型
逼真视频与文本一致性不能证明动作条件下的因果预测与可控闭环。
理解检查
CogVideoX 的“Expert Transformer”最准确指什么?

§7 对 WAM 的意义

能直接继承的

3D causal VAE、混合时长 batching、渐进式训练和密集 caption 都可直接服务动作条件视频模型。若把文本条件扩展为历史观测、机器人 proprioception 与 action,CogVideoX 是很自然的视频生成底座。

还缺的一步

论文没有学习机器人动作接口,也没有验证干预一致性。WAM 必须回答:给同一初始状态换一个 action,未来 latent 是否产生正确、可重复的因果差异?