Wan: Open and Advanced Large-Scale Video Generative Models
Team Wan 等 · arXiv 技术报告 · 2025 · arXiv:2503.20314 v2 · Zotero 3IHT7RL9
论文身份
这是 60 页系统技术报告,不是会议论文。Wan 不只描述一个 Video DiT,还公开数据清洗/字幕、Wan-VAE、flow matching 训练、分布式扩展、推理缓存、量化与多种下游应用,是理解工业级视频模型最完整的公开材料之一。
§1 为什么它值得单独读
MODELS
1.3B / 14B
小模型强调消费级部署,大模型用于质量与规模律探索。
TOKENIZER
Wan-VAE · 127M
因果时空 VAE,兼顾压缩质量、速度和长视频流式编码。
OBJECTIVE
Flow Matching
图像/视频统一连续时间路径,DiT 预测速度场。
SUITE
8 类任务
T2V、I2V、编辑、个性化、相机控制、实时生成、音频等。
§2 架构:简单三件套,难在每一件都能 scale

Fig 9 · p.13 Wan 的主干。架构看似是标准 LDM/DiT;报告的主要价值是把 tokenizer、数据、训练与系统扩展写完整。
Wan 训练/采样链
1. 视频压成 latent
Wan-VAE 同时压缩空间与时间,特征缓存避免长视频重复计算。
2. 文本形成跨注意力条件
umT5 编码长 caption;prompt rewrite 用于缩小用户短提示与训练 caption 的分布差。
3. DiT 学速度场
在 noise 与数据之间插值得到 $x_t$,回归 rectified-flow 速度。
4. 多步 ODE 采样后解码
报告常用约 50 步,并通过并行、缓存与 FP8 降低延迟。
§3 Wan-VAE:为什么 tokenizer 是第一等公民
$$V\in\mathbb R^{(1+T)\times H\times W\times3}\longrightarrow z\in\mathbb R^{(1+T/4)\times H/8\times W/8\times C}$$§4.1 · Wan-VAE 时空压缩
三个工程点
- Causal 3D convolution
- 按时间顺序编码,适合 I2V 与流式 chunk。
- Feature cache
- 相邻 chunk 重叠部分复用中间特征,既省算力又维持边界一致。
- 三阶段训练
- 先 2D 图像 VAE,再引入视频,最后在更高质量视频上微调。
论文报告
Wan-VAE 仅 127M 参数;在其 720×720、25 帧评测设置中,同时强调重建质量与 frame-per-latency 效率。这个对 WAM 很关键:闭环速度常先被 tokenizer 限制。
§4 Flow Matching + DiT
$$x_t=(1-t)x_0+t x_1,\qquad v^*(x_t,t)=x_1-x_0$$§4.2.2 · Rectified-flow 训练的核心路径
Wan 如何使用
- $x_0$
- 高斯噪声 latent。
- $x_1$
- 图像或视频的 Wan-VAE latent。
- $v_\theta$
- DiT 在文本与 timestep 条件下预测速度场,推理时解 ODE 从噪声走向数据。
渐进预训练
先做低分辨率图像预训练,再进入图像—视频联合训练,并逐步提高空间分辨率和视频时长;post-training 用更高质量 480p/720p 数据继续联合训练。
§5 系统扩展:14B Video DiT 真正烧在哪里
| 计算瓶颈 | DiT 占训练计算的绝大多数;长视频使 attention 随序列长度平方增长。 |
| 分布式 | VAE/Text Encoder 用数据并行,DiT 用 FSDP + 2D context parallel,并在模块边界转换布局。 |
| 显存 | activation offloading 与 selective gradient checkpointing 组合,避免全量重算。 |
| 可靠性 | 慢机检测、坏节点隔离与自动重启被视为模型训练的一部分。 |
| 推理 | 多 GPU context parallel、diffusion/CFG cache 与 DiT GEMM FP8 量化。 |
§6 证据与边界
DATA
分阶段过滤与配比
质量、静态视频、文字/水印、合成图、运动与 caption 分布随阶段动态调整。
EVAL
Wan-Bench + VBench + 人评
内部/外部指标与偏好评测并用,但自建 benchmark 需注意独立复现。
OPEN
代码与全系列权重
1.3B 的公开使消费级实验成为可能;14B 仍有高训练/推理成本。
LIMIT
数据细节不完全公开
报告披露 O(1) trillions tokens 级规模与管线,但无法完全复现工业数据组成。
理解检查
Wan 的 DiT 主要学习什么?
§7 对 WAM 的意义
最接近可复用工业底座的一篇
Wan 将视频 tokenizer、flow DiT、长 caption、阶段式数据课程、分布式训练和推理缓存放进同一系统视角。做生成式 WAM 时,这些模块几乎都能复用,只需把条件与输出扩展到机器人状态/动作。
但“world simulator”仍未成立
开放视频模型可以产生丰富运动,却没有用动作干预验证可控动力学。WAM 还需要 action-conditioned counterfactual、接触一致性与闭环控制成功率,不能只继承视频 benchmark。