DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
引言:为什么 VLA 需要视频动力学?
当前 VLA(Vision-Language-Action)模型几乎都继承自静态图文预训练的 backbone(如 SigLIP + LLM), 这意味着它们对时间演化和物理接触几乎没有 intrinsic 理解——这些都只能靠少量动作示范来补偿。 而视频生成模型(VGM)恰恰相反:它们在海量互联网视频上学会了"世界如何随时间变化",内含丰富的 时空先验和隐式物理动力学。DiT4DiT 的核心假设: 把视频生成作为 proxy 任务训练 VLA,是比语义对齐更有效的 scaling 信号。
DiT4DiT 是一个端到端 Video-Action Model(VAM),用 dual-DiT 架构耦合视频 DiT 和动作 DiT, 在 denoising 过程中提取 intermediate hidden states 作为动作条件,并用 dual flow-matching 联合优化, 实现视频动力学和机器人动作的统一建模。
1.1 三种 proxy 任务的比较
在引入 DiT4DiT 架构之前,作者首先验证了视频生成是否真的是最好的 proxy 任务。三种路线如下:
在 24 个 tabletop 任务的 RoboCasa 仿真 benchmark 上,视频生成 proxy 比 Grounding 和 FLARE-style 在所有数据量区间都表现更好,且随数据增加的 scaling 趋势更陡——论文 Fig. 1 的核心结论。
为什么视频生成是最好的 Proxy 任务?
想象你学会了"预测接下来 2 秒里一杯水被抓起来后会怎样移动"——你天然地在脑中有了 抓握力、重力、惯性的物理模型。这正是视频生成 proxy 给模型的: 通过强迫模型预测未来帧,让它自动学到物体运动的连续物理规律。 这些规律正是控制机器人时最需要的先验。
2.1 与静态 VLM 的本质区别
| 先验类型 | 训练信号 | 能学到什么 | 机器人控制缺陷 |
|---|---|---|---|
| VLM 语义先验 | 图像-文字对 | 物体识别、空间关系、语言理解 | 不知道"抓住后物体如何运动" |
| 视频生成先验 | 视频序列(自监督) | 时间演化、接触物理、因果关系 | —(这正是 DiT4DiT 想利用的) |
2.2 两个核心研究问题
- 视频生成能否作为 robot policy 的有效 proxy 任务?(即:预测未来帧真的比其他辅助任务更能帮助学习动作?)
- 视频模型学到的时空表示,应该如何被提取并耦合到动作生成?(不是直接用 reconstructed future frames,而是…)
以往工作(如 Cosmos Policy、mimic-video)依赖 已重建好的未来帧 作为条件,这需要等 Video DiT 完成完整 denoising, 导致推理慢。DiT4DiT 的关键 insight:不需要等完全 denoise——直接读取 Video DiT denoising 过程中某个固定 timestep 的 hidden state, 就已经包含足够的时空信息驱动动作生成。这是 MotionWAM 也采用的核心设计原则。
双 DiT 架构详解
DiT4DiT = Video DiT(Cosmos-Predict2.5-2B 初始化)+ Action DiT(GR00T-N1 动作头风格)。 两者通过 前向钩子(forward hook) 在固定 flow timestep $\tau_f$ 处耦合:Video DiT 的 intermediate hidden states 被提取为视觉条件 $\mathbf{h}_t^{\tau_f}$,传给 Action DiT 做 cross-attention。 两个模块联合用 dual flow-matching 训练。
3.1 Video DiT — 视频动力学建模
如果每次训练时 $\tau_f$ 随机变化,Action DiT 接收的 Visual Feature 就会不稳定(早期 timestep 是全局结构,晚期是细节)。 固定 $\tau_f$ 作为"特征提取操作点",让 Action DiT 始终接收一致的视觉信号。 这就像从生产线上的固定位置取样品检验——不能一会儿取半成品一会儿取成品。
3.2 Action DiT — 动作生成
3.3 整体信息流
联合训练:Tri-Timestep 与 Dual Flow-Matching
联合训练 Video DiT 和 Action DiT 面临一个矛盾:视频生成需要均匀采样 timestep(覆盖整个 denoising 轨迹), 而特征提取需要固定 timestep(稳定信号),动作生成又有自己的最优采样分布(聚焦关键阶段)。 DiT4DiT 的解法:三个独立的 timestep,各自服务各自的目的。
4.1 三时间步设计(Tri-Timestep)
| $\tau_v$(视频 DiT 训练) | 从 $\mathcal{U}[0,1]$ 均匀采样,让模型接触所有噪声等级,学习完整 denoising 轨迹 |
| $\tau_f$(特征提取) | 在 $\{0, 1/T, 2/T, \ldots, T/T\}$ 中均匀采样,但在使用时取确定性固定值,保证 Action DiT 接收稳定特征 |
| $\tau_a$(动作 DiT 训练) | 从 Beta 分布 采样($\tau_a = 1 - \sigma$,$\sigma \sim \text{Beta}(\alpha, \beta)$),集中在动作变化最大的关键阶段 |
Beta 分布的 $\tau_a$ 让动作 DiT 把训练资源集中在 flow trajectory 的关键阶段——类比"重点复习考点"。 Beta$(1.5, 1.0, 0.999)$ 使采样密度偏向 $\tau_a$ 接近 1 的区域(接近纯噪声), 这是动作预测需要学习的最难阶段。
4.2 Dual Flow-Matching 目标函数
- Action Flow Matching Loss
- 训练动作 DiT 预测从噪声到干净动作的速度场。条件是 Video DiT 提取的 $\mathbf{h}_t^{\tau_f}$ 和本体状态 $s$。
- Video Flow Matching Loss
- 同时训练 Video DiT 预测未来帧。$\lambda$ 是权重系数,平衡两个损失。
- 为什么要保留 Video Loss?
- 如果只优化动作 loss,Video DiT 的特征会退化为仅对动作有用的表示,失去通用的视觉动力学先验。 同时保留视频 loss 作为表示正则化器,确保 $\mathbf{h}_t^{\tau_f}$ 始终携带丰富的时空信息。
4.3 训练流程(Algorithm 1 简化版)
Step 1:Video DiT Forward(视频噪声预测)
VAE 编码当前帧和未来帧为 latent。采样 $\tau_v \sim \mathcal{U}[0,1]$ 和噪声 $z \sim \mathcal{N}(0,I)$,构造噪声 latent $\mathbf{z}_{t+1}^{\tau_v}$。Video DiT 预测速度 $\hat{v}_{\text{video}}$,计算 Video Loss。
Step 2:提取 Hidden State(hook 机制)
采样特征提取 timestep $\tau_f \sim \mathcal{U}\{0, 1/T, \ldots, 1\}$,用独立噪声构造 $\hat{z}_{t+1}$,通过 hook 算子 $\mathcal{H}$ 提取 Video DiT 在 $\tau_f$ 处的 hidden state $\mathbf{h}_t^{\tau_f}$。
Step 3:Action DiT Forward(动作噪声预测)
采样 $\sigma \sim \text{Beta}(\alpha, \beta)$,令 $\tau_a = 1 - \sigma$,构造噪声动作 $\mathbf{a}_t^{\tau_a}$。Action DiT 以 $\mathbf{h}_t^{\tau_f}$ 和本体状态 $s$ 为条件预测速度 $\hat{v}_{\text{action}}$,计算 Action Loss(加 action mask $M$)。
Step 4:联合 Loss 反向传播
$\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{action}} + \lambda \cdot \mathcal{L}_{\text{video}}$。两个 loss 同时反向传播,联合更新 Video DiT 参数 $\theta$ 和 Action DiT 参数 $\phi$(VAE 和文本编码器保持冻结)。
Step 5:推理时(Inference)
Action DiT 只需单次固定 forward pass提取 $\mathbf{h}_t^{\tau_f}$(不迭代 Video DiT),再对 Action DiT 做 $N_a$ 步 ODE 积分得到动作轨迹。可选同时做 Video DiT 的 $N_v$ 步 denoising 生成未来帧预测。
实验结果:LIBERO & RoboCasa & Unitree G1
三个实验平台:(1) LIBERO 仿真(Franka Panda,4 套件各 10 任务,500 轨迹/任务); (2) RoboCasa-GR1 仿真(Fourier GR1 人形,24 个 tabletop 任务,1000 轨迹/任务); (3) 真实 Unitree G1(7 任务 × 200 episodes)。
5.1 LIBERO Benchmark(Franka Panda 仿真)
DiT4DiT 以 98.6% 刷新 LIBERO 所有方向最高成绩,尤其 LIBERO-Long(长时程任务)达 97.6%(+5.6% vs 次优), 说明视频动力学先验对需要多步规划的任务提升最显著。 注意 DiT4DiT 和 Qwen3DiT 都是从头训练(from scratch),没用大规模 robot 数据预训练。
5.2 RoboCasa-GR1 与真实 G1
| 模型 | RoboCasa-GR1 (24 tasks) | Real G1 (7 tasks) | 备注 |
|---|---|---|---|
| DiT4DiT (ours) | 50.8% | SOTA | ~15% of GR00T-N1.5 pre-train data |
| GR00T-N1.5 | — | Strong baseline | 官方预训练权重 |
| Qwen3DiT | 46.6% | Weaker | 静态 VLM 先验 |
| π₀.₅ | ~38% | — | VLA 代表 |
5.3 样本效率 — 最关键的 Scaling 结果
如图 1(论文)所示,在 10%–100% 训练数据范围内,DiT4DiT(视频生成 proxy)的成功率曲线始终高于 Grounding 和 FLARE-style。 在只用 20% 数据时,DiT4DiT 与 FLARE-style 差距最大(约 +15%),说明视频先验在数据稀缺时最有价值。
具体数字:DiT4DiT 的样本效率比 FLARE-style 高 >10×,收敛速度快 up to 7×。
与 MotionWAM 的关系:先驱 vs 扩展
DiT4DiT 和 MotionWAM 都来自 Mondo Robotics + HKUST 团队,作者高度重叠。 MotionWAM 引用 DiT4DiT 为 [21],明确继承其 dual-DiT 框架; MotionWAM 的 Motion DiT 明确指定跟随 "DiT-B configuration introduced in DiT4DiT"。 但两者的目标场景和技术细节有重要区别。
| DiT4DiT(先驱) | MotionWAM(扩展) | |
|---|---|---|
| 目标场景 | 桌面操作(tabletop manipulation) | 人形全身 Loco-Manipulation |
| 动作空间 | arm + gripper(约 7-16 DoF) | 29-DoF 全身(unified motion latent) |
| Motion DiT 输出 | 直接预测关节/EEF 动作 | 预测 SONIC motion latent(m_t = 连续 + 离散 token) |
| Video DiT backbone | Cosmos-Predict2.5-2B | 同上(直接复用) |
| τ_f 使用方式 | 训练时 uniform 采样,推理时固定 | 全程固定在纯噪声端(τ_f ≈ 1),one-shot imagination |
| 数据策略 | 仿真 + 少量真实 G1 | 三阶段:2136h 视频 → 跨本体 → 真实 WBT |
| 实时性 | 未特别强调 | 4.9 Hz 闭环,7× faster than Cosmos Policy |
| 关键新贡献 | video generation 作为 proxy + tri-timestep + 联合训练 | unified motion latent + egocentric 三阶段课程 + 实时人形 |
DiT4DiT ≈ "发明了双 DiT 耦合方法并在桌面机器人上验证"; MotionWAM ≈ "把这个框架搬到人形机器人上,并解决实时性、全身控制、数据规模三个新挑战"。 DiT4DiT 证明了 video proxy 的有效性和 dual-DiT 架构的可行性, MotionWAM 把它推广到了更难、更实用的场景。
DiT4DiT 和 MotionWAM 共同指向一个结论: 视频动力学先验是 VLA 目前最缺失的能力。纯 VLM backbone 的 VLA 在需要物理接触、 长时程规划的任务上有系统性短板;而把 video generation 嵌入训练目标, 即使只用 15% 的数据量,也能超越官方大规模预训练的 GR00T 系列。 未来研究方向:VLM + Video DiT 统一预训练,同时获得语义和物理两种先验。