arXiv 2603.10448 · Mondo Robotics · HKUST(GZ) · 22 Mar 2026

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang*, Shuo Yang*
* Corresponding author · Code & Models: dit4dit.github.io
Video-Action Model Dual DiT Flow Matching LIBERO 98.6% WAM · 2026
§ 01

引言:为什么 VLA 需要视频动力学?

核心问题

当前 VLA(Vision-Language-Action)模型几乎都继承自静态图文预训练的 backbone(如 SigLIP + LLM), 这意味着它们对时间演化和物理接触几乎没有 intrinsic 理解——这些都只能靠少量动作示范来补偿。 而视频生成模型(VGM)恰恰相反:它们在海量互联网视频上学会了"世界如何随时间变化",内含丰富的 时空先验和隐式物理动力学。DiT4DiT 的核心假设: 把视频生成作为 proxy 任务训练 VLA,是比语义对齐更有效的 scaling 信号。

论文一句话

DiT4DiT 是一个端到端 Video-Action Model(VAM),用 dual-DiT 架构耦合视频 DiT 和动作 DiT, 在 denoising 过程中提取 intermediate hidden states 作为动作条件,并用 dual flow-matching 联合优化, 实现视频动力学和机器人动作的统一建模。

1.1 三种 proxy 任务的比较

在引入 DiT4DiT 架构之前,作者首先验证了视频生成是否真的是最好的 proxy 任务。三种路线如下:

PARADIGM 1
Grounding(目标检测)
用辅助检测头驱动 VLM 理解物体的"什么"和"在哪"。语义精确,但不涉及运动。
PARADIGM 2
FLARE-style(特征对齐)
用 VLM latent 预测未来帧特征,试图捕获 pixel-level 物理动力学,但仍依赖静态 VLM。
PARADIGM 3 · DiT4DiT
Video Generation(视频生成)
直接用视频 DiT 预测未来帧,学习连续时空动力学。收敛快 7x,样本效率高 10x。
最优
实验验证结论

在 24 个 tabletop 任务的 RoboCasa 仿真 benchmark 上,视频生成 proxy 比 Grounding 和 FLARE-style 在所有数据量区间都表现更好,且随数据增加的 scaling 趋势更陡——论文 Fig. 1 的核心结论。

§ 02

为什么视频生成是最好的 Proxy 任务?

直觉理解

想象你学会了"预测接下来 2 秒里一杯水被抓起来后会怎样移动"——你天然地在脑中有了 抓握力、重力、惯性的物理模型。这正是视频生成 proxy 给模型的: 通过强迫模型预测未来帧,让它自动学到物体运动的连续物理规律。 这些规律正是控制机器人时最需要的先验。

2.1 与静态 VLM 的本质区别

2.2 两个核心研究问题

  1. 视频生成能否作为 robot policy 的有效 proxy 任务?(即:预测未来帧真的比其他辅助任务更能帮助学习动作?)
  2. 视频模型学到的时空表示,应该如何被提取并耦合到动作生成?(不是直接用 reconstructed future frames,而是…)
关键洞察

以往工作(如 Cosmos Policy、mimic-video)依赖 已重建好的未来帧 作为条件,这需要等 Video DiT 完成完整 denoising, 导致推理慢。DiT4DiT 的关键 insight:不需要等完全 denoise——直接读取 Video DiT denoising 过程中某个固定 timestep 的 hidden state, 就已经包含足够的时空信息驱动动作生成。这是 MotionWAM 也采用的核心设计原则。

§ 03

双 DiT 架构详解

总览

DiT4DiT = Video DiT(Cosmos-Predict2.5-2B 初始化)+ Action DiT(GR00T-N1 动作头风格)。 两者通过 前向钩子(forward hook) 在固定 flow timestep $\tau_f$ 处耦合:Video DiT 的 intermediate hidden states 被提取为视觉条件 $\mathbf{h}_t^{\tau_f}$,传给 Action DiT 做 cross-attention。 两个模块联合用 dual flow-matching 训练。

3.1 Video DiT — 视频动力学建模

初始化 Backbone
Cosmos-Predict2.5-2B
因果时空 VAE + flow-matching 视频 DiT。输入当前观察帧 $\mathbf{o}_t$ 和语言指令 $l$,输出未来帧预测。 文本编码器和 VAE 在训练中全程冻结。
核心机制
Forward Hook 提取 Hidden State
不等 Video DiT 完成完整 denoising;在固定 flow timestep $\tau_f$ 拦截特定 transformer block 的激活。 公式:$\mathbf{h}_t^{\tau_f} = \mathcal{H}[v_\theta^{\text{video}}](\mathbf{z}_{t+1}^{\tau_f}, \tau_f \mid \mathbf{z}_t^0, l)$
为什么 τ_f 固定?

如果每次训练时 $\tau_f$ 随机变化,Action DiT 接收的 Visual Feature 就会不稳定(早期 timestep 是全局结构,晚期是细节)。 固定 $\tau_f$ 作为"特征提取操作点",让 Action DiT 始终接收一致的视觉信号。 这就像从生产线上的固定位置取样品检验——不能一会儿取半成品一会儿取成品。

3.2 Action DiT — 动作生成

架构基础
GR00T-N1 动作头风格(DiT-B)
多个 Transformer block,每个用 AdaLN 注入 diffusion timestep 信息(来自 DiT/Peebles & Xie 2023), 再用 cross-attention 层对齐 Video DiT 提取的 $\mathbf{h}_t^{\tau_f}$。
输入序列
proprioception + 噪声动作 + future tokens
本体感受状态 $s$(关节位置/EEF 位姿)+ 加噪动作轨迹 + 可学习的 "future tokens"(作为 motion planning 的压缩 query)。 输出速度场 $\hat{v}$,积分得到预测动作 $\hat{\mathbf{a}}_t$。

3.3 整体信息流

当前观察 o_t + 语言 l VAE Encoder Video DiT Cosmos-2.5-2B 固定 τ_f hook ↓ h_t^τf (2048-dim) Action DiT DiT-B style AdaLN + cross-attn τ_a (Beta 采样) 动作轨迹 â_t 状态 s + 噪声动作 + future tokens ↑ hook
DiT4DiT 信息流:Video DiT 提取 hidden state 通过 hook 传给 Action DiT 做 cross-attention
理解检查
DiT4DiT 如何将视频信息传递给动作生成?
§ 04

联合训练:Tri-Timestep 与 Dual Flow-Matching

核心挑战

联合训练 Video DiT 和 Action DiT 面临一个矛盾:视频生成需要均匀采样 timestep(覆盖整个 denoising 轨迹), 而特征提取需要固定 timestep(稳定信号),动作生成又有自己的最优采样分布(聚焦关键阶段)。 DiT4DiT 的解法:三个独立的 timestep,各自服务各自的目的。

4.1 三时间步设计(Tri-Timestep)

$\tau_v$(视频 DiT 训练) 从 $\mathcal{U}[0,1]$ 均匀采样,让模型接触所有噪声等级,学习完整 denoising 轨迹
$\tau_f$(特征提取) 在 $\{0, 1/T, 2/T, \ldots, T/T\}$ 中均匀采样,但在使用时取确定性固定值,保证 Action DiT 接收稳定特征
$\tau_a$(动作 DiT 训练) Beta 分布 采样($\tau_a = 1 - \sigma$,$\sigma \sim \text{Beta}(\alpha, \beta)$),集中在动作变化最大的关键阶段
Beta 采样的意义

Beta 分布的 $\tau_a$ 让动作 DiT 把训练资源集中在 flow trajectory 的关键阶段——类比"重点复习考点"。 Beta$(1.5, 1.0, 0.999)$ 使采样密度偏向 $\tau_a$ 接近 1 的区域(接近纯噪声), 这是动作预测需要学习的最难阶段。

4.2 Dual Flow-Matching 目标函数

$$\mathcal{L}_t^{\text{total}} = \underbrace{\mathbb{E}_{\tau_a, \epsilon} \left[ \left\| v_\phi^{\text{action}}(\mathbf{a}_t^{\tau_a}, \tau_a \mid \mathbf{h}_t^{\tau_f}, s) - (\epsilon - \mathbf{a}_t^0) \right\|^2 \right]}_{\text{Action Flow Matching Loss}} + \lambda \underbrace{\mathbb{E}_{\tau_v, z} \left[ \left\| v_\theta^{\text{video}}(\mathbf{z}_{t+1}^{\tau_v}, \tau_v \mid \mathbf{z}_t^0, l) - (z - \mathbf{z}_{t+1}^0) \right\|^2 \right]}_{\text{Video Flow Matching Loss}}$$ Eq. 10 · 联合 flow-matching 损失 · p.7
各项含义
Action Flow Matching Loss
训练动作 DiT 预测从噪声到干净动作的速度场。条件是 Video DiT 提取的 $\mathbf{h}_t^{\tau_f}$ 和本体状态 $s$。
Video Flow Matching Loss
同时训练 Video DiT 预测未来帧。$\lambda$ 是权重系数,平衡两个损失。
为什么要保留 Video Loss?
如果只优化动作 loss,Video DiT 的特征会退化为仅对动作有用的表示,失去通用的视觉动力学先验。 同时保留视频 loss 作为表示正则化器,确保 $\mathbf{h}_t^{\tau_f}$ 始终携带丰富的时空信息。

4.3 训练流程(Algorithm 1 简化版)

一个训练 step 里发生了什么
1 / 5

Step 1:Video DiT Forward(视频噪声预测)

VAE 编码当前帧和未来帧为 latent。采样 $\tau_v \sim \mathcal{U}[0,1]$ 和噪声 $z \sim \mathcal{N}(0,I)$,构造噪声 latent $\mathbf{z}_{t+1}^{\tau_v}$。Video DiT 预测速度 $\hat{v}_{\text{video}}$,计算 Video Loss。

Step 2:提取 Hidden State(hook 机制)

采样特征提取 timestep $\tau_f \sim \mathcal{U}\{0, 1/T, \ldots, 1\}$,用独立噪声构造 $\hat{z}_{t+1}$,通过 hook 算子 $\mathcal{H}$ 提取 Video DiT 在 $\tau_f$ 处的 hidden state $\mathbf{h}_t^{\tau_f}$。

Step 3:Action DiT Forward(动作噪声预测)

采样 $\sigma \sim \text{Beta}(\alpha, \beta)$,令 $\tau_a = 1 - \sigma$,构造噪声动作 $\mathbf{a}_t^{\tau_a}$。Action DiT 以 $\mathbf{h}_t^{\tau_f}$ 和本体状态 $s$ 为条件预测速度 $\hat{v}_{\text{action}}$,计算 Action Loss(加 action mask $M$)。

Step 4:联合 Loss 反向传播

$\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{action}} + \lambda \cdot \mathcal{L}_{\text{video}}$。两个 loss 同时反向传播,联合更新 Video DiT 参数 $\theta$ 和 Action DiT 参数 $\phi$(VAE 和文本编码器保持冻结)。

Step 5:推理时(Inference)

Action DiT 只需单次固定 forward pass提取 $\mathbf{h}_t^{\tau_f}$(不迭代 Video DiT),再对 Action DiT 做 $N_a$ 步 ODE 积分得到动作轨迹。可选同时做 Video DiT 的 $N_v$ 步 denoising 生成未来帧预测。

§ 05

实验结果:LIBERO & RoboCasa & Unitree G1

实验设计

三个实验平台:(1) LIBERO 仿真(Franka Panda,4 套件各 10 任务,500 轨迹/任务); (2) RoboCasa-GR1 仿真(Fourier GR1 人形,24 个 tabletop 任务,1000 轨迹/任务); (3) 真实 Unitree G1(7 任务 × 200 episodes)。

5.1 LIBERO Benchmark(Franka Panda 仿真)

DiT4DiT (ours)
98.6%
Qwen3DiT (ablation)
98.0%
CogVLA
97.4%
OpenVLA-OFT
97.1%
π₀
94.2%
GR00T-N1.5
94.1%
Diffusion Policy
72.4%
LIBERO 关键结论

DiT4DiT 以 98.6% 刷新 LIBERO 所有方向最高成绩,尤其 LIBERO-Long(长时程任务)达 97.6%(+5.6% vs 次优), 说明视频动力学先验对需要多步规划的任务提升最显著。 注意 DiT4DiT 和 Qwen3DiT 都是从头训练(from scratch),没用大规模 robot 数据预训练。

5.2 RoboCasa-GR1 与真实 G1

5.3 样本效率 — 最关键的 Scaling 结果

核心 Scaling 结论

如图 1(论文)所示,在 10%–100% 训练数据范围内,DiT4DiT(视频生成 proxy)的成功率曲线始终高于 Grounding 和 FLARE-style。 在只用 20% 数据时,DiT4DiT 与 FLARE-style 差距最大(约 +15%),说明视频先验在数据稀缺时最有价值。

具体数字:DiT4DiT 的样本效率比 FLARE-style 高 >10×,收敛速度快 up to 7×

§ 06

与 MotionWAM 的关系:先驱 vs 扩展

一图胜千言

DiT4DiT 和 MotionWAM 都来自 Mondo Robotics + HKUST 团队,作者高度重叠。 MotionWAM 引用 DiT4DiT 为 [21],明确继承其 dual-DiT 框架; MotionWAM 的 Motion DiT 明确指定跟随 "DiT-B configuration introduced in DiT4DiT"。 但两者的目标场景和技术细节有重要区别。

类比理解

DiT4DiT ≈ "发明了双 DiT 耦合方法并在桌面机器人上验证"; MotionWAM ≈ "把这个框架搬到人形机器人上,并解决实时性、全身控制、数据规模三个新挑战"。 DiT4DiT 证明了 video proxy 的有效性和 dual-DiT 架构的可行性, MotionWAM 把它推广到了更难、更实用的场景。

对 VLA 路线的启示

DiT4DiT 和 MotionWAM 共同指向一个结论: 视频动力学先验是 VLA 目前最缺失的能力。纯 VLM backbone 的 VLA 在需要物理接触、 长时程规划的任务上有系统性短板;而把 video generation 嵌入训练目标, 即使只用 15% 的数据量,也能超越官方大规模预训练的 GR00T 系列。 未来研究方向:VLM + Video DiT 统一预训练,同时获得语义和物理两种先验。

理解检查
MotionWAM 与 DiT4DiT 的关系最准确的描述是?