arXiv:2602.06949 · NVIDIA + 高校联合 · 2026-02-09

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye … Linxi "Jim" Fan · NVIDIA · HKUST · UC Berkeley · UW · Stanford · KAIST
基础世界模型 潜在动作 · 跨具身 Cosmos-Predict2.5 · Flow Matching 44k 小时人类视频 10.81 FPS 实时
🌐 项目主页    📄 原版 PDF
§ 01

论文定位:机器人世界模型的"基础模型化"尝试

一句话概括

DreamDojo 是第一个在 44k 小时人类视频上预训练、用潜在动作作为统一代理标签、支持实时自回归预测的机器人世界模型——它能在看到新机器人少量演示后,立即泛化到从未见过的物体和环境,无需重新从头训练。

核心问题机器人世界模型被限制在分布内场景:机器人数据太稀缺,覆盖不了真实世界的多样性
核心洞见人类在日常活动中与世界的物理交互和机器人的底层物理是共通的——用人类视频预训练可以学到物理知识,再迁移到机器人
数据来源In-lab (55h) + EgoDex (829h) + DreamDojo-HV (43,827h) = 44,711 小时
架构基础Cosmos-Predict2.5(NVIDIA 的视频 Diffusion 模型),WAN2.2 Tokenizer,DiT 骨干
模型规模DreamDojo-2B 和 DreamDojo-14B 两个版本,256 张 H100 预训练 140k 步
实时速度蒸馏后 10.81 FPS(640×480),推理步数从 35 → 4
关键应用实时遥操作 · 策略评估 · 模型规划 · 零样本未见场景泛化
四大贡献

① DreamDojo-HV 数据集:44k 小时自我中心人类视频,比之前最大世界模型训练数据多 15 倍时长、96 倍技能种类、2,000 倍场景数量。

② 潜在动作(Continuous Latent Actions):用 VAE 从视频帧中自监督提取动作代理标签,不需要任何外部捕捉设备,跨具身迁移。

③ 蒸馏 Pipeline(Self Forcing):把双向 Diffusion 教师模型蒸馏成因果自回归学生模型,4 步去噪实现 10.81 FPS 实时推理,同时提升长时一致性。

④ 多样下游应用:策略评估与真实世界相关性 Pearson r=0.995,模型规划提升成功率约 2×。

Figure 1: DreamDojo overview
Fig 1 · p.3 DreamDojo overview: Human video pretraining → Robot post-training → Autoregressive distillation → Applications 整体流程:人类视频预训练(三路数据)→ 机器人后训练(少量遥操作数据适配具身)→ 蒸馏(实时推理)→ 多样下游应用
点击图上标注点查看详情
DreamDojo 的三阶段训练流程:预训练 → 后训练 → 蒸馏,每阶段解决不同问题。
🪜 DreamDojo 三阶段训练流程
1 / 3

阶段 ①:人类视频预训练(Pretraining from Human Videos)

在 44,711 小时自我中心人类视频上预训练。三路数据:In-lab + EgoDex + DreamDojo-HV,采样比 1:2:10。

关键设计:用潜在动作(latent actions)作为条件,而不是无动作预测(action-free)。潜在动作由 VAE 自监督提取,不需要动作标签,却保留了因果性,让模型学会"动作→未来状态"的因果关系。

Cosmos-Predict2.5 骨干,序列长度 13 帧,分辨率 640×480,140k 步训练。

阶段 ②:目标机器人后训练(Post-Training on Target Robots)

在目标机器人数据(GR-1/G1/AgiBot 等遥操作演示)上微调。重新初始化 Action MLP 第一层以适配新动作空间,其他权重沿用预训练模型。

关键设计:动作以相对动作(relative action)形式输入——每次以当前 latent frame 起始帧的姿态为基准归一化,减小不同轨迹之间的分布差异,增强泛化。

128 张 H100,50k 步,batch size 512。后训练后即可零样本泛化到未见物体和场景。

阶段 ③:蒸馏(Distillation)

将教师模型(双向注意力,35 步去噪)蒸馏为学生模型(因果注意力,4 步去噪)。用 Self Forcing 两阶段范式:先 warmup(对齐教师 ODE 轨迹),再蒸馏(KL 分布匹配)。

学生模型自回归生成:上下文窗口 12 帧(≫ 教师的 1 帧),天然抵抗遮挡和视角变化。推理速度 10.81 FPS,支持实时遥操作和在线规划。

64 张 H100,warmup 10k 步 + 蒸馏 3k 步。

理解检查
DreamDojo 选择用人类视频(而非更多机器人数据)预训练,最根本的理由是什么?
§ 02

背景:Video World Model 卡在了哪里?

承上启下

§01 说 DreamDojo 要做"通用机器人世界模型"——但为什么之前的世界模型不够通用?这一节讲清楚两个核心瓶颈:数据分布太窄动作标签太稀缺

什么是世界模型?

世界模型(world model)的目标:给定当前状态 $s_t$ 和动作 $a_t$,预测下一个状态 $s_{t+1}$。形式化为状态转移采样:

$$s_{t+1} \sim p(\cdot | s_t, a_t)$$ Eq. 1 · §2, p.3 — 交互式世界模型定义
直觉解释
$s_t$
当前状态——这里是视频帧(或视频 latent)。不是关节角度,而是像素级观测。
$a_t$
动作——机器人关节速度/力矩命令,或者潜在动作向量(无标注场景)。
$s_{t+1}$
预测的下一帧。好的世界模型能预测出物理上合理的、动作一致的未来视频。
为什么是"采样"而不是"预测"?
世界的未来本身具有随机性(物体落点、环境扰动),用概率分布建模比确定性预测更合理。

现有世界模型的两大卡点

BOTTLENECK 01 · 数据分布
机器人数据覆盖面太窄
现有数据集(RT-1: 900h, BridgeData V2: 130h)每次遥操作都很昂贵,只能覆盖少数场景和技能。真实世界的物体组合几乎无限,远超任何机器人数据集的覆盖范围。 结果:世界模型在训练分布内表现好,遇到新物体/新场景就失效(in-distribution only)。
BOTTLENECK 02 · 动作标签
无标注视频的因果性缺失
互联网上的人类视频没有动作标签。最直接的做法是做无动作条件的"被动预测"(action-free),但这样模型学不到"动作→结果"的因果关系。 结果:适配到目标机器人时,模型无法准确响应反事实动作(counterfactual actions)——例如"如果我往左而不是往右抓会发生什么?"
关键对比:HaMeR 等显式手部姿态提取的局限

HaMeR(Pavlakos et al., 2024)等工具能从视频提取手部姿态,但:① 只能表示手,无法表示手臂/身体/相机运动;② 重度遮挡时精度下降;③ 聚焦低层次手部特征,和机器人末端执行器之间仍有具身差异(embodiment gap)。DreamDojo 提出不依赖任何外部捕捉设备的潜在动作方案。

展开原文 · 关于 action-free 预训练的局限

"Naively training on passive videos overlooks the causality between video observations and actions, leading to inferior knowledge transfer for action-conditioned world simulation. Moreover, converting various action formats into a unified one entails inevitable engineering effort."

— §1 Introduction, p.2
§ 04

DreamDojo-HV 数据集:史上最大人类交互视频

承上启下

§03 说清了"为什么需要大规模人类视频"。这一节具体看:DreamDojo-HV 怎么搭建,三路数据各自贡献什么,规模和多样性达到什么水平。

Figure 2: DreamDojo-HV dataset distribution
Fig 2 · p.4 Distribution analysis of DreamDojo-HV: (a) environment categories, (b) subtask distribution and skill frequencies, (c) skill verbs and object names word cloud DreamDojo-HV 数据分析:12 类场景(家务占比42%)+ 多子任务结构 + 6,015 种技能词云。特别注意:物体种类(43,237)和场景数(1,135k)远超任何机器人数据集。
点击图上标注点
DreamDojo-HV 的三维度多样性:场景类别 × 技能种类 × 物体种类。

三路数据来源对比

DATA SOURCE 01 · IN-LAB
55h · 实验室精准采集
Manus 手套 + Vive Ultimate Tracker 精确记录手部姿态,可直接重定向到 GR-1 机器人动作。包含实验室内新物体和新动作(不在机器人训练集中),用于验证模型核心能力。虽然规模小,但每一帧都有精确动作标注,是校准 latent action 的"黄金标准"。
DATA SOURCE 02 · EGODEX
829h · Apple Vision Pro 采集
公开数据集(Hoque et al. 2025),Apple Vision Pro 录制的自我中心视频 + 高精度 3D 手部姿态(194 种技能,5 个家庭场景)。DreamDojo 用它丰富家庭场景的物体多样性。注意:EgoDex 的手部姿态(MANO 格式)在消融实验中与 latent action 方案对比——latent action 更优(因为不依赖手部捕捉硬件,适用范围更广)。
DATA SOURCE 03 · DREAMDOJO-HV
43,827h · 众包大规模
内部采集,众包方式覆盖家务/零售/教育/行政等 12 大类。每个视频片段都有描述任务的文本标注(GPT 生成)。这是整个 DreamDojo 项目最大的技术投入,也是性能提升的核心来源——消融实验证明加入 DreamDojo-HV 后各项指标持续上升(Table 3)。
SCALE COMPARISON
与先前最大数据集对比
44,711h 总量:比 Nymeria (300h) 多 149×,比 AgiBot-World (2.9k h) 多 15×。6,015 种技能(vs 对比最优的 87 种,多 69×)。1,135k 场景(vs 比较基准的 564 种,多 2,012×)。这不是量变而是质变——覆盖了真实世界物理交互分布的主体。
采样比设计

预训练时三路数据的采样比为 In-lab : EgoDex : DreamDojo-HV = 1 : 2 : 10。这个比例设计不是按时长等比,而是适度上调精准但小规模的 In-lab 和 EgoDex,防止被 DreamDojo-HV 的巨大体量完全淹没。类比 NLP 预训练中对高质量数据的过采样策略。

§ 05

潜在动作模型:无标注视频的"自监督动作提取"

承上启下

§04 建好了数据基础,但有个问题:44k 小时视频没有动作标注。如果只做无动作的被动预测,模型学不到因果性(§02 讲过)。这一节介绍解决方案:用 VAE 信息瓶颈从视频帧对中自监督提取"潜在动作"。

核心思路类比一道谜题:给你相邻两帧图像 $f^t$ 和 $f^{t+1}$,请找出使两者之间发生变化的"最简解释"。这个最简解释就是潜在动作 $\hat{a}_t$。 信息瓶颈(Information Bottleneck)强制 $\hat{a}_t$ 只保留真正重要的变化信息,丢弃背景噪声。

Figure 3: Latent action model
Fig 3 · p.6 Latent action model: [Left] information bottleneck VAE design; [Right] cross-embodiment frame pairs sharing similar latent actions 左:VAE 信息瓶颈架构(Encoder 提取 ā_t,Decoder 重建下一帧);右:跨具身验证——不同机器人做同一动作时 latent action 相似
点击图上标注点
潜在动作 VAE:信息瓶颈迫使编码器只保留"动作"信息。

VAE 训练目标(Eq. 3)

整个 VAE 用重建损失 + KL 散度联合训练,优化以下目标:

$$\mathcal{L}_{\theta,\phi}^{pred}(f^{t+1}) = \mathbb{E}_{q_\phi(\hat{a} | f^{t:t+1})} \log p_\theta(f^{t+1} | \hat{a}, f^t) - \beta \, D_{KL}\!\left(q_\phi(\hat{a} | f^{t:t+1}) \| p(\hat{a})\right)$$ Eq. 3 · §3.3.2, p.7 — 潜在动作 VAE 损失
逐项拆解
$q_\phi(\hat{a} | f^{t:t+1})$
编码器分布:给定帧对 $(f^t, f^{t+1})$,输出潜在动作分布(均值+方差)。参数为 $\phi$。
$\mathbb{E}_{q_\phi} \log p_\theta(f^{t+1} | \hat{a}, f^t)$
重建损失:解码器用 $(f^t, \hat{a})$ 重建 $f^{t+1}$ 的对数似然。训练信号来源:能不能从"上一帧+动作"精确重建下一帧。
$\beta \, D_{KL}(q_\phi \| p(\hat{a}))$
正则项:让潜在动作分布接近标准高斯先验 $p(\hat{a})=\mathcal{N}(0,I)$。$\beta=10^{-6}$ 非常小,说明信息瓶颈约束很弱——目的是让 $\hat{a}$ 尽量保留丰富的动作信息,只去掉冗余噪声。
为什么用 VAE 而不是 AE?
VAE 输出连续分布(可采样),便于后续在世界模型中作为条件注入;且 KL 散度提供了轻量正则,防止潜在空间不连续。
展开原文 · 关于潜在动作的跨具身优势

"In egocentric human videos, we found that this embedding particularly captures the human actions and can be transferred across embodiments (see Fig. 3). Ultimately, we are able to utilize latent actions as unified proxy labels for world models."

— §3.3.2, p.7
与 VLA 的联系

VLA(如 π₀)在推理时直接输出机器人关节动作;DreamDojo 的潜在动作则是学习阶段的代理标签,不是真实关节命令。但两者都面对"跨具身"的挑战:π₀ 用 Action Expert 适配,DreamDojo 用 latent action 统一——思路相似,各有侧重。

理解检查
潜在动作 VAE 中"信息瓶颈"(information bottleneck)的作用是什么?
§ 06

Foundation World Model:架构设计与训练目标

承上启下

§05 解决了"怎么给无标注视频提供动作条件"。这一节看 DreamDojo 的主体模型怎么设计——基于 Cosmos-Predict2.5 骨干,两个关键架构改进:相对动作变换分块动作注入,以及新的时序一致性损失。

骨干:Cosmos-Predict2.5

DreamDojo 以 Cosmos-Predict2.5 为骨干——NVIDIA 的视频 Latent Diffusion 模型,在 WAN2.2 Tokenizer 的连续 latent 空间中操作。架构是 DiT,文本条件通过交叉注意力层注入,时间步信息通过 AdaLN 调制。训练目标是 Flow Matching:

$$\mathcal{L}_{\text{flow}}(\theta) = \mathbb{E}_{\mathbf{x},\boldsymbol{\epsilon},t} \left\| \mathbf{u}(\mathbf{x}_t, t, \mathbf{c};\theta) - \mathbf{v}_t \right\|^2$$ Eq. 2 · §2, p.3 — Flow Matching 损失(骨干基础)
逐项拆解
$\mathbf{u}(\mathbf{x}_t, t, \mathbf{c};\theta)$
模型预测的速度场(velocity field):在时间 $t$、噪声状态 $\mathbf{x}_t$、条件 $\mathbf{c}$ 下,模型预测"应该往哪个方向走"。
$\mathbf{v}_t = \boldsymbol{\epsilon} - \mathbf{x}$
真实速度:从噪声 $\boldsymbol{\epsilon}$ 走向干净样本 $\mathbf{x}$ 的方向(线性路径)。
$\mathbf{c}$
条件信息:文本描述、条件帧(初始帧)、动作(这是 DreamDojo 添加的部分)。
Flow Matching vs Diffusion DDPM
Flow Matching 用直线 ODE 路径(噪声→数据),比 DDPM 的曲线路径采样步数更少,推理更快。

两个关键架构改进

DESIGN 01 · 相对动作(Relative Actions)
以当前帧为基准归一化动作
问题:机器人关节绝对角度(absolute joint poses)在不同任务间变化大,难以建模。

解决:在每个 latent frame(对应 4 个像素帧)的起始时刻,把后续动作全部减去当前姿态,变成相对偏移量。相对动作在不同轨迹之间分布更集中,建模复杂度大幅降低,泛化能力更强(Table 5 证实)。
DESIGN 02 · 分块注入(Chunked Action Injection)
逐 latent frame 注入对应动作块
问题:Cosmos-Predict2.5 的 WAN2.2 tokenizer 时间压缩比为 4(1 个 latent 帧对应 4 个像素帧)。如果把整个动作轨迹作为全局条件,模型会把"未来动作"混入当前预测,破坏因果性。

解决:把 4 个连续动作 $a^{t:t+4}$ 打包成一个 chunk,仅注入到对应的那个 latent 帧 $x^i$ 中,通过 Action MLP 与时间步嵌入相加后输入 AdaLN。严格保持因果性,消除 causality confusion(Table 5 证实)。

时序一致性损失(Temporal Consistency Loss)

标准 Flow Matching 逐帧独立监督,忽略了视频帧之间的时序关联——但动作效果是在时间维度上累积的。DreamDojo 提出时序一致性损失:

$$\mathcal{L}_{\text{temporal}}(\theta) = \mathbb{E}\!\left[\sum_{i=1}^{K-1} \left\| (z^{i+1} - z^i) - (v^{i+1} - v^i) \right\|^2 \right]$$ Eq. 4 · §3.3.2, p.7 — 时序一致性损失
逐项拆解
$z^i, z^{i+1}$
预测的视频 latent 速度场中,第 $i$ 帧和第 $i+1$ 帧的预测速度(模型输出)。
$v^i, v^{i+1}$
对应的真实速度(ground-truth Flow Matching 速度)。
$(z^{i+1} - z^i) - (v^{i+1} - v^i)$
预测的帧间速度变化 vs 真实帧间速度变化的差。换句话说:不只要求每帧预测准确,还要求相邻帧之间的变化量(即"加速度")也要准确
为什么这样改进有效?
逐帧 MSE 让模型可以"每帧各自为政",忽略时序连贯性。时序一致性损失强迫模型同时考虑"当前正在发生什么"和"变化趋势",特别有利于学习动作-结果的因果关系(实验显示 LPIPS 改善,对象完整性提升)。
$$\mathcal{L}_{\text{final}}(\theta) = \mathcal{L}_{\text{flow}} + \lambda \cdot \mathcal{L}_{\text{temporal}}, \quad \lambda = 0.1$$ Eq. 5 · §3.3.2, p.7 — 最终训练目标
Action MLP 初始化技巧

Action MLP 的最后一层初始化为全零(Zhang et al. 2023)。这样在训练初期,动作条件对预训练模型的输出没有任何扰动,使模型能稳定从预训练状态出发,逐渐学会响应动作信号——避免了随机初始化导致的训练初期不稳定。

理解检查
DreamDojo 为什么要用"分块动作注入"(chunked action injection)而不是把整个动作轨迹作为全局条件?
§ 07

蒸馏 Pipeline:从教师到自回归学生,10.81 FPS

承上启下

§06 的基础模型推理需要 35 步去噪,单帧几秒——无法实时遥操作或在线规划。这一节介绍如何用 Self Forcing 范式把双向教师蒸馏成因果自回归学生,在保持质量的前提下速度提升 4×。

标准视频 Diffusion 的两大实时瓶颈: ① 双向注意力(必须看完整序列才能生成任意帧,无法流式输出); ② 多步去噪(35 步 = 每帧 35 次前向传播)。 蒸馏同时解决这两个问题。

Self Forcing 两阶段蒸馏

STAGE A · Warmup 阶段
对齐教师 ODE 轨迹
学生模型用教师 forcing:学生的上下文来自教师生成的 latent(不是自己的输出)。目标是让学生输出与教师 ODE 轨迹(35步积分终点)对齐:
STAGE B · 蒸馏阶段
KL 分布匹配(自回归)
学生模型用自身上下文(自己之前生成的帧)生成,模拟真实推理时的条件分布。用 KL 散度拉近学生分布和教师分布:消除 train-test 分布不匹配(compounding error)。
$$\mathcal{L}_{\text{warmup}}(G_{\text{teacher}}, G_{\text{student}}) = \mathbb{E}_{x,t}\left\| G_{\text{student}}(x_t, t) - x_0 \right\|^2$$ Eq. 6 · §3.3.4, p.8 — Warmup 损失(学生对齐教师 ODE 终点 x₀)
$$\mathcal{L}_{\text{distill}} = D_{\text{KL}}(p_{\text{teacher}} \| p_{\text{student}})$$ Eq. 7 · §3.3.4, p.8 — 蒸馏损失(KL 分布匹配)
逐项拆解
$G_{\text{teacher}}$ vs $G_{\text{student}}$
教师:双向注意力 + 35 步去噪;学生:因果注意力(单向,可流式输出)+ 4 步去噪。两者架构和初始权重相同,仅注意力机制和步数不同。
$x_0$(Warmup 中)
教师 ODE 积分终点(即教师 35 步去噪的输出)。Warmup 阶段让学生"模仿教师的答案",快速建立基础能力。
$\nabla \mathcal{L}_{\text{distill}}$(蒸馏阶段梯度)
KL 散度不可直接计算,用 score matching 近似梯度:$\nabla \mathcal{L}_{\text{distill}} = -\mathbb{E}_{z,t}\left[(s_{\text{real}}(x_t,t) - s_{\text{fake}}(x_t,t))\frac{dG_{\text{student}}}{d\theta}\right]$,其中 $s_{\text{real}}$ 由教师估计,$s_{\text{fake}}$ 由一个针对学生输出训练的判别器估计。
长序列训练技巧
训练时让学生生成 $N' > N$ 帧($N'$ 在 13-49 之间随机),但只对最后 $N$ 帧计算损失。这让学生的训练分布更接近真实长序列推理时遇到的情况,进一步降低 compounding error。
对比维度教师(Teacher)学生(Student)
注意力机制双向(bidirectional)因果(causal,单向)
去噪步数35 步4 步
推理速度2.72 FPS10.81 FPS(4× 提升)
上下文长度1 帧(初始帧)12 帧(滑动窗口)
流式输出不支持支持(逐帧自回归)
长程一致性较弱(单帧上下文)更强(12帧上下文)
一个反直觉的发现

蒸馏后学生模型的长程一致性反而更好(Table 6 显示 context len=12 vs 1)。原因:学生自回归生成时上下文窗口有 12 帧,可以看到自己之前生成的帧,形成内部记忆;教师每次都从单一条件帧出发,无法利用历史上下文。这是架构上的意外收益。

§ 08

实验结果:六项 Benchmark + 系统性消融

承上启下

§07 讲完了三阶段训练方案。这一节验证三个核心主张:① 潜在动作真的比无动作预训练好?② 更多更多样的数据真的持续有帮助?③ 每个架构设计真的各有贡献?

Figure 4: Benchmark visualization
Fig 4 · p.9 Six evaluation benchmarks: In-lab Eval, EgoDex Eval, DreamDojo-HV Eval, Counterfactual Eval, EgoDex-novel Eval, DreamDojo-HV-novel Eval 六项 Benchmark:前三项测不同数据分布的 OOD 泛化,第四项测反事实动作理解,后两项测背景替换后的泛化(人工偏好评估)
点击图上标注点
6 个 Benchmark 全部强调 OOD 泛化,这是 DreamDojo 的核心主张。

关键消融实验结论

消融① 动作条件方式(Table 2)

结论:潜在动作优于无动作预训练,接近使用真实动作标注的上界。

• w/o pretrain:PSNR 20.576(In-lab),基线最差
• action-free pretrain:20.797,边际提升——被动预测学到了部分物理知识,但动作可控性差
• latent action(DreamDojo):20.913,最优——与"理想上界"retargeted action(20.960)几乎持平,但不需要任何外部捕捉设备

消融② 数据量(Table 3)

结论:数据多样性持续提升各项指标,无边际递减迹象。

In-lab only → + EgoDex → + DreamDojo-HV,每加一路数据,PSNR/SSIM/LPIPS 在所有 4 个 Eval 集上均提升。DreamDojo-14B 达最优(PSNR 21.087 In-lab,LPIPS 0.185 Counterfactual eval),比 Cosmos-Predict2.5 基线提升显著。

消融③ 架构设计(Table 5)

结论:三个设计各自独立有效,叠加效果最佳。

• 仅相对动作:GR-1 Val PSNR 16.522(+0.323),Counterfactual PSNR 19.482(+0.034)
• + 分块注入:GR-1 Val 17.626(+1.104),Counterfactual 20.783(+1.301)——分块注入对反事实动作效果极其显著
• + 时序一致性损失:GR-1 Val 17.630,Counterfactual 20.980(LPIPS 0.189,最优)

人工偏好评估(Table 4)

DreamDojo-14B 在所有人工评估维度上均超越 Cosmos-Predict2.5 基线 70% 以上。

• DreamDojo-2B vs Cosmos-Predict2.5:物理合理性胜率 62.50%,动作追踪 63.45%
• DreamDojo-14B vs Cosmos-Predict2.5:物理合理性胜率 73.50%,动作追踪 72.55%
• DreamDojo-14B vs DreamDojo-2B:物理合理性 72.50%,动作追踪 65.53%——14B 明显优于 2B

§ 09

下游应用:策略评估、模型规划、实时遥操作

承上启下

§08 验证了模型各项能力。这一节看 DreamDojo 能做什么实际的事:它的核心价值不只是"看起来像机器人真实动作",而是能成为一个可靠的仿真器——替代真实机器人做策略筛选和规划。

Figure 5: Downstream applications
Fig 5 · p.14 (a) Real vs. DreamDojo success rates with Pearson r=0.995; (b) Model-based planning success rate improvement 左:DreamDojo 与真实机器人成功率高度相关(r=0.995),可作为可靠仿真器;右:模型规划在 DreamDojo 辅助下将成功率提升约 2×
点击图上标注点
策略评估和模型规划都依赖世界模型能准确预测动作后果。
Figure 6: Live teleoperation
Fig 6 · p.14 Live teleoperation using PICO VR controller to drive virtual G1 robot in real time at 10.81 FPS 实时遥操作:用 PICO VR 控制器输入动作,DreamDojo 以 10.81 FPS 实时生成虚拟机器人视频——不需要真实机器人,可用于安全的操作训练
点击图上标注点
实时遥操作是蒸馏 Pipeline 的直接应用——4 步去噪 + 因果自回归实现 10.81 FPS。
与 VLA / Embodied AI 的联系

策略评估(Policy Evaluation):VLA 的训练需要大量真实 rollout 来评估策略质量,成本高且有安全风险。DreamDojo 提供了一个可靠的"虚拟测试场"——Pearson r=0.995 的相关性意味着几乎可以用 DreamDojo 替代真实机器人做策略筛选。

模型规划(Model-Based Planning):传统 VLA 在推理时用单一策略模型做闭环;加入 DreamDojo 后,可以在推理时对多个候选动作序列做前瞻模拟,选择预期最优的执行——类似棋类 AI 的 tree search,但在连续机器人动作空间上实现。

遥操作数据采集:现有高质量机器人数据的采集都需要专业操作员+真实机器人+专用场地。用 DreamDojo 做虚拟遥操作可以大幅降低数据采集成本,同时用 VR 设备取代昂贵的遥操作装置。

理解检查
DreamDojo 在策略评估(policy evaluation)中的价值是什么?为什么 Pearson r=0.995 很重要?
§ 10

局限与展望

这篇论文还没解决什么

§01–§09 描述了 DreamDojo 能做什么。这一节诚实列出边界:哪些任务还不行,哪些假设还未被充分检验,未来工作应该往哪里走。

LIMIT 01 · 稀少动作
快速/异常动作仍不准确
"拍击"(slapping)、"快速挥手"(fast waving)等在训练数据中罕见的快速动作,DreamDojo 模拟效果较差。根本原因:这类动作在 44k 小时视频中出现频率极低,模型分布没有覆盖。可能的方向:结合策略 rollout 数据(Ho et al. 2025, Zhu et al. 2025)扩展动作分布。
LIMIT 02 · 策略评估偏乐观
绝对成功率偏高于真实值
策略评估实验中,DreamDojo 内的绝对成功率普遍高于真实机器人(虽然排名相关性高)。原因可能是 DreamDojo 生成的"失败"视频视觉上仍然连贯,难以区分真正失败。未来需要更精细的失败感知评估机制(Ball et al. 2025, Ye et al. 2026)。
LIMIT 03 · 单视角
不支持多视角同步仿真
当前 DreamDojo 是单视角视频世界模型,无法同时生成多个相机视角。但最先进的 VLA(如 π₀)使用多相机输入,这限制了 DreamDojo 作为其评估环境的适用范围。多视角世界模型仍是开放问题(Bjorck et al. 2025, Black et al. 2024)。
LIMIT 04 · 知识遗忘
后训练时如何保留预训练知识
在目标机器人上微调时,如何保留人类视频预训练获得的 OOD 泛化能力尚未深入研究。全参数微调可能导致"遗忘"预训练物理知识。未来可探索 LoRA、Parameter Efficient Fine-Tuning 等方案(Hu et al. 2022, Yadav et al. 2025)。
推理速度优化空间

10.81 FPS 已达实时,但仍有工程优化空间(Ball et al. 2025, Hong et al. 2025, Team et al. 2026, Ye et al. 2026)。目前蒸馏用了 64 张 H100 跑 13k 步,如果进一步压缩去噪步数(从 4 步到 1-2 步)或使用更高效的量化推理,FPS 还有提升空间。

展开原文 · Limitations 原文

"While DreamDojo demonstrates significant improvements over the baseline, it is by no means perfect when simulating uncommon actions, such as slapping and fast waving. Additionally, when conducting policy evaluation, the absolute success rates in DreamDojo are often higher than their real counterparts, indicating a limitation in accurately generating nuanced failures."

— §5 Conclusion, p.15
对 Embodied AI 学习路径的启示

DreamDojo 代表了 2026 年 embodied AI 的一个重要趋势:把视频生成能力引入机器人学习 pipeline——不只是用来生成演示,而是作为可信的物理仿真器(world model)参与策略训练、评估和规划的完整闭环。这与 Dreamer/R2-D2 在游戏 RL 中的地位类似,但挑战更大(连续高维动作 + 开放世界物体)。

对于在学的同学:理解 DreamDojo 的三阶段训练(预训练→后训练→蒸馏)是未来多数 robot world model 工作的共同范式,值得深入掌握。