NVIDIA · arXiv:2511.00062 · 2026-02-24
World Simulation with Video Foundation Models for Physical AI
Cosmos-Predict2.5 · 面向 Physical AI 的视频基础世界模型
NVIDIA Research
世界模型 视频生成 Flow Matching DiT Physical AI RL Post-training 2B / 14B 开源
§ 01

论文定位:为什么机器人训练需要视频世界模型

这一节解决什么

在真实世界里训练机器人又贵又危险——机器出错可能损坏设备或伤人,而且要覆盖所有场景几乎不可能。解决思路:用一个高质量的"视频世界模拟器"来替代真实环境,让机器人的感知、规划和策略评估全部在"数字世界"里进行,调好了再部署到真实硬件。Cosmos-Predict2.5 就是 NVIDIA 提供的这把"数字世界生成引擎"——可以根据文字、图片或视频片段,生成物理上真实可信的未来视频。

Cosmos-Predict2.5 是对前一代 Cosmos-Predict1 的全面升级,核心改进体现在三个维度:

IMPROVEMENT 01 · 训练目标
EDM → Flow Matching
把扩散模型的噪声预测目标换成速度场预测(Flow Matching),训练信号更直接,推理步数更少,生成质量更稳定。
IMPROVEMENT 02 · 文字理解
T5 → Cosmos-Reason1
把通用的 T5 文字编码器替换为专为 Physical AI 设计的 VLM(Cosmos-Reason1),提供更丰富的语义表示,文字控制更精准。
IMPROVEMENT 03 · 后训练
SFT + RL + 模型合并
引入强化学习(VideoAlign 奖励模型)+ TIES/DARE 模型合并,把各领域专项模型融合为一个全能统一模型。
NEW · 伴生模型
Cosmos-Transfer2.5
ControlNet 风格的 Sim2Real 转换器,把仿真器渲染图(IsaacSim 等)转化为真实感视频,体积比前代小 3.5×。
统一模式Text2World / Image2World / Video2World 三种模式合并为一个模型
模型规格Cosmos-Predict2.5-2B(32层)和 14B(36层),3D RoPE 位置编码
视频压缩WAN2.1 VAE,时间×空间 = 4×8×8 压缩比;生成 93 帧 @ 16fps ≈ 5.8 秒视频
开源协议NVIDIA Open Model License,代码和权重均公开
与 DreamDojo 的关系

DreamDojo(2026)直接使用 Cosmos-Predict2.5 作为视频生成骨架,并在其上加入了"潜在动作注入"和"Self Forcing 蒸馏"机制,使其能接受机器人动作条件,实现跨具身泛化的世界模型。MotionWAM / SONIC 同样以 Cosmos-Predict2.5 为基底,加入自己的动作条件机制。

🧠 理解检查
Cosmos-Predict2.5 相比 Cosmos-Predict1 最核心的训练目标变化是什么?
§ 02

数据管道:7 阶段视频策展,只有 4% 通过

这一节解决什么

上一节确立了 Cosmos-Predict2.5 相比 Cosmos-1 的改进方向。但好模型的前提是好数据——论文在原有 Cosmos-1 数据管道上做了大规模扩充和质量升级。核心结论:从 350 亿原始视频中只保留 2 亿高质量片段(约 4% 存活率),用于预训练。严格过滤是生成质量的关键保障。

七阶段过滤管线

Fig 1: 视频数据策展管线
Fig 1 · p.5 Our video curation pipeline transforms raw, unstructured video data from diverse real-world sources into a high-quality, annotated, deduplicated, and sharded dataset. 视频策展管线:从海量原始视频 → 高质量训练数据集。7 个阶段,只有约 4% 的片段最终进入训练。
点击图中绿点查看各阶段说明

5 个领域专项数据集

在通用预训练数据之外,论文还为 Physical AI 的五个目标领域定制了专项数据:

DOMAIN 01 · ROBOTICS
机器人操作视频
收录 AgiBot-Beta(254k)、DROID(141k)、GR00T(3k)等数据集,增速和视角统一化处理;Caption 包含运动类型、部件信息、相机运动等。
DOMAIN 02 · AUTONOMOUS DRIVING
自动驾驶多视角
310 万个 20 秒环视视频片段(7 路摄像头),覆盖美国/欧洲多种道路、天气、光照条件;Caption 包含交通行为、速度、方向信息。
DOMAIN 03 · SMART SPACES
智能空间场景
仓库、工厂、建筑工地等工业场景视频,约 40k 片段;VLM 过滤确保场景相关性。
DOMAIN 04 · HUMAN DYNAMICS
人体动态
YOLOX + RTMPose 标注人体姿态,保留每帧至少有一人占 3% 以上画面的片段,用于增强人类运动模拟能力。
展开原文 · 数据管道规模对比

"In contrast to the pipeline in [Cosmos-Predict1], the [Cosmos-Predict2.5] pipeline scales to a much larger volume, processing 35 million hours of raw video compared to 20 million clips and producing over 6 billion clips from which 200 million high-quality clips are retained."

— §2.1, p.6
§ 03

模型架构:Flow Matching DiT + WAN2.1 VAE + Cosmos-Reason1

这一节解决什么

有了好数据,接下来是建模方式。Cosmos-Predict2.5 的架构是一个潜变量扩散 Transformer(Latent DiT),核心可以理解为:先用 VAE 把视频压缩成"潜在视频",然后用一个 DiT(Diffusion Transformer)在潜变量空间里学习"如何从噪声走向真实视频"。训练目标从上一代的 EDM 噪声预测改成了更直接的 Flow Matching 速度场预测。

Flow Matching:比扩散模型更直接的训练目标

可以把生成过程想象成从 A 地(纯噪声 $\mathbf{x}_0$)走到 B 地(真实视频 $\mathbf{x}_1$)。EDM 是"猜测下一步的噪声",Flow Matching 是"直接告诉模型往哪个方向走、走多快"——更直接,也更好优化。

$$\mathbf{x}_t = (1-t)\mathbf{x} + t\boldsymbol{\epsilon}, \quad t \in [0,1]$$ Eq. 1 · 线性插值路径(从真实数据 x 到噪声 ε 的直线)
逐项拆解
$\mathbf{x}_t$
时刻 $t$ 的中间状态:$t=0$ 时是真实视频,$t=1$ 时是纯噪声
$(1-t)\mathbf{x} + t\boldsymbol{\epsilon}$
在真实视频和噪声之间做线性插值——相当于"按比例混合"
$$\mathbf{v}_t = \boldsymbol{\epsilon} - \mathbf{x}$$ Eq. 2 · Ground truth 速度场(从真实视频指向噪声的方向向量)
$$\mathcal{L}(\theta) = \mathbb{E}_{\mathbf{x},\boldsymbol{\epsilon},t} \left\| \mathbf{u}(\mathbf{x}_t, t; \mathbf{c}; \theta) - \mathbf{v}_t \right\|^2$$ Eq. 3 · Flow Matching Loss(预测速度场 vs 真实速度场的 MSE)
逐项拆解
$\mathbf{u}(\mathbf{x}_t, t; \mathbf{c}; \theta)$
模型输出的速度预测,条件 $\mathbf{c}$ 包含文字 embedding、参考帧等
$\mathbf{v}_t = \boldsymbol{\epsilon} - \mathbf{x}$
Ground truth 速度场——从噪声方向指向真实数据(类比 GPS 导航的"目标方向")
$\|\cdot\|^2$
MSE 损失,让预测速度和真实速度尽量一致

整体架构图

Fig 2: Cosmos-Predict2.5 整体架构
Fig 2 · p.9 Overall architecture of [Cosmos-Predict2.5]. Left: Cosmos-Reason1 as text encoder. Right: DiT blocks with Self-Attention, Cross-Attention, and Feed-forward layers modulated by time embedding. 左侧 Cosmos-Reason1 负责文字理解,右侧 DiT 在潜变量空间预测速度场,生成条件可以是纯文字、参考图,或参考视频。
点击图中绿点查看架构细节
关键设计决策

去掉了绝对位置 embedding:Cosmos-1 用了绝对位置 embedding(固定了分辨率和帧数范围),Predict2.5 只保留 3D RoPE 相对位置编码。这让模型在后训练阶段可以处理更高分辨率(720p)和更长视频序列,而不受预训练时序列长度的限制。

🧠 理解检查
WAN2.1 VAE 的时空压缩比是多少?原始 93 帧视频压缩后对应多少潜变量帧?
§ 04

训练配方:预训练 → SFT → 模型合并 → RL → 蒸馏

这一节解决什么

架构确定了,下一个问题是怎么训练。Cosmos-Predict2.5 采用了一条复杂但精心设计的五阶段训练流水线。每个阶段解决不同的问题:预训练建立通用世界知识,SFT 打磨各领域专项能力,模型合并把专项能力融合,RL 对齐人类偏好,蒸馏提升推理速度。

🪜 五阶段训练流水线
1 / 5

第 1 阶段:多分辨率渐进预训练

从 Text2Image @ 256p 出发,逐步提升到 Video2World @ 720p(1280×704),共 5 个课程阶段。用 logit-normal 时间步采样 + shifted schedule(β=5 @ 720p)确保高噪声区域充分训练。训练结束后在 4K 视频上做 cooldown 微调,提升细节和运动流畅度。数据:2 亿片段。

第 2 阶段:领域专项 SFT(监督微调)

用 InternVideo2 embedding 训练多头分类器把数据分成 6 类:客体永久性(10.4M)、高运动(1.0M)、复杂场景(1.6M)、驾驶(3.1M)、机器人操作(730k)、4K(388k)。每个领域单独训练一个专项 SFT 模型(30k iterations,batch=256),各自在专项测试集上都显著优于预训练基底。

第 3 阶段:模型合并(Model Merging)

用 TIES/DARE-TIES 等 4 种权重合并方法,通过网格搜索超参数生成 20+ 个候选合并模型,人工评估选出最佳。最终合并模型(Model Soup 变体)在通用域 + 所有专项领域上同时取得高水平,避免了单模型遗忘问题。

第 4 阶段:强化学习(RL Post-training)

采用 VideoAlign 作为奖励模型(VLM-based,评估文字对齐度、运动质量、视觉质量)。使用 GRPO 算法:每个 Prompt 生成 8 个输出,按奖励归一化后计算优势值。在合并模型上训练 256 步(batch=32)。结果:RL 版本在人类投票中约 40% 胜出(vs 18.9% 败)。

第 5 阶段:时间步蒸馏(Timestep Distillation)

用混合前向-反向联合蒸馏框架(rCM),把教师模型(35 步)蒸馏为学生模型(4 步),量化指标几乎无损(Table 7/8 显示 Domain Score 差距 <1%)。基础设施支持 Flash Attention + JVP、FSDP2、Context Parallelism。

SFT + 模型合并的效果

Fig 3: SFT 领域性能提升
Fig 3 · p.12 Domain-specific SFT training improves the performance of the pretrained model on each domain. 各领域 SFT 后与预训练基底的对比:机器人领域 SFT 胜率高达 72.6%,提升最显著。
点击图中绿点查看解读
Fig 4: 模型合并雷达图
Fig 4 · p.12 Merged model gets the best of all the worlds while maintaining performance on the general domain. 模型合并(蓝色)在六大维度上全面超越预训练基底(黑色),且保住了通用域(General)能力。
点击图中绿点查看解读
核心结论

RL 后训练有效:在 pre-trained 模型和合并模型上,RL 都显著提升了 VideoAlign 奖励(文字对齐 +0.14,视觉质量 +0.23)。人类投票结果:RL 版本约 40% 胜率 vs 合并模型的 19.6%。蒸馏基本无损(4步 vs 35步,Domain Score 差距 <1%)。

§ 05

Cosmos-Transfer2.5:仿真→真实的 ControlNet 桥梁

这一节解决什么

训练好了世界生成模型,下一个问题是:机器人训练常用 NVIDIA IsaacSim 等物理仿真器生成的图像,但仿真器图像和真实图像之间存在明显的"视觉鸿沟"——光照、纹理、阴影都太假。Cosmos-Transfer2.5 就是一个"图像翻译器",把仿真器渲染的图(或者深度图、边缘图、语义分割图等条件)转换成视觉上真实可信的视频,弥合 Sim2Real 差距。

架构上继承自 Cosmos-Transfer1-7B,但做了关键改进:把 4 个控制块均匀分布在主干每隔 7 层插入一个(而非全部插在最前面),让控制信号更均匀渗透到网络各层,生成更一致。

Fig 9: Transfer2.5 vs Transfer1 对比
Fig 9 · p.20 Sample comparison results of [Cosmos-Transfer2.5-2B] vs [Cosmos-Transfer1-7B]. Transfer2.5(下)在 Prompt 对齐、幻觉控制、条件遵循三方面均优于 Transfer1-7B(上),且体积小 3.5×。
点击图中绿点查看对比详情
模型 Blur SSIM↑ Edge F1↑ Depth si-RMSE↓ Seg mIoU↑ Overall Quality↑
Cosmos-Transfer1-7B Uniform 0.820.260.700.749.24
Cosmos-Transfer2.5-2B Blur 0.900.260.590.759.75
Cosmos-Transfer2.5-2B Uniform 0.870.410.670.769.31
类比理解

Cosmos-Transfer2.5 类比于图像领域的 ControlNet(Stable Diffusion + 骨架/边缘控制)。区别在于:① 作用于视频而非图像;② 使用 Cosmos-Predict2.5 的 Flow Matching DiT 而非 U-Net;③ 专为 Physical AI(机器人、自动驾驶)场景定制了训练数据。

§ 06

下游应用:机器人策略学习 / 合成数据 / 多视角驾驶

这一节解决什么

Cosmos-Transfer2.5 的各项能力如何在真实 Physical AI 任务中落地?论文展示了三个核心应用:(1) 用合成视频增强机器人策略训练;(2) 为 VLA 模型生成多样化训练数据;(3) 多视角视频生成支持自动驾驶仿真。

应用 1:机器人策略视觉增强

实验设置:双臂 Kinova Gen3 机器人,100 次人类遥操作苹果/碗抓放演示,训练 UNet-based Diffusion Policy。测试时引入对抗性视觉扰动(改变背景、物体外观、光照),评估策略鲁棒性。

Cosmos-Transfer2.5 生成多样化视觉风格的增强视频(改变颜色、纹理、光照)→ 扩充训练集 → 成功率大幅提升,尤其在 OOD(out-of-distribution)视觉条件下。

应用 2:VLA 合成数据生成

用 Cosmos-Predict2.5 生成机器人操作的合成视频,作为 VLA 模型(如 π₀)的训练数据来源。动作条件由已有机器人数据的动作序列提供,视频生成覆盖更多场景和视觉变化,缓解 VLA 训练数据稀缺问题。

应用 3:相机可控多视角驾驶仿真

在 Cosmos-Predict2.5 上微调出多视角生成能力,以世界场景图(road boundary + 3D bounding boxes)作为控制条件,同步生成 7 路摄像头的一致性视频,用于自动驾驶策略评估和数据增强。

对 VLA 研究的意义

这三个应用共同指向同一个问题的解决方案:真实机器人数据稀缺。用 Cosmos-Predict2.5 生成的合成视频可以:① 弥补稀有任务的训练数据不足;② 提供可控的 OOD 测试场景;③ 通过 Sim2Real 转换让仿真器数据也变得"可用"。这和 DreamDojo 的核心动机高度一致。

§ 07

实验结果:PAI-Bench 指标 + 人类偏好评估

这一节解决什么

用 PAI-Bench(Physical AI Generation Benchmark)评估,包含两个分数:Domain Score(VQA-based,跨 7 个物理 AI 领域)和 Quality Score(8 个文字到视频/图像生成指标的平均)。综合来看,Cosmos-Predict2.5 在 I2W 任务上拿到最好成绩,在 T2W 任务上与更大的 Wan2.2-27B-A14B 持平。

模型 T2W Domain↑ T2W Quality↑ T2W Overall↑ I2W Domain↑ I2W Quality↑ I2W Overall↑
CP2.5-2B [pre-train] 0.7820.7200.751 0.8240.7750.799
CP2.5-2B [post-train] 0.8040.7320.768 0.8400.7790.810
CP2.5-14B [post-train] 0.8030.7320.768 0.8380.7810.810
Wan2.2-27B-A14B 0.8100.7280.769 0.8410.7720.806

CP2.5 = Cosmos-Predict2.5。Wan2.2-27B-A14B 参数量是 Cosmos-Predict2.5-14B 的 1.9 倍。

Fig 6+7: 人类偏好评估
Fig 6+7 · p.17 Human evaluation: post-trained Cosmos-Predict2.5 models are preferred more often than Wan2.1 14B and on par with Wan2.2 27B-A14B despite having only half the parameter count. 人类偏好评估:CP2.5-14B 在参数量只有 Wan2.2 27B 一半的情况下,胜率不输对方。
点击图中绿点查看对比详情
🧠 理解检查
在 PAI-Bench 哪项任务上 Cosmos-Predict2.5 取得了最好的成绩,超过了参数量更大的 Wan2.2-27B-A14B?
§ 08

与 Embodied AI 的联系:为什么 DreamDojo 和 MotionWAM 都选它

这一节解决什么

作为精读笔记的最后一节,把 Cosmos-Predict2.5 放回到更大的 Embodied AI 技术地图里看。为什么这篇论文会在 DreamDojo(2026/02)和 MotionWAM 中被直接引用为基础组件?它解决了什么别的模型没解决的问题?它的局限又是什么?

Cosmos-Predict2.5 在 Embodied AI 技术地图中的位置

DreamDojo · 2026
直接使用 CP2.5 作为视频骨架
DreamDojo 保留 CP2.5 的 DiT + WAN2.2 tokenizer,并在其上注入"潜在动作条件(Latent Action)",加入时序一致性损失和 Self Forcing 蒸馏,使其变成可接受机器人动作的世界模型。
MotionWAM · 2026
继承 CP2.5 的视频生成能力
MotionWAM 在 CP2.5 基础上加入运动先验(Motion Prior)和关节轨迹条件,专注于手腕/手指精细运动的世界模型预测,用于灵巧操作任务。
CP2.5 的核心优势
高质量视频 + 开源权重
2B/14B 两种规格开源,训练 pipeline 完整,Video2World 的条件生成 API 简洁,易于接入自定义动作条件机制——这是下游工作选择它的核心原因。
局限性
纯视频输出,无动作理解
CP2.5 本身不理解或输出动作,无法直接作为策略模型使用。每次生成一段视频(93 帧≈5.8秒),长视频自动回归会积累误差。不支持音频或非视觉模态。
技术脉络 · Cosmos 系列演进

Cosmos-1(2025)→ EDM 扩散 + T5 编码器 + 视频生成
Cosmos-Predict2.5(2026/02)→ Flow Matching + Cosmos-Reason1 + SFT/RL/合并后训练
Cosmos-3(2026/06)→ 完全不同的范式:Mixture-of-Transformers,统一 Language/Image/Video/Audio/Action 五模态

Cosmos-3 不是 Cosmos-Predict2.5 的"下一版本",而是对整个 Physical AI 世界模型架构的重新设计——从"视频生成基座"跃迁到"全模态统一世界模型"。

局限性 · 研究者需要注意

无长时一致性保证:自动回归生成长于 93 帧的视频时,各 chunk 之间可能出现外观漂移和物理不一致(虽然 Transfer2.5 有所缓解)。
生成速度限制:蒸馏版本虽然仅需 4 步,但 5.8 秒视频生成仍需数秒,无法实时(相比之下 DreamDojo 的蒸馏 pipeline 达到 10.81 FPS)。
不懂动作语义:CP2.5 本质上是视频生成模型,对"关节角度""末端执行器位置"没有内在理解,必须由下游工作(DreamDojo、MotionWAM)额外注入动作条件。

精读笔记 · Cosmos-Predict2.5 · NVIDIA 2026
→ 继续阅读:Cosmos 3 (Omnimodal World Models)