// Embodied AI · 具身智能学习笔记

具身智能学习笔记

面向具身智能(Embodied AI)方向的中文学习记录:论文精读、源码精读、以及认知科学/理论背景。 聚焦 VLA(视觉-语言-动作)模型、世界模型、控制策略等方向,每篇都有架构拆解 / 核心公式 / 与工程实践的连接。

34
已精读
30+
计划中
7
覆盖方向
最近更新 Recent 按更新时间排序
2026-07-22 · 合集
VLM 架构合集 · 按组件拆解(Encoder / Connector / LLM)
面试向阅读地图:把 VLM 拆成视觉编码器 + 连接器/投影器 + 语言模型三段,每个槽位配齐论文并标注"为什么读它"。 覆盖 CLIP/SigLIP/DINOv2(含"DINOv2 算什么")、LLaVA/BLIP-2/Flamingo/Qwen2-VL 的对齐路线、 Transformer 现代标配与 MoE(Mixtral/DeepSeek-V3),以及 VLM→VLA 的必问衔接题(RT-2/OpenVLA/π₀ 站内直达)。
✓ 合集 VLM 内部结构 面试向
2026-07-17 · 刚完成
Being-M0.7 · 人形机器人的隐空间世界-动作模型
BeingBeyond(research.beingbeyond.com/being-m07):不预测像素、只预测未来 DINO 视觉隐状态 + 运动的 latent WAM。 万小时三流语料(视频-动作对/纯视频/纯动作)用 MoT 混合模态预训练"世界演化先验",再接轻量动作专家落地真机。 人机共享的紧凑运动表示(头+两手两脚)桥接形态鸿沟。真机 G1 四任务:7/15 超 Ψ₀(3) 与 GR00T(2)。
✓ 已精读 BeingBeyond · 2026 Latent WAM · MoT
2026-07-16 · 刚完成
WAM-TTT · 测试时看人类演示,把技能写进快权重
北大 + Galbot(arXiv:2607.06988):部署后 steering 新范式——人类视频不做重定向、不当上下文, 用自监督视频预测把它"写进"冻结 WAM 里的 TTT 快权重(1 步梯度)。meta-training 用 2286 对人机数据校准"人类 K/V ↔ 机器人 Q"读出接口。 3 本体 9 任务:46.2% vs ICL 7.1%;域内最高 + 场景漂移留存率最高(0.76)。含 co-training 反噬、伪动作 −43 分等硬核消融。
✓ 已精读 北大 · Galbot · 2026 Test-Time Training · 快权重
2026-07-16 · 刚完成
Ψ₀ · 通用人形 Loco-Manipulation 的开放基础模型
USC PSI Lab + NVIDIA(arXiv:2603.12263):反 co-training 主张——VLM 从 800h 人类第一视角视频学任务先验(任务空间/单步/离散), MM-DiT action expert 从 30h 真机数据学关节控制(关节空间/块/flow matching),两种动作分布不混训。 8 个长程任务比第二名 GR00T-N1.6 高 40%+,基线数据量是它的 10×。含 training-time RTC、三系统架构、遥操作全链路拆解。
✓ 已精读 USC · NVIDIA · 2026 人类视频预训练 · MM-DiT
2026-07-16 · 刚完成
Humanoid-GPT · GPT 式序列建模做人形动作跟踪 + Scaling Law
清华 + Galbot(arXiv:2606.03985):2B 帧动作语料训 ~300 个 PPO 专家,DAgger 并行蒸馏进 causal Transformer(5.7M–80M), Unitree G1 零样本跟舞蹈/功夫/翻身起立。首次给出 motion tracking 的 scaling law——MLP/TCN 早饱和,Transformer 还在涨。 含与 SONIC 的逐维对比(相反的押注:架构 scale vs 接口生态)。
✓ 已精读 清华 · Galbot · 2026 Scaling Law · DAgger 蒸馏
2026-06-30 · 刚完成
DeepWBC · 腿臂统一全身控制策略(VBC 前身)
CMU CoRL 2022(Fu/Cheng/Pathak):单个 RL 策略同时控制 Go1+WidowX 19 DoF,不分层、不解耦,学出人类般的腿臂协同。 首创两大技术并被 VBC 沿用:Advantage Mixing(拆解-混合解决高 DoF 信用分配)+ ROA(单阶段双向对齐 Sim2Real,RMA 的推广)。 含全部 RL 公式逐项解读 + DeepWBC→VBC 演进对照表。
✓ 已精读 CMU · CoRL 2022 Advantage Mixing · ROA
2026-06-30 · 刚完成
VBC · 腿足机器人视觉全身控制(Loco-Manipulation)
UCSD CoRL 2024:装了机械臂的四足狗(Unitree B1+Z1,19 DoF),用『腿+臂』全身协调去抓不同高度的物体——弯腰屈膝够到地面垃圾。 三阶段训练:低层 RL 通用全身策略 → 高层特权教师 RL → 视觉学生 DAgger 蒸馏;全程仿真训练,零真机数据 Sim2Real。 含完整 RL 公式逐项解读(PPO / 奖励表 / IK / ROA / DAgger)+ 复现操作总结。
✓ 已精读 UCSD · CoRL 2024 Whole-Body · RL · Sim2Real
2026-06-15 · 刚完成
Cosmos 3 · 全模态世界模型(Omnimodal MoT)
NVIDIA 2026-06-09 最新:Mixture-of-Transformers 架构,一个模型统一 Language / Image / Video / Audio / Action 五种模态。 Reasoner Tower(因果 AR)+ Generator Tower(扩散生成)共享同一组 Transformer 层,MoT 实现理解和生成并行。 Cosmos3-Nano-Policy-DROID 39.7 分超过 π₀.₅(28.1 分),T2I/I2V 被评为最佳开源。
✓ 已精读 NVIDIA · 2026-06 MoT · Omnimodal · Action
2026-06-15 · 刚完成
Cosmos-Predict2.5 · 视频世界模型基座(Flow Matching DiT)
NVIDIA 2026-02:200M 视频片段训练的视频世界模型,Flow Matching + WAN2.1 VAE + Cosmos-Reason1 VLM 作为文字编码器。 支持 T2W / I2W / V2W 三种推理模式,2B 和 14B 全开源。 DreamDojo、MotionWAM 等下游工作的视频生成基座;Cosmos-Transfer2.5 提供 Sim2Real 转换。
✓ 已精读 NVIDIA · 2026-02 Flow Matching · DiT · Sim2Real
2026-06-15 · 刚完成
DreamDojo · 大规模人类视频预训练的通用机器人世界模型
NVIDIA 2026:44k 小时自我中心人类视频预训练,潜在动作作为统一代理标签,首个实现 OOD 跨具身泛化的机器人基础世界模型。 蒸馏 Pipeline(Self Forcing)压缩到 4 步去噪,实时 10.81 FPS,支持遥操作 / 策略评估 / 模型规划。
✓ 已精读 NVIDIA · 2026 World Model · Latent Action · Distillation
2026-06-13 · 刚完成
SONIC · 超大规模运动追踪与通用全身控制
NVIDIA 2026:以运动追踪为可扩展基础任务,100M 帧 + 21K GPU 小时训练通用全身控制器。 FSQ Universal Token 统一机器人/人类/混合运动命令于同一离散 token 空间,99.6% OOD 追踪成功率。 MotionWAM 的 k_t 就是 SONIC 的 universal token,SONIC 作为底层运动引擎被 MotionWAM 复用。
✓ 已精读 NVIDIA · 2026 FSQ · Universal Token · PPO
2026-06-13 · 刚完成
DiT4DiT · 联合建模视频动力学与动作生成
Mondo Robotics + HKUST 2026:MotionWAM 的先驱工作。双 DiT 架构(Video DiT + Action DiT), 在固定 flow timestep τ_f 用 forward hook 提取 intermediate hidden state,Dual flow-matching 联合训练。 LIBERO 98.6% SOTA,样本效率比语义对齐高 10×,收敛快 7×。
✓ 已精读 Mondo Robotics · HKUST · 2026 WAM · Dual DiT · Video Proxy
2026-06-28 · 刚完成
Fast-WAM · WAM 需要测试时未来想象吗?
清华/Galaxea 2026:严格受控消融——保留训练时 video co-training、去掉推理时视频生成, RoboTwin 91.8%(无 embodied pretraining),190ms 实时推理(IDM 的 1/4 延迟)。 核心结论:WAM 的收益主要来自训练时视频联合目标,而非推理时显式想象未来。
✓ 已精读 Tsinghua · Galaxea · 2026 Video Co-training · 190ms · 受控消融
2026-06-28 · 刚完成
τ₀-WM · 统一视频-动作世界模型(AGIBOT Finch)
AGIBOT Finch 2026 最新:VAM(视频动作模型)+ ACVS(动作条件视频模拟器)共享 Wan2.2 5B 视频 DiT 骨干, 27.3K 小时异质数据(机器人 65% + UMI 24% + Ego 11%)用模态掩码统一训练。 推理时计算(RCS + LAR)让成功率从 43% 提升到 60%,4 个精操作任务平均成功率 64%,超 π₀.₅(44%)和 Fast-WAM(20%)。
✓ 已精读 AGIBOT Finch · 2026 World Model · Video Diffusion · TTC · 5.5B
2026-06-10 · 刚完成
MotionWAM · 实时人形机器人 Loco-Manipulation 世界-动作模型
Mondo Robotics 2026 最新:双 DiT 架构(Video DiT + Motion DiT)耦合视频世界模型与全身动作, unified motion latent 统一控制 locomotion、torso、足部交互、手部操作。三阶段训练从 2,136 小时视频到 9 个真实任务, 成功率比 SOTA VLA 高 32%,首次实现实时闭环 WAM。
✓ 已精读 Mondo Robotics · HKUST · 2026 WAM · Humanoid · Real-Time
2026-04-27 · 刚完成
RT-2 · Vision-Language-Action Models Transfer Web Knowledge
VLA 开山之作:Google DeepMind 用 PaLI-X 55B / PaLM-E 12B 直接微调输出动作 token, co-fine-tuning 保留 Internet 语义知识。涌现能力:符号理解、数学推理、人类识别—— robot 数据中从未出现过的能力。OpenVLA 和 π₀ 的共同起点。
✓ 已精读 Google DeepMind · 2023 VLA · Co-Fine-Tuning · Emergent
2026-04-27 · 刚完成
OpenVLA · An Open-Source Vision-Language-Action Model
第一个完全开源的通用 VLA:Prismatic-7B(SigLIP + DINOv2 + Llama 2 7B)在 970k 轨迹上微调, 动作离散化为 256-bin token。7B 参数比 55B 的 RT-2-X 高 16.5%,LoRA 微调只需 1 张 A100, 4-bit 量化后 7GB VRAM 即可部署。
✓ 已精读 Stanford · Berkeley · CoRL 2024 VLA · Open-Source · 7B
2026-04-27 · 刚完成
π₀.₇ · A Steerable Generalist Robotic Foundation Model
Physical Intelligence 2026 最新:架构小升(Gemma3 4B + 860M Action Expert = 5B), 核心在 Diverse Prompting——subtask 指令 + BAGEL world model 生成 subgoal 图 + episode metadata(speed/quality/mistake)让通才 VLA 可操控。零样本跨本体折衣服匹配人类遥操。
✓ 已精读 Physical Intelligence · 2026 VLA · Steerable · Cross-Embodiment
2026-04-27 · 刚完成
π*₀.₆ · A VLA That Learns From Experience (RECAP)
Physical Intelligence 2025-11:在 π₀.₆ 基础上加 RL 回路。把 advantage 当 prompt token、 独立 distributional VF 当裁判、纯 SL loss 完成 RL 改进——绕开 flow matching 没有可计算 log-π 的死结。 真机:13h 连续做 espresso、2h 折新衣物、最难任务 2× throughput 且失败率减半。
✓ 已精读 Physical Intelligence · 2025-11 VLA · RL · Advantage Conditioning
2026-04-27 · 刚完成
π₀.₅ · A VLA with Open-World Generalization
Physical Intelligence 2025 续作:架构小动两刀(state 进 prompt + adaRMSNorm), 训练换两阶段(discrete pre + flow post),数据混 web/HL/VI 异质源。在没见过的真家做家务。 §6 对照 openpi 源码:哪些公开了、哪些只在 paper 里。
✓ 已精读 Physical Intelligence · 2025 VLA · Open-World
2026-04-21 · 刚完成
π₀ 数据 Pipeline · Transform 设计
以 openpi 的 transform 链为主线:7 层适配器 + 镜像对称(训练 .inputs 单向 / 推理 .inputs+.outputs)+ norm_stats.json 做粘合。逐层展开每个 transform 的"做什么/为什么/代码在哪", 以及 LIBERO / ALOHA / DROID 三种数据集的适配差异对照。
✓ 已完成 数据流 · Transform openpi · LeRobot
按方向浏览 Roadmap 点击展开
VLA · 视觉-语言-动作 把 VLM 作为 backbone,直接从感知+指令映射到机器人动作。当前 embodied 主流路线。 9 篇已读
世界模型 · JEPA 路线 LeCun 倡导的非生成式联合嵌入预测架构 2 篇已读
控制 · Policy & Planning 底层策略网络与经典控制方法,VLA / 世界模型的下游输出 1 篇已读
Loco-Manipulation · 移动操作 边走边抓:腿/全身参与操作,扩大工作空间。分层 RL + Sim2Real 是主流路线。 9 篇已读
生成式基础 · VAE 到 Flow π₀ flow matching 的上游知识链:VAE → Diffusion → Score SDE → Flow 3 篇已读
WAM · 世界-动作模型 世界模型生成 subgoal / 模拟未来,辅助策略学习 8 篇已读
认知科学 · 参考背景 婴幼儿认知、动物智能,指导 embodied AI 的数据/课程设计 1 篇已读
// ABOUT

关于本项目

这是一个个人学习笔记仓库,记录具身智能(Embodied AI)方向的学习过程——不限于论文精读, 也包含源码精读、工程实践、认知科学背景等。 每篇笔记包含:核心贡献/设计、架构拆解、关键公式或代码、以及与研究/工程实践的联系。 使用中文写作,英文专业术语保留对照,方便查阅原文。

如有错误或建议,欢迎通过 GitHub Issues 指出。