VLA + RL:从动作模仿到闭环自我改进
截图的主线是对的:VLA 先用大规模数据建立跨任务先验,SFT 把它适配到机器人,RL 再通过环境反馈补上分布偏移、错误恢复与策略最优性。但“用了 RL”不是一个方法类别;真正要区分的是反馈来自离线数据、在线真机还是世界模型,以及更新的是整条生成链、动作块、residual,还是仅仅一个 critic。
§1 基础:先分清 VLA、SFT、offline RL 与 online RL
先学会读动作头和数据分布,再进入后训练。RT-2/OpenVLA/π₀ 是 VLA 基座;IQL、AWAC 与 HIL-SERL 分别提供离线、离线到在线、真机人类介入三套 RL 直觉。
§2 RL 到底给 VLA 带来了什么
不要把训练任务涨点误当泛化。先读系统实证,再决定要优化视觉、语义、执行鲁棒,还是仅仅提高熟悉任务成功率。
§3 轻量在线 RL 与真机落地
工程主流是保护预训练基座,只训练少量 residual、critic 或动作模块,并用人类介入和异步采样降低真机成本。
§4 离线 RL 与小数据冷启动
没有大量真机交互时,关键是只在数据支持范围内提取“哪些动作更好”,同时让算法尊重 VLA 的 action chunk 或 flow 表示。
§5 生成式动作头的原生 RL
扩散与 flow 不是普通高斯 actor。DPPO 把去噪链视为内部 MDP;ReinFlow 用可学习噪声让确定性 flow 具备 likelihood 与探索。
§6 自提升:RL 生成数据,或在世界模型里想象
PLD 用 residual RL 发现失败并生成恢复数据,再蒸馏回 VLA;RISE 则把 rollout 搬进 compositional world model,用想象优势更新策略。
截图条目核验说明 · 2026-08-10 更新
截图中的 11 个黄色名称现已全部对应到公开论文,并完成 PDF、Zotero 与独立精读页。两处二手写法已纠正:STARF-VLA → STARE-VLA;Kai-0 → χ₀。其余简称对应 RL Token、SAC Flow、πRL、SA-VLA、FlowPRO、DSRL、QGF、RL-VLA³ 与 LWD。
| 截图写法 | 核验后的正式身份 | 路线定位 |
|---|---|---|
| DSRL | Steering Your Diffusion Policy with Latent Space RL | 冻结 diffusion policy,学习潜噪声策略 |
| QGF | Test-Time Gradient Guidance of Flow Policies | critic 只在推理时引导 flow |
| STARF-VLA | STARE-VLA | 阶段级信用分配 |
| Kai-0 | χ₀ | 资源受限长程双臂可靠性 |