TOPIC 02 · VERIFIED ROUTE

VLA + RL:从动作模仿到闭环自我改进

截图的主线是对的:VLA 先用大规模数据建立跨任务先验,SFT 把它适配到机器人,RL 再通过环境反馈补上分布偏移、错误恢复与策略最优性。但“用了 RL”不是一个方法类别;真正要区分的是反馈来自离线数据、在线真机还是世界模型,以及更新的是整条生成链、动作块、residual,还是仅仅一个 critic。

● 绿色 = 身份已核验 + PDF + Zotero + 独立 HTML路线按学习依赖排列,不按发布时间排列

§1 基础:先分清 VLA、SFT、offline RL 与 online RL

先学会读动作头和数据分布,再进入后训练。RT-2/OpenVLA/π₀ 是 VLA 基座;IQL、AWAC 与 HIL-SERL 分别提供离线、离线到在线、真机人类介入三套 RL 直觉。

§2 RL 到底给 VLA 带来了什么

不要把训练任务涨点误当泛化。先读系统实证,再决定要优化视觉、语义、执行鲁棒,还是仅仅提高熟悉任务成功率。

开放环境基座

§3 轻量在线 RL 与真机落地

工程主流是保护预训练基座,只训练少量 residual、critic 或动作模块,并用人类介入和异步采样降低真机成本。

离线 → 在线
系统与可靠性

§4 离线 RL 与小数据冷启动

没有大量真机交互时,关键是只在数据支持范围内提取“哪些动作更好”,同时让算法尊重 VLA 的 action chunk 或 flow 表示。

保守价值学习
VLA 原生结构

§5 生成式动作头的原生 RL

扩散与 flow 不是普通高斯 actor。DPPO 把去噪链视为内部 MDP;ReinFlow 用可学习噪声让确定性 flow 具备 likelihood 与探索。

Flow · 推理期

§6 自提升:RL 生成数据,或在世界模型里想象

PLD 用 residual RL 发现失败并生成恢复数据,再蒸馏回 VLA;RISE 则把 rollout 搬进 compositional world model,用想象优势更新策略。

数据与阶段闭环
想象 RL

截图条目核验说明 · 2026-08-10 更新

截图中的 11 个黄色名称现已全部对应到公开论文,并完成 PDF、Zotero 与独立精读页。两处二手写法已纠正:STARF-VLA → STARE-VLAKai-0 → χ₀。其余简称对应 RL TokenSAC FlowπRLSA-VLAFlowPRODSRLQGFRL-VLA³LWD

截图写法核验后的正式身份路线定位
DSRLSteering Your Diffusion Policy with Latent Space RL冻结 diffusion policy,学习潜噪声策略
QGFTest-Time Gradient Guidance of Flow Policiescritic 只在推理时引导 flow
STARF-VLASTARE-VLA阶段级信用分配
Kai-0χ₀资源受限长程双臂可靠性