Offline Reinforcement Learning with Implicit Q-Learning
Kostrikov 等 · 2021/2022 · ICLR 2022 · arXiv:2110.06169 · Zotero E37AXX5B
IQL 不查询数据集外动作,而用上 expectile 从数据动作的 Q 分布中隐式逼近最好动作,再用优势加权行为克隆抽取策略。
§1 Introduction:离线 RL 为什么最怕给未见动作估值
离线 RL 希望只用既有数据学出优于行为策略的 policy,这对机器人很有吸引力:失败轨迹、旧策略数据和演示可以重复利用,不必承担在线探索风险。困难在于 Bellman backup 或 actor improvement 往往查询数据集外动作;Q 网络在这些动作上没有监督,稍微高估就会被策略反复放大。
IQL 的思路不是显式约束新策略接近 behavior,也不是学习 behavior model,而是完全避免对未见动作做 bootstrap。它用 expectile regression 从数据动作的 $Q(s,a)$ 拟合一个偏向高值的 $V(s)$,再仅用数据中的下一状态更新 Q;最后通过 advantage-weighted behavioral cloning 抽取 policy,让函数逼近器的泛化隐式组合高质量行为。
展开原文 · 核心原则
“never needs to evaluate actions outside of the dataset”
§2 Related Work:保守 Q、行为约束与优势加权回归
BCQ、BEAR 等用生成模型或分布距离限制策略动作,CQL 直接压低数据外 Q;它们显式处理 distribution shift,但约束强度会影响是否能超过 behavior。AWR/AWAC 用 advantage 对数据动作加权,更像稳定的加权模仿。IQL 将 expectile value learning 与 advantage-weighted extraction 组合,训练简单且不需要策略参与 critic backup。
迁移到 VLA 时,IQL 的价值是“critic 只信数据动作”,但也有结构错位:大 VLA 输出 action chunk 或 diffusion/flow 分布,而原始 IQL 假设普通 Markov 单步动作与可计算策略密度。CO-RFT、ARFM 等后续工作正是在 chunk 信用分配和生成式动作头上改造这套思想。
§3 问题设定:SFT 到底漏掉了什么
VLA 预训练与 SFT 解决“从观测到动作的模仿”,但部署是闭环过程:动作会改变下一帧,错误会把策略带到演示没有覆盖的状态。离线 RL 想超过行为策略,却一评估未见动作就容易因分布外 Q 误差崩溃。
训练数据固定为 (s,a,r,s')。Q 只在数据动作上回归,V 用非对称 expectile 从 Q 分布中选择偏高但仍受数据支持的值。
展开原文 · 核心主张
“never needs to evaluate actions outside of the dataset”
§4 方法总览:反馈信号怎么走
上一节明确了状态、动作与反馈,现在沿论文原图追踪训练信号。重点不是背模块名,而是判断:哪部分保持预训练先验,哪部分真的被 RL 改写。

1. 只对数据集动作拟合 Q
critic 只在离线数据真实出现的动作上拟合 Q,不对当前策略随意采样的 OOD 动作查询价值。这个限制直接针对离线 RL 的外推误差:没见过的动作不会因为函数逼近偶然高分就被选中。
输入是什么:已经采集的专家演示、机器人交互轨迹或评测样本。每条数据通常包含观测、动作,以及可能存在的奖励或下一状态。
这一步究竟做什么:critic 只在离线数据真实出现的动作上拟合 Q,不对当前策略随意采样的 OOD 动作查询价值。这个限制直接针对离线 RL 的外推误差:没见过的动作不会因为函数逼近偶然高分就被选中。
输出到哪里:一个分数、奖励或价值估计,用来比较候选,而不是直接控制机器人。这个结果会交给下一步“expectile 回归得到偏向高价值的 V”继续处理。
为什么不能省略:只有生成候选而没有评价标准,模型不知道哪个结果更好;这一步把‘好坏’变成可比较的学习信号。
2. expectile 回归得到偏向高价值的 V
用 expectile regression 从 $Q(s,a)$ 拟合 $V(s)$,并让 $V$ 偏向数据中较高价值的动作。它像一个软最大值,但仍完全由数据支持,比显式求 $\max_a Q$ 更保守。
输入是什么:来自上一步“只对数据集动作拟合 Q”的产物:一个分数、奖励或价值估计,用来比较候选,而不是直接控制机器人。本步骤还会按论文设置读取当前条件、时间步或训练信号。
这一步究竟做什么:用 expectile regression 从 $Q(s,a)$ 拟合 $V(s)$,并让 $V$ 偏向数据中较高价值的动作。它像一个软最大值,但仍完全由数据支持,比显式求 $\max_a Q$ 更保守。
输出到哪里:经过本步骤处理、含义更明确的中间结果。这个结果会交给下一步“用 Bellman backup 更新 Q”继续处理。
为什么不能省略:它承担上下两步之间的接口;缺少它,前一步产生的信息无法以正确格式或正确含义传到下一步。
3. 用 Bellman backup 更新 Q
Bellman backup 用奖励和下一状态的 $V$ 更新 Q。由于下一状态目标不需要从 learned policy 采 OOD 动作,critic 的 bootstrap 链比常规离线 Q-learning 更稳定。
输入是什么:来自上一步“expectile 回归得到偏向高价值的 V”的产物:经过本步骤处理、含义更明确的中间结果。本步骤还会按论文设置读取当前条件、时间步或训练信号。
这一步究竟做什么:Bellman backup 用奖励和下一状态的 $V$ 更新 Q。由于下一状态目标不需要从 learned policy 采 OOD 动作,critic 的 bootstrap 链比常规离线 Q-learning 更稳定。
输出到哪里:一个分数、奖励或价值估计,用来比较候选,而不是直接控制机器人。这个结果会交给下一步“优势加权行为克隆提取策略并可继续在线微调”继续处理。
为什么不能省略:只有生成候选而没有评价标准,模型不知道哪个结果更好;这一步把‘好坏’变成可比较的学习信号。
4. 优势加权行为克隆提取策略并可继续在线微调
最后用 $\exp(eta A)$ 加权行为克隆提取策略,高优势数据动作被更强模仿。若继续在线微调,新交互可自然加入数据集,而无需改变 IQL 的价值学习结构。
输入是什么:来自上一步“用 Bellman backup 更新 Q”的产物:一个分数、奖励或价值估计,用来比较候选,而不是直接控制机器人。本步骤还会按论文设置读取当前条件、时间步或训练信号。
这一步究竟做什么:最后用 $\exp(eta A)$ 加权行为克隆提取策略,高优势数据动作被更强模仿。若继续在线微调,新交互可自然加入数据集,而无需改变 IQL 的价值学习结构。
输出到哪里:参数得到更新的模型,或能供下一轮训练使用的新监督信号。这是图中这条链路的最终产物,随后会进入真实执行、模型更新或指标评测。
为什么不能省略:前面的数据或分数本身不会自动改变模型;必须通过损失函数把误差信号变成参数更新。
§5 机制细拆:动作、价值与更新边界
上图给出了宏观流程,但真正决定训练是否稳定的是三个接口:动作以什么粒度出现、反馈怎样变成可学习信号、哪些参数允许被更新。
§6 目标函数:把直觉压缩成可检查的量
前一节说清了信号路径,这里把核心优化目标写成教学化公式。读公式时依次检查:回报影响谁、数据支持在哪里、预训练策略受到什么约束。
- $\tau$
- expectile 水平,越大越偏向高价值动作
- $Q-V$
- 数据动作相对状态价值的优势
- $D$
- 固定离线数据集
交替优化 V、Q 与 advantage-weighted actor;离线完成后可把同一结构继续用于在线交互。
§7 训练与评测:数字是在什么条件下得到的
只看最终成功率会隐藏数据预算、仿真/真机差异和基座强弱。本节把论文的实验对象与比较关系放回同一张表。
| 策略与动作 | 训练数据固定为 (s,a,r,s')。Q 只在数据动作上回归,V 用非对称 expectile 从 Q 分布中选择偏高但仍受数据支持的值。 |
|---|---|
| 训练反馈 | Bellman target 更新 Q;A=Q−V 只用于给行为克隆加权,不需要从当前策略采样数据外动作。 |
| 更新方式 | 交替优化 V、Q 与 advantage-weighted actor;离线完成后可把同一结构继续用于在线交互。 |
| 实验覆盖 | D4RL 的 MuJoCo locomotion、AntMaze、Franka Kitchen 与 Adroit 是主要基准;论文还测试离线初始化后 1M 在线步。 |
| 关键对照 | CQL 显式压低 OOD Q,IQL 选择不查询 OOD;AWAC 同样优势加权,但 IQL 的 expectile V 是其离线稳定性的关键。 |
§8 结果怎么读:证据、因果与可迁移结论
论文在 D4RL 上达到当时强结果,并展示离线初始化后继续在线微调的能力;它也是多篇 VLA 离线 RL 的基础。
CQL 显式压低 OOD Q,IQL 选择不查询 OOD;AWAC 同样优势加权,但 IQL 的 expectile V 是其离线稳定性的关键。
IQL 的价值在于把‘策略改进’藏进值函数回归,适合成为 VLA 离线 RL 的稳健起点。
§9 复现与工程检查
前一节判断了证据强度,复现时还要把训练信号对齐、时间尺度和数据统计逐项落地,否则“同名算法”也可能得到完全不同的结果。
- expectile τ 与 actor 温度 β 要分开调;确认 Q target 不含当前策略采样动作;不同数据质量应分别报告。
- 先跑通不加 RL 的预训练/SFT 基线,并保存逐任务成功率与失败视频。
- 同时记录环境步数、真实墙钟时间、人工介入次数、更新次数和推理延迟。
- 把奖励、终止、action chunk mask 与归一化统计做成可视化单元测试。
§10 适用边界与研究启发
IQL 的保守性来自数据支持而非魔法;数据中没有可泛化的好动作时,上 expectile 也无法凭空创造技能。
IQL 的价值在于把‘策略改进’藏进值函数回归,适合成为 VLA 离线 RL 的稳健起点。