返回博客

/ CS336

[CS336-16] 可验证奖励强化学习

整理 CS336 第十六讲:从 RLHF 到 RLVR,PPO、DPO、GRPO、可验证 reward 和 reasoning model 训练。

3 minCS336 · RLVR · GRPO

这篇是 Stanford CS336 Spring 2025 第 16 讲 Course Materials 的学习笔记。主题是 Reinforcement Learning from Verifiable Rewards,也就是 RLVR。

1. 从 RLHF 到 RLVR#

RLHF 依赖人类偏好或 reward model,容易遇到 reward overoptimization 和主观偏好不稳定。RLVR 关注的是另一类任务:答案可以被程序或规则验证。

典型场景包括数学、代码、逻辑题、可自动判分任务。只要能判断最终答案对错,就可以直接把 correctness 当 reward。

这让 RL 的目标更清晰:不是优化一个可能有偏的 reward model,而是优化可验证结果。

2. PPO、DPO 和 GRPO 的位置#

Lecture 16 先回顾了 DPO:它通过 preference pairs 做直接优化,简单有效,但偏 offline,不天然适合在线 rollout 后立即按 reward 更新。

PPO 更通用,但需要 value model、advantage estimation、KL control、rollout loop,系统复杂。

GRPO 的吸引力在于:它保留 policy gradient 思路,但去掉 value function,用同一 prompt 下多条 response 的 group statistics 作为 baseline。

3. GRPO 的直觉#

对一个 prompt 采样多条回答,计算每条回答的 reward。然后用组内均值和标准差归一化 reward,得到相对 advantage。

同一个 prompt 下,回答 A 比本组平均好,就增加概率;
回答 B 比本组平均差,就降低概率。

这和语言模型场景天然匹配,因为我们很容易对同一 prompt 采样多个 completions。

4. 为什么去掉 value model 很重要#

PPO 中 value model 会增加显存、训练复杂度和不稳定来源。对于 outcome reward 任务,尤其是只有最终答案 reward 的任务,value estimation 本身也不容易。

GRPO 用 group baseline 替代 critic,简化了系统。实践中可以写很小的 GRPO implementation:rollout、打分、组内归一化、KL penalty、policy update。

5. RLVR 的案例和意义#

DeepSeek-R1、OpenAI o1 这类 reasoning model 让 RLVR 变得非常受关注。核心思路是:如果某些能力可以被可靠验证,就可以用 RL 在这些能力上持续优化,甚至超过人类示范数据的上限。

但这也意味着 RLVR 的适用范围受 reward 可验证性限制。数学和代码适合,开放问答、审美写作、复杂安全偏好就更难。

6. RL 的工程挑战#

RLVR 不是只加一个 reward 函数。它会带来大量推理 workload,因为每次更新都要采样多个 responses;还需要管理 policy、reference、reward/verifier、可能的 SFT model;需要处理 KL、长度偏差、过拟合、样本效率和 rollout 吞吐。

因此 RLVR 同时是算法问题和系统问题。

7. takeaway#

第 16 讲的核心是:可验证 reward 给了 RL 一个更干净的目标。

  • RLHF 优化偏好,RLVR 优化可验证结果;
  • PPO 通用但复杂;
  • DPO 简单但偏离在线 RL;
  • GRPO 用 group baseline 简化 critic;
  • RLVR 特别适合数学、代码等可自动判分任务;
  • 真正落地时,rollout 系统和 verifier 吞吐同样关键。

参考#