/ CS336
[CS336-15] RLHF and Alignment
Notes for Stanford CS336 Spring 2025 lecture 15: Alignment, RLHF, SFT.
这篇是 Stanford CS336 Spring 2025 第 15 讲 Course Materials 的学习笔记。主题是 alignment:如何把 base model 变成可用的 assistant。
1. Base model 不是 assistant#
Pretraining 得到的是 next-token predictor。它有大量知识和语言能力,但默认目标是续写文本,不一定会遵循指令、保持安全、控制格式或满足用户偏好。
Alignment 的目标是更强地控制输出:让模型回答问题、遵循格式、拒绝不安全请求、使用合适语气,并更贴近目标产品行为。
标准流程通常是:SFT 先做 imitation,再用 preference 或 reward 进一步优化。
2. SFT:用示范数据教行为#
Supervised fine-tuning 使用 prompt-response pairs,最大化模型对标注 response 的概率。
Instruction tuning 数据可能来自人工标注、现有 NLP 任务模板、self-instruct、供应商数据或模型生成数据。不同数据集在风格、长度、知识密度、安全策略上差异很大。
SFT 的效果很直接:让模型从“续写器”变成“会回答指令的模型”。但它仍然只是模仿标注分布,无法直接表达“两个回答哪个更好”。
3. Style 会强烈影响偏好#
Lecture 15 特别强调:偏好评测很容易受风格影响。更长、更有条理、更自信的回答,可能在人工或 LM judge 中更占优势,即使事实质量不一定更好。
这意味着 alignment 数据不只在教能力,也在教格式和语气。模型回答长度、bullet 风格、引用倾向、拒答方式都会被数据塑造。
4. Preference data 和 reward model#
RLHF 使用 preference data:给同一 prompt 生成多个回答,让人类或 judge 选择更好的一个。
然后可以训练 reward model 预测偏好,再用 PPO 等 RL 方法优化 policy,使模型输出获得更高 reward。
这个过程比 SFT 更接近“优化我们想要的行为”,但也引入 reward hacking、overoptimization、mode collapse 等问题。
5. PPO 的复杂性#
PPO 是早期 RLHF 的代表方法。它需要 rollout、reward model、reference model、policy model,有时还要 value model。训练时还要控制 KL,避免模型偏离 reference 太远。
它能工作,但系统复杂度高、显存占用大、实现细节多、调参困难。
6. DPO:把偏好优化变成监督损失#
DPO 试图绕开显式 reward model 和在线 RL。它从 RLHF 目标推导出一个直接使用 preference pairs 的 loss:提高 chosen response 的相对 log probability,降低 rejected response 的相对 log probability,并通过 reference model 控制偏移。
直觉上,DPO 更像“带负样本的 SFT”,实现简单许多,因此成为很多开源 alignment pipeline 的常用选择。
7. takeaway#
第 15 讲的核心是:alignment 是把 base model 的潜力转成可控产品行为。
- SFT 教模型模仿高质量回答;
- preference data 表达相对好坏;
- RLHF 用 reward 优化偏好,但实现复杂;
- DPO 简化了 preference optimization;
- 风格、长度、安全策略都会被 alignment 数据强烈塑造。
Alignment 不只是让模型“更聪明”,更是在定义模型应该如何和人交互。
参考#
- Stanford CS336 Spring 2025 Course Materials: lecture 15.pdf