返回博客

/ CS336

[CS336-13] 数据概览

整理 CS336 第十三讲:pretraining、mid-training、post-training 数据,web data pipeline、版权许可和 instruction data。

3 minCS336 · Data · Pretraining

这篇是 Stanford CS336 Spring 2025 第 13 讲 Course Materials 的学习笔记。主题是语言模型训练数据。

1. Data does not fall from the sky#

这讲的核心观点很直接:数据不是天然干净地躺在那里等你训练。网页、PDF、书籍、代码、论坛、论文、对话数据都有不同格式、噪声、版权、质量和分布问题。

模型架构可以复用,训练系统可以工程化,但数据是长尾问题,依赖大量人类判断和处理策略。很多模型能力差异,最后都可以追溯到数据差异。

2. Pretraining、mid-training、post-training#

不同阶段的数据目标不同。

Pretraining 数据追求广覆盖和规模,让模型学习语言、知识、代码、数学和世界分布。

Mid-training 往往在某些能力或领域上继续强化,例如代码、数学、多语言、长上下文。

Post-training 数据更偏 instruction following、偏好、安全和具体产品行为。

把所有数据都混成“训练数据”会掩盖这些目标差异。

3. Web 数据的复杂性#

Common Crawl 这样的网页数据规模大,但原始格式是 HTML,不是干净文本。网页里有导航栏、广告、模板、重复内容、脚本、乱码、垃圾站点、SEO 内容。

因此 web data pipeline 至少包括:

  • HTML 到文本抽取;
  • 语言识别;
  • 质量过滤;
  • 去重;
  • 有害内容过滤;
  • 文档分段和元数据保留。

这也是 Assignment 4 的核心。

4. 数据来源和能力#

不同数据源会影响模型能力。书籍和论文带来长文本和结构化知识;GitHub 带来代码能力;论坛和问答带来对话风格;数学语料影响推理和符号能力;多语言数据影响跨语言表现。

数据 mixture 不是越杂越好,而是要和目标能力匹配。资源受限时,每个 token 都有机会成本。

5. 法律与许可#

Lecture 13 也讨论了 copyright、license、fair use、terms of service 等问题。大多数互联网内容都受到版权保护,开源 license 和网站 terms 也会限制使用方式。

从工程角度看,数据合规不是训练结束后才处理的法务问题,而应当进入数据采集和元数据管理流程。

6. Instruction data 和数据投毒#

Post-training 使用的 instruction data 可以来自人工标注、现有任务模板、模型生成、自我对话、供应商数据等。数据质量、风格、长度、安全策略都会影响 assistant 行为。

课程还提到数据投毒风险:如果训练数据中有触发词和目标行为,模型可能学到隐藏后门。这说明数据 pipeline 还需要安全审计。

7. takeaway#

第 13 讲的核心是:数据是模型能力的主要来源,也是最难标准化的一层。

  • pretraining、mid-training、post-training 的数据目标不同;
  • raw web data 到训练语料之间有很长处理链;
  • 数据 mixture 决定模型能力分布;
  • 法律、许可、安全是数据工程的一部分;
  • 高质量数据不是规模的附属品,而是核心资产。

如果说架构决定模型能不能学习,数据决定模型到底学到什么。

参考#