/ CS336
[CS336-11] Scaling 实践细节
整理 CS336 第十一讲:muP、WSD learning rate、MiniCPM、DeepSeek、LLaMA 3 等 scaling 实践 recipe。
这篇是 Stanford CS336 Spring 2025 第 11 讲 Course Materials 的学习笔记。它从 scaling laws 的基本思想进入实践细节:怎么真正用小实验设计大模型。
1. Scaling 的现实问题#
第 9 讲说明 scaling laws 可以预测大规模训练,但实际落地还有很多问题:学习率是否随模型变、batch 如何选、Chinchilla 式拟合是否太贵、架构和参数化是否会破坏外推。
第 11 讲通过 CerebrasGPT、MiniCPM、DeepSeek、LLaMA 3、Hunyuan、MiniMax 等案例讨论这些问题。
2. muP 的动机#
Maximum update parametrization,也就是 muP,试图让超参数在 width scaling 时更稳定。它希望不同宽度模型在初始化和一次更新后的 activation scale 保持可比。
如果做得到,就可以在小模型上调学习率、初始化等超参数,然后迁移到更大模型。
这对大模型训练很有吸引力,因为大模型调参成本极高。
3. CerebrasGPT 与 MiniCPM 的路线#
CerebrasGPT 使用 Chinchilla recipe 并结合 muP,希望获得更可预测的 scaling 行为。
MiniCPM 则是更细致的实践案例:使用 muP 稳定初始化和学习率,固定 aspect ratio,然后通过小模型实验拟合 batch、LR、token-to-parameter ratio 等。
这些案例说明 scaling 不只是拟合 loss 曲线,也包括让实验设置本身可迁移。
4. WSD learning rate 的作用#
Chinchilla 风格分析往往需要从头训练许多不同数据量和模型大小的组合,成本很高。
WSD schedule 把学习率分成 warmup、stable、decay 三段。稳定阶段可以让训练持续收集中间点,最后从 stable 阶段分叉进入 decay,从而降低拟合不同 token budget 的成本。
这是一种很工程化的 scaling trick:不是改变理论,而是让实验设计更便宜。
5. DeepSeek、LLaMA 3 和更高 data ratio#
Lecture 11 提到一些近年模型使用了比 Chinchilla 20 tokens per parameter 更高的数据比例。例如 LLaMA 3 等模型使用更多 tokens 训练相对较小模型。
原因之一是现实部署中 inference 成本很重要。如果一个模型会被大量调用,训练时多花一些 compute,把模型做得更小更强,可能降低长期总成本。
因此 compute-optimal 不只有训练 compute 版本,也有考虑部署频率的版本。
6. muP 不是万能的#
课程也强调 muP 的局限。现代 Transformer 有 SwiGLU、RMSNorm gains、不同 batch size、特殊 initialization、weight decay、不同 optimizer 等组件,未必完全满足简化理论假设。
经验上 muP 常常有用,但也可能被某些设计打破。因此 scaling 实践需要同时依赖理论、ablation 和实际 loss 曲线。
7. takeaway#
第 11 讲的核心是:scaling laws 要变成训练 recipe,还需要一整套实验工程。
- muP 让部分超参数更可能跨 scale 迁移;
- WSD schedule 降低 Chinchilla 式拟合成本;
- batch、LR、数据比例都可以通过小实验拟合;
- 现代模型常常为了推理成本选择更高 tokens/parameter;
- scaling 不是一次公式计算,而是一个实验设计流程。
参考#
- Stanford CS336 Spring 2025 Course Materials: lecture 11.pdf