Back to writing

/ CS336

[CS336-11] Scaling Details

Notes for Stanford CS336 Spring 2025 lecture 11: Scaling, muP.

1 minCS336 · Scaling · muP

这篇是 Stanford CS336 Spring 2025 第 11 讲 Course Materials 的学习笔记。它从 scaling laws 的基本思想进入实践细节:怎么真正用小实验设计大模型。

1. Scaling 的现实问题#

第 9 讲说明 scaling laws 可以预测大规模训练,但实际落地还有很多问题:学习率是否随模型变、batch 如何选、Chinchilla 式拟合是否太贵、架构和参数化是否会破坏外推。

第 11 讲通过 CerebrasGPT、MiniCPM、DeepSeek、LLaMA 3、Hunyuan、MiniMax 等案例讨论这些问题。

2. muP 的动机#

Maximum update parametrization,也就是 muP,试图让超参数在 width scaling 时更稳定。它希望不同宽度模型在初始化和一次更新后的 activation scale 保持可比。

如果做得到,就可以在小模型上调学习率、初始化等超参数,然后迁移到更大模型。

这对大模型训练很有吸引力,因为大模型调参成本极高。

3. CerebrasGPT 与 MiniCPM 的路线#

CerebrasGPT 使用 Chinchilla recipe 并结合 muP,希望获得更可预测的 scaling 行为。

MiniCPM 则是更细致的实践案例:使用 muP 稳定初始化和学习率,固定 aspect ratio,然后通过小模型实验拟合 batch、LR、token-to-parameter ratio 等。

这些案例说明 scaling 不只是拟合 loss 曲线,也包括让实验设置本身可迁移。

4. WSD learning rate 的作用#

Chinchilla 风格分析往往需要从头训练许多不同数据量和模型大小的组合,成本很高。

WSD schedule 把学习率分成 warmup、stable、decay 三段。稳定阶段可以让训练持续收集中间点,最后从 stable 阶段分叉进入 decay,从而降低拟合不同 token budget 的成本。

这是一种很工程化的 scaling trick:不是改变理论,而是让实验设计更便宜。

5. DeepSeek、LLaMA 3 和更高 data ratio#

Lecture 11 提到一些近年模型使用了比 Chinchilla 20 tokens per parameter 更高的数据比例。例如 LLaMA 3 等模型使用更多 tokens 训练相对较小模型。

原因之一是现实部署中 inference 成本很重要。如果一个模型会被大量调用,训练时多花一些 compute,把模型做得更小更强,可能降低长期总成本。

因此 compute-optimal 不只有训练 compute 版本,也有考虑部署频率的版本。

6. muP 不是万能的#

课程也强调 muP 的局限。现代 Transformer 有 SwiGLU、RMSNorm gains、不同 batch size、特殊 initialization、weight decay、不同 optimizer 等组件,未必完全满足简化理论假设。

经验上 muP 常常有用,但也可能被某些设计打破。因此 scaling 实践需要同时依赖理论、ablation 和实际 loss 曲线。

7. takeaway#

第 11 讲的核心是:scaling laws 要变成训练 recipe,还需要一整套实验工程。

  • muP 让部分超参数更可能跨 scale 迁移;
  • WSD schedule 降低 Chinchilla 式拟合成本;
  • batch、LR、数据比例都可以通过小实验拟合;
  • 现代模型常常为了推理成本选择更高 tokens/parameter;
  • scaling 不是一次公式计算,而是一个实验设计流程。

参考#