Nathan Lambert 著。一本聚焦語言模型的 RLHF 與後訓練(post-training)簡明導論:從指令微調、獎勵模型,到 PPO/GRPO、DPO、拒絕採樣與推理模型。每一章都附有互動實驗,邊玩邊懂核心概念。
由台灣 Twinkle AI Community 翻譯維護的非官方社群翻譯版本。