繁體中文全譯本 · 互動版

從人類回饋中強化學習
Reinforcement Learning from Human Feedback

Nathan Lambert 著。一本聚焦語言模型的 RLHF 與後訓練(post-training)簡明導論:從指令微調、獎勵模型,到 PPO/GRPO、DPO、拒絕採樣與推理模型。每一章都附有互動實驗,邊玩邊懂核心概念。

由台灣 Twinkle AI Community 翻譯維護的非官方社群翻譯版本。

17章節
3附錄
49插圖
20互動實驗
—GitHub ★

章節

互動實驗第 1 章導論IntroductionRLHF 是什麼、為何誕生、三步驟流程與後訓練的整體直覺。 互動實驗第 2 章RLHF 簡史A Tiny History of RLHF從偏好式 RL 的起源、語言模型時代,到 ChatGPT 之後的爆發。 互動實驗第 3 章訓練總覽Training Overview問題形式化、RL 設定的調整,與 InstructGPT/Tülu 3/DeepSeek R1 的經典配方。 互動實驗第 4 章指令微調Instruction Fine-Tuning聊天模板、指令資料的最佳實務與實作細節。 互動實驗第 5 章獎勵模型Reward ModelingBradley-Terry 模型、架構與實作、ORM/PRM 與 LLM-as-a-judge。 互動實驗第 6 章強化學習Reinforcement Learning策略梯度推導、REINFORCE/PPO/GRPO 全家族與實作要點。 互動實驗第 7 章推理與推論時擴展Reasoning & Inference-Time ScalingRLVR 的角色、推理模型的起源與訓練慣例。 互動實驗第 8 章直接對齊演算法Direct-Alignment AlgorithmsDPO 的原理與完整推導、數值疑慮與線上/離線之辨。 互動實驗第 9 章拒絕採樣Rejection Sampling生成、評分、微調的逐步流程與 Best-of-N 採樣。 互動實驗第 10 章偏好的本質The Nature of Preferences從經濟學、哲學到最適控制:偏好與效用的跨領域根源。 互動實驗第 11 章偏好資料Preference Data標註介面、排序與評分、資料來源與偏誤陷阱。 互動實驗第 12 章合成資料與蒸餾Synthetic Data & Distillation蒸餾、on-policy 師生訓練、AI 回饋與憲法式 AI。 互動實驗第 13 章工具使用與函式呼叫Tool Use & Function Calling工具呼叫的生成交織、多步驟推理與 MCP。 互動實驗第 14 章過度最佳化Over-OptimizationGoodhart 定律、代理目標的質性與量化失控。 互動實驗第 15 章正則化RegularizationKL 懲罰、隱性正則化,與「SFT 記憶、RL 泛化」。 互動實驗第 16 章評估Evaluation提示格式、外部評比為何不可靠、污染與工具鏈。 互動實驗第 17 章打造模型性格與產品Model Character & Products性格訓練、persona 向量、模型規格與產品週期。

附錄與文獻

互動實驗附錄 A定義Definitions全書使用的符號、定義與延伸詞彙表。 互動實驗附錄 B不只是「風格」Beyond "Just Style"為何風格是溝通的載體,以及話多的平衡。 互動實驗附錄 C實務議題Practical Issues後訓練的運算成本、評估變異與異常任務辨識。 參考文獻參考文獻Bibliography全書引用文獻(保留原文)。