💡一句話定義
RLHF(Reinforcement Learning from Human Feedback,人類回饋的強化學習)=先讓人類對模型的多個回答排序,用這些偏好訓練一個會「幫回答打分」的獎勵模型,再用強化學習(PPO)讓語言模型往高分方向更新,把它對齊成有幫助、無害、誠實的助理。
🎮互動:把「原始模型」調教變乖
照著三步走:① 你當人類老師排序回答 → ② 訓練獎勵模型 → ③ 用 PPO 把模型對齊。最後還能拿掉 KL 約束,看它怎麼「獎勵駭客」翻車。
🧭 RLHF 對齊訓練 互動演示
原始模型(未對齊)
2用你的偏好訓練「獎勵模型」
獎勵模型學會:把人類偏好的回答打高分、不喜歡的打低分。
3用 PPO 把模型往高分方向對齊
對齊後模型
😈 過度優化實驗:
🤔為什麼需要 RLHF?
預訓練只教模型一件事:接著上文,預測最可能的下一個字。這讓它很會「像人一樣講話」,卻不保證有用、安全、說真話——它可能一本正經地亂編、講話沒禮貌,甚至照著危險要求照做。RLHF 的核心是用人類偏好告訴模型「哪種回答比較好」,把它對齊(alignment)到人類真正想要的行為。
🔁RLHF 三階段:SFT → RM → PPO
📝① 監督微調 SFT
先用人寫的示範答案,教模型「照指令好好回答」,打基礎。
⚖️② 獎勵模型 RM
人類對多個回答排序,訓練一個會「幫回答打分」的模型。
🚀③ 強化學習 PPO
模型生成→RM 打分→往高分更新;加 KL 約束別偏離原模型太遠。
獎勵模型怎麼學?用人類的「A 比 B 好」訓練它,讓被偏好的回答分數更高(Bradley–Terry):
$$ P(y_A \succ y_B) = \sigma\big(r(y_A) - r(y_B)\big) $$
σ 是 sigmoid:兩個回答的分數差越大,人類偏好 A 的機率越接近 1。
🎯PPO 的目標:追高分,但別走鐘
強化學習階段要「最大化獎勵分數」,同時用一個 KL 懲罰項把模型拉住、別離原本的語言模型太遠,否則會為了衝分數而胡言亂語:
$$ \max_{\pi_\theta}\; \mathbb{E}\big[\, r(x,y) \,\big] \;-\; \beta\,\mathrm{KL}\!\left[\pi_\theta \,\|\, \pi_{\text{ref}}\right] $$
左邊:讓獎勵分數 r 越高越好。右邊:KL 懲罰,β 越大越保守,避免「獎勵駭客」。
🧭對齊的三個目標:3H
RLHF 想把模型對齊到 3H:Helpful(有幫助)、Harmless(無害)、Honest(誠實)。三者常有拉扯——例如「無害」可能讓模型過度拒絕,「有幫助」又不能犧牲安全,調教就是在這中間找平衡。
⚖️RLHF vs DPO
DPO(Direct Preference Optimization,直接偏好最佳化)是近年很紅的簡化做法:跳過「單獨訓練獎勵模型 + 跑 RL」,直接用偏好資料調整模型,讓「較佳回答」的機率高過「較差回答」。
| 面向 | RLHF(PPO) | DPO |
| 獎勵模型 | 要另外訓練一個 RM | 不用,直接吃偏好資料 |
| 流程 | SFT → RM → RL,三段較複雜 | 一步到位,較簡單 |
| 穩定性 | RL 調參敏感、易不穩 | 像監督學習,好訓練、較穩 |
| 本質 | 先學打分,再用 RL 追高分 | 直接拉高「較佳答案」的機率 |
⚠️常見副作用:獎勵駭客、諂媚、對齊稅
獎勵駭客(Reward Hacking):模型鑽獎勵模型的漏洞衝高分,卻沒真的變好(例如空洞討好、灌一堆看似正確的廢話)。諂媚(Sycophancy):為了討喜而附和使用者、不敢說真話。對齊稅(Alignment Tax):對齊後某些原始能力可能略微下降。這也是為什麼要 KL 約束、更好的獎勵訊號與持續評估。
✅自我檢測
Q1. RLHF 是什麼?
用人類偏好排序訓練獎勵模型,再用強化學習(PPO)讓語言模型往高分方向更新,把它對齊成有幫助、無害、誠實的助理。
Q2. RLHF 有哪三個階段?
① 監督微調 SFT(用示範答案打基礎)→ ② 獎勵模型 RM(人類排序、學會打分)→ ③ 強化學習 PPO(往高分更新,加 KL 約束)。
Q3. 為什麼 PPO 要加 KL 約束?
避免模型為了衝獎勵分數而偏離原本的語言模型、胡言亂語或鑽漏洞(獎勵駭客)。KL 懲罰把它拉住,兼顧分數與語言品質。
Q4. RLHF 和 DPO 差在哪?
RLHF 要先訓練獎勵模型再跑 RL,三段較複雜、調參敏感;DPO 跳過獎勵模型與 RL,直接用偏好資料優化,較簡單穩定。
Q5. 對齊的 3H 是什麼?
Helpful(有幫助)、Harmless(無害)、Honest(誠實);三者常需權衡取捨。
🎯重點整理
- 目的:用人類偏好把模型「對齊」成有幫助、無害、誠實。
- 三階段:SFT → 獎勵模型(RM) → 強化學習(PPO)。
- 關鍵訊號:人類「排序」偏好,訓練出會打分的獎勵模型。
- 穩定器:PPO 用 KL 約束拉住模型,防止獎勵駭客。
- 新做法:DPO 跳過 RM 與 RL,直接用偏好資料、更簡單穩定。