生成式 AI · LLM 對齊

RLHF 人類回饋強化學習

剛預訓練完的模型只會「接話」,不一定有用、也不一定安全。RLHF 用人類的偏好把它「調教變乖」——這就是 GPT 變成 ChatGPT 的關鍵一步。

人類偏好排序獎勵模型PPO 強化學習對齊 Alignment3HDPO

💡一句話定義

RLHF(Reinforcement Learning from Human Feedback,人類回饋的強化學習)=先讓人類對模型的多個回答排序,用這些偏好訓練一個會「幫回答打分」的獎勵模型,再用強化學習(PPO)讓語言模型往高分方向更新,把它對齊成有幫助、無害、誠實的助理。

🎮互動:把「原始模型」調教變乖

照著三步走: 你當人類老師排序回答 → 訓練獎勵模型 → 用 PPO 把模型對齊。最後還能拿掉 KL 約束,看它怎麼「獎勵駭客」翻車。

🧭 RLHF 對齊訓練 互動演示
原始模型(未對齊)
1你來當人類老師:哪個回答比較好?
回答 A
回答 B
2用你的偏好訓練「獎勵模型」

獎勵模型學會:把人類偏好的回答打高分、不喜歡的打低分。

✅ 好回答
❌ 壞回答
3用 PPO 把模型往高分方向對齊
0%

🤔為什麼需要 RLHF?

預訓練只教模型一件事:接著上文,預測最可能的下一個字。這讓它很會「像人一樣講話」,卻不保證有用、安全、說真話——它可能一本正經地亂編、講話沒禮貌,甚至照著危險要求照做。RLHF 的核心是用人類偏好告訴模型「哪種回答比較好」,把它對齊(alignment)到人類真正想要的行為。

🔁RLHF 三階段:SFT → RM → PPO

📝① 監督微調 SFT
先用人寫的示範答案,教模型「照指令好好回答」,打基礎。
⚖️② 獎勵模型 RM
人類對多個回答排序,訓練一個會「幫回答打分」的模型。
🚀③ 強化學習 PPO
模型生成→RM 打分→往高分更新;加 KL 約束別偏離原模型太遠。

獎勵模型怎麼學?用人類的「A 比 B 好」訓練它,讓被偏好的回答分數更高(Bradley–Terry):

$$ P(y_A \succ y_B) = \sigma\big(r(y_A) - r(y_B)\big) $$ σ 是 sigmoid:兩個回答的分數差越大,人類偏好 A 的機率越接近 1。

🎯PPO 的目標:追高分,但別走鐘

強化學習階段要「最大化獎勵分數」,同時用一個 KL 懲罰項把模型拉住、別離原本的語言模型太遠,否則會為了衝分數而胡言亂語:

$$ \max_{\pi_\theta}\; \mathbb{E}\big[\, r(x,y) \,\big] \;-\; \beta\,\mathrm{KL}\!\left[\pi_\theta \,\|\, \pi_{\text{ref}}\right] $$ 左邊:讓獎勵分數 r 越高越好。右邊:KL 懲罰,β 越大越保守,避免「獎勵駭客」。

🧭對齊的三個目標:3H

RLHF 想把模型對齊到 3HHelpful(有幫助)Harmless(無害)Honest(誠實)。三者常有拉扯——例如「無害」可能讓模型過度拒絕,「有幫助」又不能犧牲安全,調教就是在這中間找平衡。

⚖️RLHF vs DPO

DPO(Direct Preference Optimization,直接偏好最佳化)是近年很紅的簡化做法:跳過「單獨訓練獎勵模型 + 跑 RL」,直接用偏好資料調整模型,讓「較佳回答」的機率高過「較差回答」。

面向RLHF(PPO)DPO
獎勵模型要另外訓練一個 RM不用,直接吃偏好資料
流程SFT → RM → RL,三段較複雜一步到位,較簡單
穩定性RL 調參敏感、易不穩像監督學習,好訓練、較穩
本質先學打分,再用 RL 追高分直接拉高「較佳答案」的機率

⚠️常見副作用:獎勵駭客、諂媚、對齊稅

獎勵駭客(Reward Hacking):模型鑽獎勵模型的漏洞衝高分,卻沒真的變好(例如空洞討好、灌一堆看似正確的廢話)。諂媚(Sycophancy):為了討喜而附和使用者、不敢說真話。對齊稅(Alignment Tax):對齊後某些原始能力可能略微下降。這也是為什麼要 KL 約束、更好的獎勵訊號與持續評估。

自我檢測

Q1. RLHF 是什麼?
用人類偏好排序訓練獎勵模型,再用強化學習(PPO)讓語言模型往高分方向更新,把它對齊成有幫助、無害、誠實的助理。
Q2. RLHF 有哪三個階段?
① 監督微調 SFT(用示範答案打基礎)→ ② 獎勵模型 RM(人類排序、學會打分)→ ③ 強化學習 PPO(往高分更新,加 KL 約束)。
Q3. 為什麼 PPO 要加 KL 約束?
避免模型為了衝獎勵分數而偏離原本的語言模型、胡言亂語或鑽漏洞(獎勵駭客)。KL 懲罰把它拉住,兼顧分數與語言品質。
Q4. RLHF 和 DPO 差在哪?
RLHF 要先訓練獎勵模型再跑 RL,三段較複雜、調參敏感;DPO 跳過獎勵模型與 RL,直接用偏好資料優化,較簡單穩定。
Q5. 對齊的 3H 是什麼?
Helpful(有幫助)、Harmless(無害)、Honest(誠實);三者常需權衡取捨。

🎯重點整理

📝 iPAS 考點提醒

RLHF(人類回饋強化學習)是 iPAS 生成式 AI 的高頻考點,也是 LLM「對齊」的代表方法。核心三階段:SFT 監督微調 → 獎勵模型 RM(人類對回答排序、學會打分)→ 強化學習 PPO(往高分更新,並用 KL 約束避免走鐘)。對齊目標記 3H:Helpful、Harmless、Honest。易混點:獎勵模型是「打分」不是「產生答案」;PPO 的 KL 約束是為了防止獎勵駭客(Reward Hacking)與胡言亂語。延伸:DPO 直接用偏好資料最佳化、跳過 RM 與 RL,較簡單穩定。副作用:獎勵駭客、諂媚(Sycophancy)、對齊稅(Alignment Tax)。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

RLHF 是什麼?

用人類偏好排序訓練獎勵模型,再用強化學習(PPO)讓語言模型往高分方向更新,把它對齊成有幫助、無害、誠實的助理。

RLHF 有哪三個階段?

① 監督微調 SFT(用示範答案打基礎)→ ② 獎勵模型 RM(人類排序、學會打分)→ ③ 強化學習 PPO(往高分更新,加 KL 約束)。

為什麼 PPO 要加 KL 約束?

避免模型為了衝獎勵分數而偏離原本語言模型、胡言亂語或鑽漏洞(獎勵駭客);KL 懲罰把它拉住,兼顧分數與語言品質。

RLHF 和 DPO 差在哪?

RLHF 要先訓練獎勵模型再跑 RL,三段較複雜、調參敏感;DPO 跳過獎勵模型與 RL,直接用偏好資料優化,較簡單穩定。

對齊的 3H 是什麼?

Helpful(有幫助)、Harmless(無害)、Honest(誠實),三者常需權衡取捨。

🧭 相關主題

← 返回 AI 學習與考證地圖