生成式 AI · 可靠性與評測

AI 幻覺 與 LLM-as-Judge

LLM 會「一本正經地胡說八道」——為什麼?又怎麼降低?而當我們改用 AI 去評 AI,這個「裁判」本身又藏著哪些偏見?兩個互動一次看懂。

幻覺 Hallucination下一詞預測RAG 緩解LLM-as-Judge位置偏誤長度偏誤

💡一句話定義

幻覺(Hallucination)=LLM 產生看似合理、語氣自信,實際上卻錯誤或虛構的內容(假事實、假來源、不存在的人事物)。
LLM-as-Judge(用 AI 當評審)=用一個強語言模型去自動評分或排序其他模型的回答,省下大量人力;但這個「裁判」本身也帶有偏誤,要小心使用。

🧪互動:幻覺實驗室

問一個模型其實不知道的問題(有些甚至是假前提),看它怎麼自信地編;再切換不同緩解手段,觀察哪些真的有效、哪些只是心理安慰。

🧪 幻覺實驗室
幻覺風險

🤔為什麼 LLM 會幻覺?

LLM 的訓練目標是預測下一個最可能的字、把話講得流暢自然不是「說真話」。它沒有內建「我不知道」的開關——遇到訓練沒看過、過時(知識截止)或很冷門的東西,它為了當個好助理,往往用聽起來合理的內容補上空缺,於是自信地編。取樣隨機性(溫度)與缺乏可查證的來源,也讓它更容易走偏。

🛡️怎麼降低幻覺?

📚RAG 接地
回答前先檢索外部資料當依據,查不到就說查不到。最有效
🙅允許棄答
讓模型可以誠實說「不確定」、要求提供出處與引用。
🧭對齊與提示
用 RLHF 對齊「誠實」、提示要求逐步推理或自我查核。
🌡️降低溫度(有限)
讓輸出更集中,但補不上知識缺口,不能單靠它。

關鍵心法:幻覺常是「知識缺口」問題。給它正確的資料(RAG)或允許它承認不知道,比單純調參數有效得多。

⚖️用 AI 評 AI:LLM-as-Judge

人工評測又慢又貴,於是大家改用強模型當「評審」:給它問題與兩個回答,請它打分或選出比較好的一個。這用於模型評測、排行榜、甚至 RLHF 的偏好標註。方便,但裁判會受一些與內容無關的因素影響——下面這個互動就抓給你看。

⚖️ AI 評審的位置偏誤
位置 A
位置 B

⚠️評審的三種偏誤與去偏

偏誤意思去偏做法
位置偏誤偏好排在前面(或固定某位置)的答案交換順序各評一次、取一致結果
長度偏誤偏好比較長、看起來豐富的答案控制長度、用評分準則看實質
自我偏好偏好和自己風格/同家族的輸出換不同評審、對齊人工標註校準
其他實用做法:提供明確評分準則(rubric)參考答案、用多個評審投票、並定期拿人工標註校準。AI 評審是好用的加速器,但別把它當唯一真理。

自我檢測

Q1. 什麼是 AI 幻覺?
LLM 產生看似合理、語氣自信,實際卻錯誤或虛構的內容(假事實、假來源、不存在的人事物)。
Q2. LLM 為什麼會幻覺?
它被訓練來預測「最可能、最流暢的下一個字」,不是說真話;又沒有內建「我不知道」,遇到知識缺口就用合理內容補上,於是自信地編。
Q3. 降低幻覺最有效的方法?
用 RAG 把回答接地在可查證的外部資料上;並允許模型誠實棄答、要求引用。單純降低溫度補不上知識缺口。
Q4. LLM-as-Judge 是什麼?
用強語言模型自動評分/排序其他模型的回答,取代昂貴的人工評測,也用於排行榜與 RLHF 偏好標註。
Q5. AI 評審有哪些偏誤、怎麼去偏?
位置偏誤、長度偏誤、自我偏好等。去偏:交換順序取一致、用評分準則與參考答案、多評審投票、對齊人工校準。

🎯重點整理

📝 iPAS 考點提醒

幻覺(Hallucination)與 LLM 評測是 iPAS 生成式 AI 的重要考點。幻覺=模型自信產生看似合理卻錯誤/虛構的內容;成因是「預測下一個最可能的字」的訓練目標、缺少「我不知道」機制、知識缺口與截止。緩解:RAG 接地(最有效)、允許棄答與要求引用、RLHF 對齊誠實、降低溫度(有限,補不上知識缺口)。LLM-as-Judge=用強模型自動評分/排序其他輸出,省人力並用於排行榜與 RLHF 標註;易混點:評審有位置偏誤、長度偏誤、自我偏好。去偏:交換順序取一致、用評分準則(rubric)與參考答案、多評審投票、對齊人工校準。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

什麼是 AI 幻覺?

LLM 產生看似合理、語氣自信,實際卻錯誤或虛構的內容(假事實、假來源、不存在的人事物)。

LLM 為什麼會幻覺?

它被訓練來預測最可能、最流暢的下一個字,不是說真話;又沒有內建「我不知道」,遇到知識缺口就用合理內容補上,於是自信地編。

降低幻覺最有效的方法?

用 RAG 把回答接地在可查證的外部資料上,並允許模型誠實棄答、要求引用;單純降低溫度補不上知識缺口。

LLM-as-Judge 是什麼?

用強語言模型自動評分或排序其他模型的回答,取代昂貴的人工評測,也用於排行榜與 RLHF 偏好標註。

AI 評審有哪些偏誤、怎麼去偏?

位置偏誤、長度偏誤、自我偏好等;去偏:交換順序取一致、用評分準則與參考答案、多評審投票、對齊人工校準。

🧭 相關主題

← 返回 AI 學習與考證地圖