LLM 語言模型指標新手村 (圖形聯動版)

用直覺的文字機率分佈與動態指數曲線,徹底搞懂 Perplexity(困惑度)與 Loss 的親密血緣!

語言模型「文字接龍」品質評估

核心白話:LLM 生成句子的本質就是「猜下一個字」的機率接龍。給定前文「我想吃」,如果模型非常篤定下一個字是「飯」,代表它不困惑 (Perplexity 極低);如果它覺得猜什麼都可以,代表它非常困惑 (Perplexity 極高)

👇 請選擇要測試的 LLM 大腦模型狀態:

🧠 給定前文「我想吃...」,下一個文字的預測機率分佈

📊 語言模型當前核心指標

📉 Perplexity (困惑度 / PPL) — 越低模型越聰明 1.25
📉 Cross-Entropy Loss (交叉熵損失) 0.223

幾何驚喜:困惑度其實就是 Loss 的指數函數!

💡 數學關係大解密 (已修復亂碼):許多初學者不知道,Perplexity 和 Loss 在數學上是同一件事。PPL 其實就是以常數 e (約等於 2.718) 為底數、Loss 數值為指數的上標函數。拉動下方滑桿調大 Loss,親眼看見黃色指針在曲線上的大爆炸!

📐 PPL 與 Loss 的孿生換算公式

PPL = e 0.30 = 1.35 (常數 e ≈ 2.718)

📈 困惑度隨 Loss 指數噴發動態曲線圖

Loss PPL 困惑度

🔷 Perplexity (PPL 困惑度)

模型在預測下一個字時,平均「要在多少個同樣看起來合理的候選字中猶豫不決」。PPL = 1.0 代表它每次都百分之百命中,完全不猶豫。

🔶 Cross-Entropy Loss (訓練損失)

優化器訓練時看的可微分平滑曲線。雖然 Loss 能指引前進方向,但數值(如 0.223)不夠具備直覺,因此評估模型時多轉換成 PPL 看板。

📝 iPAS 考點提醒

LLM 評估是 iPAS 生成式 AI 落地考點(中級科目一)。重點:不只看答得對不對,還含正確性與事實性、相關性、連貫性、安全與偏誤、指令遵循,以及效率(延遲、成本、token)。易混點:自動指標(困惑度、BLEU、ROUGE)抓不到語意與事實,需人工或 LLM-as-judge;幻覺與安全要專門評測(紅隊)。情境:選模型與設計(是否用 RAG)要綜合品質與成本。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

LLM 評估有哪些面向?

不只看答得對不對,還包括正確性與事實性、相關性、連貫性、安全與偏誤、指令遵循,以及效率(延遲、成本、token 數)。

自動指標和人工評估怎麼分工?

自動指標(BLEU、ROUGE、BERTScore、困惑度)快但抓不到語意與事實;人工或 LLM-as-judge 評細緻品質,實務常兩者並用。

什麼是 LLM-as-judge?

用一個強 LLM 當評審,依規準對另一模型的輸出評分或比較;可規模化、與人類偏好相關度高,但需注意評審本身的偏誤。

怎麼衡量幻覺與安全?

用事實一致性與真實性基準、紅隊測試(red-teaming)誘發不當輸出、偏誤與毒性檢測;高風險場景尤其重要。

為什麼也要看成本與延遲?

上線要顧體驗與預算;同樣品質下,token 用量、回應速度與費用是選模型與設計(是否用 RAG、模型大小)的關鍵。

🧭 相關主題

← 返回 AI 學習與考證地圖