用智慧自適應文本對齊圖,秒懂 BLEU(翻譯精準)與 ROUGE(摘要召回)的動態制衡!
核心白話:評估 AI 寫的英文好不好,最快的方式是拿去跟「人類專家寫的標準答案(Reference)」做單字比對。BLEU 專注於 Precision(AI 猜的字有多少猜對,別瞎編);ROUGE 專注於 Recall(人類標準字有多少被 AI 成功抓到,別漏意)。
除了用機器去對答案單字以外,評估 GPT 還有兩個不可或缺的維度:模型自己講話通不通順(Perplexity)、以及在現實世界中寫程式或回答問題的真正實力(Human Eval)。
最適用場景: 機器翻譯(Machine Translation)。
特點: 它是 Precision(精準率)的化身。分子看「AI 猜對了幾個字」,分母看「AI 總共吐出了幾個字」。如果 AI 為了逃避責任故意說得非常短,它還會觸發簡短懲罰因子(Brevity Penalty)扣分。適合不容許胡言亂語的硬核翻譯任務。
最適用場景: 自動文本摘要(Text Summarization)。
特點: 它是 Recall(召回率)的化身。分母看「人類專家給的標準答案總字數」。摘要任務最怕漏掉核心大意,哪怕 AI 自己多碎念了幾句(Precision低),只要把標準答案裡的關鍵要點全部抓齊(Recall高),ROUGE 就會給予高分評價。
生成式模型(GPT 類)的評估是 iPAS 生成式 AI 考點(中級科目一)。重點:自動指標有困惑度(Perplexity,流暢度)、BLEU 與 ROUGE(與參考的詞重疊,翻譯或摘要)、BERTScore(語意相似)。易混點:自動指標抓不到事實正確性與有用性,生成品質常需人工或 LLM-as-judge;低困惑度不等於內容正確。情境:評估摘要、翻譯、對話品質與幻覺。
想練情境題與詳解 → AI 學習與考證地圖
生成是開放式、沒有唯一正解;不像分類有標準答案,需用多種自動指標加人工評估綜合判斷。
困惑度(Perplexity,語言流暢度)、BLEU 與 ROUGE(與參考答案的詞重疊,用於翻譯與摘要)、BERTScore(語意相似)等。
衡量語言模型對測試文本的驚訝程度,越低代表越能預測該文本、越流暢;但低困惑度不等於內容正確或有用。
自動指標抓不到事實正確性、連貫性、有用性與安全;生成品質常需人工或用更強模型(LLM-as-judge)評分。
用事實一致性檢查、要求附來源、與知識庫比對,或專門的真實性基準;RAG 也能降低並便於查證。