💡一句話定義
溫度(Temperature)是控制生成隨機與創意程度的參數:溫度低→輸出更確定、保守、可重現(適合事實問答、程式);溫度高→更多樣、有創意,但也更可能離題或出錯(適合發想、創作)。它只調整「機率分布的尖銳度」,不改變模型本身。
🎮互動:參數實驗室
拖曳 Temperature 拉桿,看下方機率分布如何被「拉平」或「凸顯」,以及 AI 抽出的下一個詞怎麼變。再玩玩 Top-K / Top-P / 懲罰項。
⚙️ 參數實驗室
拖曳拉桿,觀察機率分佈與生成的詞彙。
越高越瘋狂 (拉平機率),越低越死板 (凸顯最高機率)。
無情斬斷排名 K 之後的選項。
保留累積機率達到 P 的選項,尾巴太長的怪詞會被剔除。
降低「常規童話詞彙」(如公主、寶藏) 的分數,逼 AI 發揮創意。
只要出現過就扣分,讓 AI 轉移話題(例如突然聊起房地產)。
📊 AI 腦內的「下一個詞」機率分佈
※ 註:此圖表顯示之百分比,為原始權重 (Logits) 經過 Softmax 函數 轉換,並套用各項參數後的最終抽樣機率。
🧮數學上做了什麼?
取樣前,把每個字的原始分數 logits 除以溫度 T,再送進 softmax:
pi = exp(zi / T) / Σj exp(zj / T)
T 小 → 放大分數差異,機率更集中在最可能的字;T 大 → 分布更平,低機率字也有機會被選中。
當 T → 0,幾乎永遠選機率最高的字(等同 greedy/argmax,最確定);T 越大,越接近「隨便亂選」的均勻分布。
⚖️低溫 vs 高溫
| 面向 | 低溫(T → 0) | 高溫(T > 1) |
|---|---|---|
| 機率分布 | 尖銳、集中在最高分 | 平坦、雨露均霑 |
| 輸出 | 確定、保守、可重現 | 多樣、有創意、每次不同 |
| 適合 | 事實問答、程式、資料抽取 | 故事創作、腦力激盪、命名 |
| 風險 | 呆板、重複、無聊 | 離題、胡言亂語、不穩定 |
🎚️取樣三兄弟
🌡️Temperature
調整整體分布形狀:拉平或凸顯,控制隨機性強弱。
調整整體分布形狀:拉平或凸顯,控制隨機性強弱。
🔢Top-K
只從機率前 K 名候選裡抽,直接砍掉尾巴的怪詞。
只從機率前 K 名候選裡抽,直接砍掉尾巴的怪詞。
🎯Top-P(核取樣)
從累積機率達 P 的最小候選集裡抽,動態決定範圍。
從累積機率達 P 的最小候選集裡抽,動態決定範圍。
🧭該怎麼設?
要正確與一致(事實問答、程式碼、資料抽取)→ 用低溫(接近 0),例如客服、報表要穩。要發想與創作(寫故事、取名、腦力激盪)→ 用較高溫。溫度常與 Top-K / Top-P 搭配使用:溫度定「隨機強度」,Top-K/P 負責「剪掉離譜候選」。
⚠️常見誤解
溫度不會讓模型變聰明或改變它學到的知識,只調整輸出分布的尖銳度。設太高會胡言亂語、不穩定;設太低(趨近 0)每次幾乎一樣、可能呆板重複。它是「取樣策略」,不是「能力開關」。
✅自我檢測
Q1. 溫度到底控制什麼?
控制生成的隨機/創意程度。低溫→確定保守可重現;高溫→多樣有創意但易離題。它只調機率分布尖銳度,不改模型本身。
Q2. 數學上溫度怎麼運作?
softmax 前把 logits 除以 T。T 小放大分數差異、更集中於最可能字;T 大讓分布更平、低機率字也有機會被選。
Q3. 事實問答該用高溫還是低溫?
低溫(接近 0)。需要正確、一致、可重現的任務(問答、程式、抽取)都用低溫;創作、發想才用高溫。
Q4. 溫度和 Top-K、Top-P 差在哪?
都影響取樣多樣性。溫度調整整體分布形狀;Top-K 只從前 K 個候選選;Top-P 從累積機率達 P 的候選選。三者常搭配使用。
🎯重點整理
- 是什麼:控制生成隨機/創意程度的取樣參數。
- 怎麼算:softmax 前 logits ÷ T。
- 低溫:集中、保守、可重現 → 事實類。
- 高溫:平坦、多樣、有創意 → 創作類。
- 搭配:與 Top-K / Top-P 一起決定輸出風格。