🎓 知識蒸餾 互動動畫

Knowledge Distillation — 大模型當老師,教小模型學會精華

💡 白話說明

想像一個資深教授(大模型)要把畢生所學傳給一個年輕助教(小模型):

📌 考試重點:知識蒸餾的目的是「降低推論成本、方便部署到邊緣設備」。不是從零訓練,而是讓大模型的知識「濃縮」到小模型裡。
T=1
調整溫度觀察 Soft Label 變化

🧠 為什麼要蒸餾?

大模型的問題

參數太多(幾十億)、推論慢、需要昂貴 GPU、無法部署到手機或邊緣設備。

蒸餾後的小模型

參數少(幾百萬)、推論快、手機也能跑、效果接近大模型的 90%+。

Soft Label 的秘密

「80% 貓、15% 虎」比「100% 貓」包含更多資訊。小模型學到了類別之間的相似關係(暗知識)。

📊 知識蒸餾角色
角色說明
教師模型大而準,提供「軟標籤」(機率分布)
學生模型小而快,學教師的軟標籤
軟標籤含類別間相似度的暗知識
溫度 T調高使分布更平、暴露暗知識
✅ 自我檢測
知識蒸餾是什麼?
用大「教師」模型的輸出(軟標籤)訓練小「學生」模型,讓小模型逼近大模型表現,兼顧效能與速度。
學生為什麼學軟標籤?
軟標籤(如貓 0.7、狗 0.2、車 0.01)含類別間相似度的「暗知識」,比只有 0/1 硬標籤資訊更豐富。
溫度的作用?
提高 softmax 溫度 T 讓機率分布更平滑,放大非目標類的資訊,讓學生學到更多暗知識。
🎯 重點整理
  1. 蒸餾=用教師軟標籤訓練小學生。
  2. 軟標籤含類別相似的暗知識。
  3. 溫度 T 調高暴露更多暗知識。
  4. 好處:壓縮模型、加速推論、省資源。
  5. 變體:自蒸餾、特徵蒸餾、TinyBERT。

📝 iPAS 考點提醒

知識蒸餾用大教師模型訓練小學生模型,iPAS 模型壓縮考點(中級科目三)。重點:學生學教師的軟標籤(機率分布含類別間關係),在更小體積下逼近大模型表現;常調高溫度傳遞更多暗知識。易混點:它是壓縮與加速手段(便於部署到手機、邊緣),與微調、剪枝、量化並列;不是讓模型更準的萬靈丹。情境:把大模型部署到資源有限裝置。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

知識蒸餾是什麼?

用大教師模型的輸出去訓練小學生模型,讓小模型學到大模型的知識,在更小體積下逼近其表現。

學生為什麼學軟標籤?

教師的機率分布(軟標籤)含類別間關係(如貓比較像狗、不像車),比硬標籤資訊更豐富,學生學得更好。

溫度(temperature)的作用?

提高 softmax 溫度讓機率分布更平滑、凸顯次要類別的相對關係;蒸餾時常調高溫度以傳遞更多暗知識。

知識蒸餾有什麼好處?

壓縮模型、加速推論、降成本與耗能,便於部署到手機或邊緣裝置,同時盡量保留準確率。

有哪些變體?

除了學輸出(response),還可學中間特徵(feature)、關係(relation);也用於自蒸餾與大型語言模型壓縮。

🧭 相關主題

← 返回 AI 學習與考證地圖