Knowledge Distillation — 大模型當老師,教小模型學會精華
想像一個資深教授(大模型)要把畢生所學傳給一個年輕助教(小模型):
參數太多(幾十億)、推論慢、需要昂貴 GPU、無法部署到手機或邊緣設備。
參數少(幾百萬)、推論快、手機也能跑、效果接近大模型的 90%+。
「80% 貓、15% 虎」比「100% 貓」包含更多資訊。小模型學到了類別之間的相似關係(暗知識)。
| 角色 | 說明 |
|---|---|
| 教師模型 | 大而準,提供「軟標籤」(機率分布) |
| 學生模型 | 小而快,學教師的軟標籤 |
| 軟標籤 | 含類別間相似度的暗知識 |
| 溫度 T | 調高使分布更平、暴露暗知識 |
知識蒸餾用大教師模型訓練小學生模型,iPAS 模型壓縮考點(中級科目三)。重點:學生學教師的軟標籤(機率分布含類別間關係),在更小體積下逼近大模型表現;常調高溫度傳遞更多暗知識。易混點:它是壓縮與加速手段(便於部署到手機、邊緣),與微調、剪枝、量化並列;不是讓模型更準的萬靈丹。情境:把大模型部署到資源有限裝置。
想練情境題與詳解 → AI 學習與考證地圖
用大教師模型的輸出去訓練小學生模型,讓小模型學到大模型的知識,在更小體積下逼近其表現。
教師的機率分布(軟標籤)含類別間關係(如貓比較像狗、不像車),比硬標籤資訊更豐富,學生學得更好。
提高 softmax 溫度讓機率分布更平滑、凸顯次要類別的相對關係;蒸餾時常調高溫度以傳遞更多暗知識。
壓縮模型、加速推論、降成本與耗能,便於部署到手機或邊緣裝置,同時盡量保留準確率。
除了學輸出(response),還可學中間特徵(feature)、關係(relation);也用於自蒸餾與大型語言模型壓縮。