← 返回 AI 學習與考證地圖
半監督式學習 · Semi-Supervised

只有少數答案,怎麼教會整批資料?

真實世界裡「標註」很貴:少量資料有標籤、大量沒有。半監督式學習用少量種子標籤 + 大量未標籤資料一起訓練,讓標籤從已知點「傳播」到相似的未知點。

互動動畫:標籤從 2 個種子點傳播出去

一開始每群只有「1 個」帶顏色的種子(外圈標記),其餘都是灰色未標籤。每按一次「傳播一步」,離已標籤點最近、最有把握的未標籤點就會被貼上偽標籤——像漣漪一樣往外擴散。

已標籤 2 / 122
未標籤 類別 A 類別 B ⭕ 外圈 = 原始種子標籤

五種半監督式方法

核心都是「想辦法把未標籤資料用起來」,差別在怎麼產生與傳播偽標籤。

自訓練 Self-Training

用已標籤訓練模型,再把高信心預測加入訓練集,反覆疊代。最簡單的起點。

偽標籤 Pseudo-Labeling

把模型對未標籤的預測當「偽標籤」一起訓練,深度學習常用,搭配資料增強更穩。

協同訓練 Co-Training

兩個不同視角的分類器互相教學,各自用高信心預測擴充對方的訓練集。

標籤傳播 Label Propagation

建圖、假設相似樣本同標籤,沿著邊把標籤從已標節點傳到未標節點。

一致性正則化 Consistency Reg.

對同一筆資料加微擾,要求模型輸出一致,逼模型學到穩健的決策邊界。

什麼時候用?

標註成本高(醫療影像、法律文件) 未標籤資料很多 文本 / 影像分類 語意分割 跨語言分類

iPAS 考點提醒

情境題:只有少部分影像有專家標註,其餘大量未標註,結合兩者一起建模——屬於哪一種學習?
關鍵字:少量標籤 + 大量未標籤、一起訓練半監督式
常見陷阱

別把它當成「監督式」(那需要全標註),也不是「非監督式」(那完全沒標籤)。半監督式的精神是用未標籤資料補強少量標籤。自訓練的偽標籤若品質差,錯誤會被放大——信心閾值很重要。