Self-Training · 半監督式

自訓練 Self-Training

用模型自己的高信心預測,回收成新標籤

只有少量標籤怎麼辦?讓模型先學會一點,再把最有把握的猜測當真標籤加回去,反覆滾大訓練集。

標註資料 → 訓練 → 預測未標註 → 收高信心者 → 再訓練(循環)
01 — 白話直覺

用自己的預測,教自己進步

半監督式學習介於兩者之間:只有少量資料有標籤,但有大量沒標籤的資料。它想辦法讓沒標籤的資料也派上用場,省下昂貴的人工標註。

自訓練的流程像「滾雪球」:先用少量有標籤資料訓練一個模型 → 讓它去預測沒標籤的資料 → 把最有把握的預測當成新標籤加進訓練集 → 重新訓練。一輪一輪,標籤越滾越多。

一句話

自訓練 = 模型把自己最有信心的猜測,當成真標籤回收再利用。風險:如果一開始猜錯又很有信心,錯誤會被放大(error propagation)。

02 — 核心互動

一步步看標籤怎麼滾大

畫面中只有兩個有顏色(有標籤)的點,其餘灰點都沒標籤。按「下一輪」:模型會把離已知點最近、最有把握的灰點染色(賦予偽標籤),雪球越滾越大。

已標註
2
未標註
輪數
0

觀察染色從兩顆種子向外擴散。若兩群本來就分得開,自訓練很有效;若中間糊在一起,早期一旦染錯,後面會一路錯下去。

03 — 優缺點

什麼時候適合用自訓練?

優點

  • 實作簡單,任何分類器都能套
  • 能大幅減少需要人工標註的資料量
  • 資料分群明確時效果很好

缺點 / 限制

  • 錯誤會自我強化(一步錯步步錯)
  • 需要設信心門檻,門檻難調
  • 類別邊界模糊時容易崩壞

典型應用場景

🗂️
文本分類
少量標註 + 海量未標註文章
🔊
語音辨識
用高信心轉錄擴充訓練集
🌐
網頁分類
自動擴充類別標籤

📝 iPAS 考點提醒

自訓練(Self-training)是半監督學習的核心做法,iPAS 半監督考點(中級科目三)。重點:先用少量標註訓練,對未標註資料預測,把高信心預測當偽標籤加入再訓練、反覆迭代,善用大量未標註資料。易混點:最大風險是確認偏誤——偽標籤錯了會自我強化、越錯越深,需設信心門檻;與協同訓練(兩視角互相標註)不同。情境:標註稀少時擴大訓練集。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

自訓練(Self-training)是什麼?

半監督法;先用少量標註資料訓練,對未標註資料預測,把高信心預測當偽標籤加入再訓練,反覆迭代。

為什麼有效?

善用大量便宜的未標註資料擴大訓練集,在標註稀少時提升表現;像只有少數病例標註、卻有大量未標註影像時特別有用。

最大的風險?

確認偏誤:偽標籤錯了會自我強化、越錯越深;需設信心門檻、逐步加入並監控驗證表現。

自訓練和協同訓練差在哪?

自訓練用單一模型自我標註;協同訓練用兩個不同視角的模型互相標註,降低單一模型的偏誤。

怎麼提升自訓練效果?

結合資料增強與一致性正則化(如 FixMatch)、謹慎的門檻與偽標籤權重、定期用驗證集把關。

🧭 相關主題

← 返回 AI 學習與考證地圖