Pseudo-Labeling · 半監督式

偽標籤 Pseudo-Labeling

把高信心預測當成暫定標籤再訓練

模型對未標註資料的預測,只要信心夠高,就當真標籤用。
門檻 τ 決定一切:數量與品質的永恆拉鋸。

若 max p(y|x) ≥ τ → 採用 argmax 為偽標籤
01 — 白話直覺

給未標註資料貼上「暫定標籤」

半監督式學習介於兩者之間:只有少量資料有標籤,但有大量沒標籤的資料。它想辦法讓沒標籤的資料也派上用場,省下昂貴的人工標註。

偽標籤是自訓練的核心動作:模型對未標註資料做預測,當預測機率(信心)超過門檻時,就把這個預測當成「偽標籤」一起拿去訓練。門檻是關鍵旋鈕:太低會收進一堆錯標籤,太高則幾乎沒新資料可用。

02 — 核心互動

調信心門檻,看品質與數量的拉鋸

下方每個未標註點都有一個模型給的信心值。拖動門檻:只有信心高於門檻的點會被採用為偽標籤(亮起)。同時觀察被採用的偽標籤裡有多少其實是錯的

0.80
採用偽標籤數
其中錯誤
偽標籤正確率

把門檻往右拉:採用的數量變少,但正確率上升。這就是偽標籤永遠的權衡——數量 vs 品質

03 — 優缺點

偽標籤的取捨

優點

  • 極簡單,深度學習常標配
  • 信心門檻一個旋鈕就能控制品質
  • 搭配資料增強、一致性正則效果更好

缺點 / 限制

  • 門檻設定敏感,錯標籤會污染訓練
  • 模型本來就偏的類別會被進一步放大
  • 信心高 ≠ 正確(過度自信問題)

典型應用場景

🖼️
影像分類
ImageNet 半監督、自監督預訓練後微調
📝
NLP 任務
大量未標註語料貼偽標籤
🏭
工業檢測
少量瑕疵樣本 + 大量正常樣本

📝 iPAS 考點提醒

偽標籤是半監督學習的核心做法,iPAS 半監督考點(中級科目三)。重點:先用少量標註訓練,對未標註資料預測,把高信心的預測當偽標籤加入訓練、反覆迭代。易混點:最大風險是確認偏誤——偽標籤錯了會自我強化、越錯越深,需設信心門檻並謹慎;它是自訓練的核心,FixMatch 等把它與強增強、一致性結合。情境:標註稀少時擴大有效訓練集。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

偽標籤(Pseudo-labeling)是什麼?

半監督技巧;先用已標註資料訓練模型,對未標註資料預測,把高信心的預測當偽標籤加入訓練,反覆迭代。

為什麼有效?

讓模型利用大量未標註資料、擴大有效訓練集,在標註稀少時常能提升;但偽標籤錯了會自我強化,需設信心門檻。

最大的風險是什麼?

確認偏誤——若偽標籤錯了,模型會學到錯誤並自我強化、越錯越深;需設信心門檻並謹慎。

怎麼降低風險?

只採用高信心預測、逐步加入、配合資料增強與一致性正則化、監控驗證表現,必要時設定偽標籤權重。

偽標籤和自訓練的關係?

偽標籤是自訓練(self-training)的核心做法;FixMatch 等現代方法把它與強增強、一致性結合,效果更佳。

🧭 相關主題

← 返回 AI 學習與考證地圖