模型對未標註資料的預測,只要信心夠高,就當真標籤用。
門檻 τ 決定一切:數量與品質的永恆拉鋸。
半監督式學習介於兩者之間:只有少量資料有標籤,但有大量沒標籤的資料。它想辦法讓沒標籤的資料也派上用場,省下昂貴的人工標註。
偽標籤是自訓練的核心動作:模型對未標註資料做預測,當預測機率(信心)超過門檻時,就把這個預測當成「偽標籤」一起拿去訓練。門檻是關鍵旋鈕:太低會收進一堆錯標籤,太高則幾乎沒新資料可用。
下方每個未標註點都有一個模型給的信心值。拖動門檻:只有信心高於門檻的點會被採用為偽標籤(亮起)。同時觀察被採用的偽標籤裡有多少其實是錯的。
把門檻往右拉:採用的數量變少,但正確率上升。這就是偽標籤永遠的權衡——數量 vs 品質。
偽標籤是半監督學習的核心做法,iPAS 半監督考點(中級科目三)。重點:先用少量標註訓練,對未標註資料預測,把高信心的預測當偽標籤加入訓練、反覆迭代。易混點:最大風險是確認偏誤——偽標籤錯了會自我強化、越錯越深,需設信心門檻並謹慎;它是自訓練的核心,FixMatch 等把它與強增強、一致性結合。情境:標註稀少時擴大有效訓練集。
想練情境題與詳解 → AI 學習與考證地圖
半監督技巧;先用已標註資料訓練模型,對未標註資料預測,把高信心的預測當偽標籤加入訓練,反覆迭代。
讓模型利用大量未標註資料、擴大有效訓練集,在標註稀少時常能提升;但偽標籤錯了會自我強化,需設信心門檻。
確認偏誤——若偽標籤錯了,模型會學到錯誤並自我強化、越錯越深;需設信心門檻並謹慎。
只採用高信心預測、逐步加入、配合資料增強與一致性正則化、監控驗證表現,必要時設定偽標籤權重。
偽標籤是自訓練(self-training)的核心做法;FixMatch 等現代方法把它與強增強、一致性結合,效果更佳。