只有少量標籤怎麼辦?讓模型先學會一點,再把最有把握的猜測當真標籤加回去,反覆滾大訓練集。
半監督式學習介於兩者之間:只有少量資料有標籤,但有大量沒標籤的資料。它想辦法讓沒標籤的資料也派上用場,省下昂貴的人工標註。
自訓練的流程像「滾雪球」:先用少量有標籤資料訓練一個模型 → 讓它去預測沒標籤的資料 → 把最有把握的預測當成新標籤加進訓練集 → 重新訓練。一輪一輪,標籤越滾越多。
自訓練 = 模型把自己最有信心的猜測,當成真標籤回收再利用。風險:如果一開始猜錯又很有信心,錯誤會被放大(error propagation)。
畫面中只有兩個有顏色(有標籤)的點,其餘灰點都沒標籤。按「下一輪」:模型會把離已知點最近、最有把握的灰點染色(賦予偽標籤),雪球越滾越大。
觀察染色從兩顆種子向外擴散。若兩群本來就分得開,自訓練很有效;若中間糊在一起,早期一旦染錯,後面會一路錯下去。
自訓練(Self-training)是半監督學習的核心做法,iPAS 半監督考點(中級科目三)。重點:先用少量標註訓練,對未標註資料預測,把高信心預測當偽標籤加入再訓練、反覆迭代,善用大量未標註資料。易混點:最大風險是確認偏誤——偽標籤錯了會自我強化、越錯越深,需設信心門檻;與協同訓練(兩視角互相標註)不同。情境:標註稀少時擴大訓練集。
想練情境題與詳解 → AI 學習與考證地圖
半監督法;先用少量標註資料訓練,對未標註資料預測,把高信心預測當偽標籤加入再訓練,反覆迭代。
善用大量便宜的未標註資料擴大訓練集,在標註稀少時提升表現;像只有少數病例標註、卻有大量未標註影像時特別有用。
確認偏誤:偽標籤錯了會自我強化、越錯越深;需設信心門檻、逐步加入並監控驗證表現。
自訓練用單一模型自我標註;協同訓練用兩個不同視角的模型互相標註,降低單一模型的偏誤。
結合資料增強與一致性正則化(如 FixMatch)、謹慎的門檻與偽標籤權重、定期用驗證集把關。