在損失函數加入懲罰項、或在訓練過程加入隨機性,抑制模型過度貼合訓練資料,用一點訓練精度換取更好的泛化能力。
L1 懲罰絕對值,會把部分權重壓成正好 0(稀疏、兼做特徵選擇);L2 懲罰平方,全體縮小但不歸零。兩者混用就是 Elastic Net。
訓練時隨機停用神經元,逼網路不依賴特定路徑,等效於訓練大量子網路再集成;推論時全員上工並做權重縮放。
算——在驗證誤差回升前停止訓練,等於限制模型複雜度的成長,而且幾乎零成本,是實務上最便宜的正則化。
它主要是穩定並加速訓練(可用更大學習率);因 mini-batch 統計帶隨機性,附帶輕微正則化效果,有時可少用 Dropout。