Low-Rank Adaptation — 只調一小部分就能適應新領域
想像你有一本百科全書(大模型),要讓它變成醫學專家:
調整所有參數
需要大量 GPU
訓練時間長
每個任務存一份完整模型
只調 A、B 兩個小矩陣
單張 GPU 就能跑
訓練快很多
每個任務只存小矩陣(幾 MB)
LoRA + 4-bit 量化
更省記憶體
消費級 GPU 也能微調 LLM
效果幾乎不損失
低秩矩陣注入,PEFT 主流方法
量化 + LoRA,4-bit 更省記憶體
在層之間插入小模組
只調 soft prompt 向量
| 面向 | 全參數微調 | LoRA |
|---|---|---|
| 更新 | 更新全部權重 | 凍結原權重、只學低秩增量 |
| 參數量 | 龐大 | 極少(常 <1%) |
| 記憶體 | 高 | 低 |
| 產出 | 整份大模型 | 小小的 adapter |
LoRA 是參數高效微調(PEFT)的代表,iPAS 生成式 AI 落地考點(中級科目一)。重點:凍結原模型權重,只在旁路注入少量低秩矩陣來學新任務,訓練參數常不到 1%,大幅省記憶體與儲存、可隨插隨用。易混點:LoRA 是微調(改行為、內化技能)、不是 RAG(外掛知識);QLoRA 再加量化,讓單張消費級 GPU 也能微調大模型。情境:用少量資料把通用 LLM 客製到特定領域或風格。
想練情境題與詳解 → AI 學習與考證地圖
Low-Rank Adaptation,一種參數高效微調法;凍結原模型權重,只在旁路注入少量低秩矩陣來學習新任務。
大模型全參數微調昂貴又佔空間;LoRA 只訓練極少參數(常不到 1%),大幅省記憶體與儲存。
微調帶來的權重變化常是低秩的;用兩個小矩陣相乘近似這個變化,就能以很少參數捕捉適應所需。
訓練快、省資源、可為不同任務存多組小的 LoRA 權重隨插隨用,且推論時可合併回原權重不增延遲。
QLoRA 在 LoRA 基礎上把基礎模型量化(如 4-bit),進一步降低記憶體,讓單張消費級 GPU 也能微調大模型。