🔧 LoRA 原理視覺化

Low-Rank Adaptation — 只調一小部分就能適應新領域

💡 白話說明

想像你有一本百科全書(大模型),要讓它變成醫學專家:

📌 考試重點:LoRA 不是從零訓練,也不是改整個模型。它是在原始權重「旁邊」加少量可訓練參數。屬於 PEFT(參數高效微調)方法。
768 8
原始參數量
-
LoRA 參數量
-
節省比例
-
記憶體估算
-

❌ 全量微調

調整所有參數
需要大量 GPU
訓練時間長
每個任務存一份完整模型

✅ LoRA

只調 A、B 兩個小矩陣
單張 GPU 就能跑
訓練快很多
每個任務只存小矩陣(幾 MB)

🔄 QLoRA

LoRA + 4-bit 量化
更省記憶體
消費級 GPU 也能微調 LLM
效果幾乎不損失

🧠 LoRA 家族

LoRA

低秩矩陣注入,PEFT 主流方法

QLoRA

量化 + LoRA,4-bit 更省記憶體

Adapter

在層之間插入小模組

Prompt Tuning

只調 soft prompt 向量

📊 LoRA vs 全參數微調
面向全參數微調LoRA
更新更新全部權重凍結原權重、只學低秩增量
參數量龐大極少(常 <1%)
記憶體
產出整份大模型小小的 adapter
✅ 自我檢測
LoRA 是什麼?
Low-Rank Adaptation:凍結預訓練權重,只在旁邊插入一對小的低秩矩陣(A×B)來學任務增量,大幅減少可訓練參數。
為什麼用低秩矩陣?
微調的權重變化常是「低秩」的;用兩個小矩陣近似增量 ΔW=A·B,參數少很多卻能保留大部分效果。
LoRA 和 QLoRA 差在哪?
QLoRA 先把基座模型「量化」到 4-bit 再套 LoRA,記憶體更省,能在單張消費級 GPU 微調大模型。
🎯 重點整理
  1. LoRA=凍結原權重、只學低秩增量。
  2. 可訓練參數常 <1%,省記憶體。
  3. 產出小 adapter、可插拔切換任務。
  4. 效果接近全參數微調。
  5. QLoRA 加 4-bit 量化更省。

📝 iPAS 考點提醒

LoRA 是參數高效微調(PEFT)的代表,iPAS 生成式 AI 落地考點(中級科目一)。重點:凍結原模型權重,只在旁路注入少量低秩矩陣來學新任務,訓練參數常不到 1%,大幅省記憶體與儲存、可隨插隨用。易混點:LoRA 是微調(改行為、內化技能)、不是 RAG(外掛知識);QLoRA 再加量化,讓單張消費級 GPU 也能微調大模型。情境:用少量資料把通用 LLM 客製到特定領域或風格。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

LoRA 是什麼?

Low-Rank Adaptation,一種參數高效微調法;凍結原模型權重,只在旁路注入少量低秩矩陣來學習新任務。

LoRA 解決什麼問題?

大模型全參數微調昂貴又佔空間;LoRA 只訓練極少參數(常不到 1%),大幅省記憶體與儲存。

為什麼用低秩矩陣?

微調帶來的權重變化常是低秩的;用兩個小矩陣相乘近似這個變化,就能以很少參數捕捉適應所需。

LoRA 的優點?

訓練快、省資源、可為不同任務存多組小的 LoRA 權重隨插隨用,且推論時可合併回原權重不增延遲。

LoRA 和 QLoRA 差在哪?

QLoRA 在 LoRA 基礎上把基礎模型量化(如 4-bit),進一步降低記憶體,讓單張消費級 GPU 也能微調大模型。

🧭 相關主題

← 返回 AI 學習與考證地圖