💡一句話定義
RAG(Retrieval-Augmented Generation,檢索增強生成)=模型回答前,先從外部知識庫檢索相關內容,當作依據再生成,讓答案有所本。好處:減少幻覺、補足過時或缺漏的知識、提供可查證來源,而且更新知識庫就能更新答案,不必重訓。
🎮互動:純 LLM vs RAG
點兩個按鈕比較資訊流。純 LLM 只靠內建記憶回答(可能幻覺);RAG 先把問題轉向量 → 到 Vector DB 檢索 → 把找到的事實注入 Prompt → 才生成正確答案。
🔎 RAG 檢索增強生成 互動演示
請選擇模式以開始演示
🤔為什麼 LLM 會「幻覺」?
LLM 的知識截止於訓練結束日。問它「今天的股價」「公司內部的請假規定」,它沒看過這些資料,卻為了當個好助理,往往一本正經地胡說八道(Hallucination)。RAG 的解法:不強迫它「背誦」,而是教它「查資料」——像把閉卷考改成開卷考。
🔁RAG 三步驟:R → A → G
🔍Retrieval 檢索
把問題轉向量,到 Vector DB 用相似度找最相關文件。
把問題轉向量,到 Vector DB 用相似度找最相關文件。
➕Augmentation 增強
把檢索到的內容當 Context 塞進 Prompt。
把檢索到的內容當 Context 塞進 Prompt。
✍️Generation 生成
LLM 讀完參考資料,用流暢語言總結並回答。
LLM 讀完參考資料,用流暢語言總結並回答。
檢索常用餘弦相似度比對問題向量與文件向量:
$$ \text{similarity} = \frac{\mathbf{A} \cdot \mathbf{B}}{\|\mathbf{A}\|\,\|\mathbf{B}\|} $$
兩個向量夾角越小、方向越接近,語意越相關,就越優先被取回。
⚖️純 LLM vs RAG
| 面向 | 純 LLM | RAG |
|---|---|---|
| 知識來源 | 訓練權重(截止某日) | 權重 + 外部知識庫(可即時更新) |
| 幻覺風險 | 高,遇生資料愛亂編 | 低,答案基於檢索到的事實 |
| 可查證 | 難,說不出出處 | 可附來源/引用 |
| 更新知識 | 要重訓 | 更新知識庫即可 |
🪜RAG vs 微調(Fine-tuning)
🎯影響品質的關鍵 & 應用
品質關鍵:文件切塊策略、嵌入與檢索品質、取回片段數量與排序、提示如何組織脈絡——檢索不準,答案就不準。
應用場景:企業內部知識庫(「怎麼申請 VPN?」→ 查 PDF 手冊)、法律/醫療助手(不容幻覺、知識更新快)、即時新聞摘要(把最新搜尋結果餵給 LLM)。
應用場景:企業內部知識庫(「怎麼申請 VPN?」→ 查 PDF 手冊)、法律/醫療助手(不容幻覺、知識更新快)、即時新聞摘要(把最新搜尋結果餵給 LLM)。
✅自我檢測
Q1. RAG 是什麼?
檢索增強生成:模型回答前先從外部知識庫檢索相關內容,當依據再生成,讓答案有所本、可查證。
Q2. RAG 解決什麼問題?
減少幻覺、補足過時或缺漏的知識、提供可查證來源,而且更新知識庫即可更新答案、不必重訓。
Q3. RAG 怎麼運作?
文件切塊轉成嵌入存進向量資料庫;查詢時用相似度檢索最相關片段,連同問題一起餵給模型生成。
Q4. RAG 和微調怎麼選?
知識常變、要可查證、來源多用 RAG(不改權重);要改風格或內化技能用微調(改權重);兩者也常搭配。
🎯重點整理
- 本質:回答前先檢索外部知識當依據。
- 三步:Retrieval → Augmentation → Generation。
- 好處:減幻覺、可查證、易更新、不重訓。
- 檢索:常用餘弦相似度在向量庫比對。
- 選型:知識常變用 RAG、內化技能用微調。