檢索增強生成:回答前先從知識庫檢索相關內容、附進提示再生成。解決知識過時與幻覺問題,且不必重新訓練模型。
整份長文件直接檢索不精準、雜訊多;切成小段後語意對齊更好、引用更精確。chunk 大小與重疊量是關鍵參數。
文字先轉成 Embedding 向量,用餘弦相似度等距離衡量語意遠近;向量資料庫負責在海量向量中快速找出最近鄰(Top-k)。
知識常更新、要能引用來源→RAG;要改變模型的風格與行為→微調。兩者常常並用。
要求附引用、控管檢索品質(文件版本、重排序)、限制只依據檢索內容回答、無把握時回答「不知道」。