生活分享

圖譜檢索增強生成(GraphRAG):從關係看懂整批文件

GraphRAG 把實體及其關係納入檢索,協助回答跨文件的關聯與整體主題。本文以 Microsoft 原始論文及官方文件為範圍,拆解實體抽取、社群摘要、局部搜尋和全域搜尋,以地方活動紀錄示範不同問題需要不同路徑。也說明圖譜漏連、名稱誤合併與摘要失真如何影響答案,避免把一張漂亮的關係圖誤認為已驗證的事實。

更新日期: 閱讀時間約 7 分鐘

文件旁的人物與組織節點形成相連群集,呈現跨文件關係
圖片:Mokaair (© Mokaair)

GraphRAG 可以廣義指運用圖譜關係來增強生成回答的系統,也常特指 Microsoft Research 發表的 GraphRAG 方法與開源專案。本篇以後者的原始論文及官方文件為主,說明如何先從文件抽取實體與關係,再用這些結構支援問答。不同廠商同名方案的索引與搜尋方式不一定相同,不能只靠名字比較。

它值得關注的問題是:當答案分散在很多文件裡,單純找幾段文字最相近的片段,是否足以回答「整體有哪些共同主題」?例如一批地方活動紀錄,各篇只談單次活動,讀者卻想知道不同團體長期合作的模式。圖譜和社群摘要提供另一條整理路徑,但抽取出的關係仍需回到原文檢查。

圖譜提供的是連結方式

Microsoft 的方法先把文件拆成文字單位,再抽取人物、組織、地點等實體與它們的關係。接著對圖做分群,為群集及相關內容產生社群摘要。這些摘要供跨文件的整體問答使用,並不是把所有原文永遠丟掉。系統仍需要把實體、關係、摘要與原始段落連起來,才有追查出處的可能。

這裡的「社群」是圖分析所形成的群集,不必等於真實社會中的正式團體。若兩個組織經常出現在相連紀錄裡,它們可能在圖中靠近,但不能直接推論彼此具有法律、財務或治理關係。分群是一種資料整理結果,抽取關係也可能只是文字主張。把圖上相連誤讀成因果,是使用時特別需要避免的跳躍。

局部問題與全域問題走不同路

局部搜尋適合問特定實體,例如某個團體和哪些場地合作。官方流程會找到與問題相關的實體,沿關係取得鄰近資訊,並結合相關原始段落放進上下文。它保留了從一個明確起點展開的特性,能補上單一段落未提到、卻在其他紀錄出現的連結。仍要注意關係方向與時間,合作過不代表目前仍合作。

全域搜尋則面向整批資料的主題,例如所有活動最常出現哪些合作困難。Microsoft 的設計利用社群報告產生局部回應,再彙整為整體答案。這是一種先整理再綜合的架構,不能直接當成精確統計工具。若要知道某詞出現的次數或每年活動總場次,結構化計數往往比讓摘要回答更適合,尤其不能把「常見」自動換成比例。

原文抽取成實體關係,一路沿特定實體做局部搜尋,另一路建立社群摘要回答全域主題
局部搜尋沿實體展開,全域搜尋利用社群摘要整理整體議題。 · 圖片:Mokaair (© Mokaair)

示範:閱讀地方活動紀錄

假設有一批虛構紀錄,包含山城書屋、河畔協會及不同場地的活動報告。輸入「山城書屋曾與哪些團體共辦活動?」時,可先定位書屋實體,沿共同主辦關係取得團體,再找支持每條關係的原文。預期輸出是團體名稱、合作活動與紀錄出處,而不是把同篇出現的所有組織都列成共同主辦。

改問「這批紀錄裡,活動組織最常面臨什麼困難?」時,需求變成跨文件主題整理。系統可檢視各社群摘要中的場地協調、人手安排等內容,再彙整重複議題,附可追查的例子。這裡的主題是教學示意,未執行真實資料分析。如果某個困難只在少數紀錄出現,答案應保留它的範圍,不能寫成所有團體共同面臨。

為檢查圖譜是否有用,可以保留一份人工確認的小樣本。先核對書屋與協會是否被正確識別,再核對共同主辦關係,最後看答案是否完整。若錯在把同名書屋合併,換生成模型未必有幫助;若圖譜正確但答案把曾經合作寫成持續合作,則要修正生成及引用檢查。

圖越漂亮,越要看來源

圖譜建構可能漏掉隱含關係,也可能把代稱解析到錯誤人物。文件若寫「本會」卻沒有清楚上下文,抽取器很難可靠辨識;同名機構、改名與不同分店更容易造成混淆。資料清理時需要穩定識別碼、別名及時間資訊,並保留合併決策。把一切都交給模型自動抽取,會讓錯誤沿著關係與摘要繼續傳播。

摘要也是生成內容。它可能略過少數意見,或者把帶保留的說法寫得太確定;全域答案若又根據摘要生成,便多了一層可能失真。比較重要的主張應回查原文,而非只引用另一段機器摘要。當資料來源彼此矛盾,圖譜最好記錄不同來源的主張,而不是在建索引時悄悄選一邊,讓後續讀者完全看不到衝突。

導入前先確認問題類型

GraphRAG 常需要比一般文件檢索更多的前處理:抽取、關係整理、分群及摘要都要計算,文件更新也可能影響既有結構。若主要需求只是查明確條文或找特定名稱,較直接的搜尋流程可能更容易維護。是否值得付出索引成本,應由跨文件問題的改善程度判斷,不能從圖中節點很多就推定價值很高。

驗收時可分開測局部關係題、全域主題題,以及需要精確計數的題目,檢視系統是否選對方法。除了答案品質,也要檢查引用、實體誤合併、更新後圖譜一致性及未授權資料是否被隔離。一般讀者可以把 GraphRAG 理解成增加關係與群集視角的資料閱讀方式;它整理了通往證據的路徑,並沒有替證據本身背書。

另外,圖譜更新需要可追蹤的資料版本。刪除一份原文時,相關關係和摘要可能仍包含它的內容;不能只刪原檔就假定整個系統同步乾淨。驗收應挑一個已撤下的紀錄重新查詢,檢查原文引用、圖上的關係與摘要是否仍受它影響。

概念對照;來源查證於 2026 年 9 月。
方法處理重點需要留意
局部搜尋特定實體與鄰近關係核對關係方向和時間
全域搜尋社群摘要與整體議題摘要不等於完整統計
一般向量檢索語意相近的原文片段可能漏掉分散的關係

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享