生活分享

知識圖譜(Knowledge Graph):把事物與關係說清楚

知識圖譜用實體及關係組織資料,讓「誰參與什麼、在哪裡、何時發生」能沿連結查詢。本文以社群活動資料示範實體識別、關係方向、來源與時間,介紹 RDF 和屬性圖的表示差異,也說明圖譜不等於視覺化或可信事實。讀完能判斷資料適不適合建圖,並理解它如何和資料表、向量搜尋及 GraphRAG 搭配。

更新日期: 閱讀時間約 7 分鐘

中心事件連到人物、場地及文件節點,不同顏色的連線表示具體關係而非單純相似度
圖片:Mokaair (© Mokaair)

知識圖譜,英文 Knowledge Graph,是以事物及其關係組織知識的方式。事物可以是人物、機構、地點、文件或事件,關係則描述誰參與什麼、何者位於哪裡、資料來自何處。它的重點是讓連結具有明確意義與可追查的識別,不只是把資料畫成一群圓點和線條。

這個詞沒有只準使用某一種儲存技術的單一定義。本篇以 W3C 的 RDF 概念規範和 Neo4j 的屬性圖說明作為具體基礎,介紹兩種常見表示方式。範例採虛構社群活動資料;圖上的關係是教學設定,不是對真實人物或組織的調查。讀者將能辨認哪些關聯可由資料支持,哪些只是看圖後的猜測。

先有身份,再談關係

若兩份文件都提到「山城書屋」,首先要判斷是否為同一間書屋。名稱相同可能是不同分店,名稱不同也可能是同一機構改名。圖譜需要穩定的實體識別碼,名稱與別名則作為屬性保留。沒有處理這一步,後續沿關係查詢就可能把不同主體混在一起,得到形式連貫但事實錯置的答案。

關係也需要明確類型和方向。「書屋主辦活動」與「活動位於書屋」表達的責任不同;同一篇報告裡共同出現,不等於共同主辦。建圖時應依證據定義關係,保留不能確定的部分,必要時把「某文件聲稱有合作」表示為帶來源的主張,而不是直接升級成無條件事實。

RDF 與屬性圖怎麼表示

RDF 的基本陳述可理解為主體、述詞、受詞:例如「活動甲、舉辦於、場地乙」。W3C 規範定義了 RDF 圖與相關識別及資料型別,使不同來源有共同的表示基礎。這裡只是概念示例,不代表任意使用中文片語就已符合完整的資料交換規格;實際系統還要選擇適當詞彙與識別方式。

屬性圖則常把資料表示為節點、帶類型的關係,以及附在節點或關係上的屬性。活動節點可以有日期,主辦關係可以有角色或有效期間。兩種方式都能組織關聯,但資料模型、查詢語言與互通方式不同。它們不是一個新舊淘汰序列,選擇要看既有工具、交換需求和團隊如何管理資料。

山城書屋主辦讀書會,河畔協會協辦,讀書會舉辦於青禾教室;場地不能自動視為共同主辦
連線的意義與方向,是圖譜能回答問題的關鍵。 · 圖片:Mokaair (© Mokaair)

示範:誰參與過同一場活動

假設資料寫明山城書屋主辦讀書會,河畔協會協辦,地點在青禾教室。輸入「哪些團體曾和山城書屋一起辦活動?」時,系統可先找到書屋,再沿主辦的活動節點找其他協辦團體,最後回傳活動與來源。預期結果包含河畔協會,但青禾教室只有場地角色,不能自動把它也當成共同主辦單位。

如果活動紀錄另寫「講者來自河畔協會」,仍不足以證明協會是協辦。這時應保留講者所屬關係,或者記下資料尚未確認。例子說明圖譜的好處:關係類型使查詢可以區分同樣相連但意義不同的情況。若只把所有提及者用「相關」連起來,雖然圖很密,卻難以支援這種精確問題。

接著改問「目前有哪些長期合作夥伴?」單次共同活動並不足以回答。需要資料明示合作期間或持續關係,不能把「曾共同主辦」直接變成「現任夥伴」。因此時間與關係狀態應跟著證據儲存,答案也應說明資料範圍。這些是建模與查詢時要負責的判斷,不會因採圖形儲存就自動完成。

圖譜不能替來源背書

圖譜可能由人工整理、規則抽取或語言模型建立,每種方式都可能出錯。原始文件若有誤,抽取得再正確也只是忠實儲存錯誤主張;模型抽取還可能猜錯代稱或漏掉否定。需要分開檢查原文可信度、抽取是否忠實,以及身份是否合併正確。這些階段的錯誤原因不同,不能只用一個整體信心分數概括。

來源撤回或修訂時,圖譜也需要更新。若某條關係由多份資料支持,刪除其中一份不一定等於整條關係應消失;但也不能完全不處理。保留來源連結與有效期間,有助於追蹤哪些結論受影響。對需要審核的資料,應區分候選關係和已確認關係,避免未驗證抽取結果直接供對外答案使用。

何時適合用圖,如何與其他方法搭配

當常見問題需要跨多個實體追蹤關係,例如事件參與、內容引用或組織合作,圖的結構容易表達這些路徑。但資料如果主要是單一表格的篩選與加總,關聯式資料庫可能更直接。圖形儲存不是所有 JOIN 查詢的必要替代,資料量大也不表示一定適合建圖。應先寫出實際要回答的問題,再決定結構。

向量搜尋擅長找意思相近的起點,圖譜則擅長沿明確關係展開,兩者可以搭配。例如先用文字找到可能對應的書屋,再用識別碼查正式的活動關係。GraphRAG 進一步把圖及相關文字交給生成流程回答。這些步驟仍需保留原文,不能把一條模型抽取的連線當成充分引用。

小型驗收可以先人工確認一組實體與關係,加入同名不同人、改名、過期關係與相互矛盾的來源。檢查查詢是否走對關係類型,是否能指出每個結果的依據,並確認無資料時不會硬連。評估圖譜應看它能支援哪些可核對的問題,不只是節點數增加或視覺化看起來更複雜。視覺化只是閱讀圖譜的一個介面。線條密集、節點靠近或顏色相同,可能是佈局演算法的選擇,不一定是資料本身的正式含義。分享圖時應附上關係圖例與範圍說明,讓讀者知道哪一些視覺特徵可以解讀,哪一些只是為了排版清楚。

概念對照;來源查證於 2026 年 9 月。
方法處理重點需要留意
資料表列與欄位組織記錄適合明確篩選及統計
知識圖譜實體與有意義的關係需要身份和來源治理
向量表示內容的相似性不直接提供明確關係類型

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享