生活分享

接地(Grounding)是什麼:讓 AI 的回答有可以對回去的依據

接地(Grounding)在生成式 AI 產品裡,指讓回答連到可查證的來源,例如搜尋結果或你提供的文件;同一個詞也用在符號接地問題與視覺接地。內容拆開三種用法,說明檢索、放入上下文與附上引用的流程,示範逐句核對一個報名日期,並解釋為什麼有引用仍可能只支持一半,也不保證沒有幻覺。

閱讀時間約 8 分鐘

一個對話框的三行文字,各有細線連到文件上的一行,其中一份文件被放大鏡檢視
圖片:Mokaair (© Mokaair)

接地,英文 Grounding,在生成式 AI 的產品文件裡,指讓模型的回答連到可以查證的來源:系統先取得搜尋結果或你提供的文件,回答再把其中的說法標上對應的來源。它給讀者一條回頭核對的路,但不保證回答因此正確。

這個詞在認知科學、電腦視覺等領域另有很不一樣的意思,所以下面先分清三種用法,再看產品裡怎麼運作,以及有引用為什麼還要核對。

先分清楚:同一個詞,三種用法

Google 的 Gemini API 文件把 Grounding with Google Search 當成功能:讓模型取得即時網路內容並引用來源,繁體中文頁面譯作「以 Google 搜尋建立基準」;Anthropic 的 Citations 文件則是讓回答對回你提供的文件。各家範圍不一定相同,讀到「有接地」,要回頭看它實際接了什麼。

三種用法辨識表;來源查證於 2026 年 10 月。
用法接在一起的兩端讀到時先問
產品的接地(主講)回答裡的說法,和可查證的來源這句話在來源的哪一段?
符號接地問題符號,和感官經驗與外界事物符號的意義從哪裡來?
視覺接地一段文字描述,和影像中的區域這個詞指的是圖上哪一塊?

產品裡的接地怎麼運作

Google Cloud 文件把接地定義為把模型輸出連到可驗證資訊來源的能力。實際流程可以拆成三步。取得資料:Gemini API 文件說,啟用搜尋工具後,模型先判斷搜尋能否改善答案,需要時自己產生查詢並執行;Anthropic 則用你交給 API 的文件,預設切成句子,作為可引用的單位。放進上下文:這是本文的概括,指取回的內容和你的問題一起交給模型,回答依據它寫成。回傳對應:Gemini 的引用註記把回答中的一段文字連到來源網址,Claude 則附上被引用的原文與它在文件中的位置。想用程式讀這些欄位,可參考Gemini API 搜尋引用。

要不要搜尋由模型判斷;Gemini 文件描述的是回答「成功接地」時,文字會帶有引用註記。所以開了搜尋工具,不保證每次都有搜尋與引用;核對時看回應實際出現了什麼,不要只看設定。

有引用,不等於有支持

引用告訴你這句話出自哪裡,不代表來源真的這樣寫。以 Anthropic 文件為例,它把引用描述成支持說法的原文段落,但用上「保證」一詞的只有一點:因為 API 會解析引用並直接取出原文,引用一定指向你提供的文件中有效的位置。那一段是否足以支持整句,文件沒有保證;句子仍可能多寫了原文沒有的條件。

兩項研究量過這個落差,數字只屬於各自的設定。Gao 等人的 ALCE 基準用自然語言推論(NLI)模型自動判定陳述是否被所引段落完整支持;他們 2023 年用當時的模型測試 ELI5 長篇問答,摘要寫到最好的模型也有一半的情況缺少完整的引用支持。Liu 等人請人工評分員審查四個商用生成式搜尋引擎在 2023 年 2 月下旬到 3 月下旬的回應:平均只有 51.5% 的句子完整被引用支持,74.5% 的引用支持所附的句子(幾個引用合起來才完整支持一句時,各自只支持一部分的也算在內)。這些都是三年多前的系統,不代表今天的產品,但能告訴你該檢查什麼。

第二個落差在來源本身。Rashkin 等人提出的歸因評估框架 AIS,只問陳述能否歸到已指明的來源,刻意不判斷事實真偽,並指出還需搭配來源品質等評估。轉貼可能逐字支持某句話,卻是舊版本;網頁自己也可能寫錯。

示例:核對一個報名日期

以下是虛構示例,沒有實測任何產品。假設你問某市立圖書館的夏季講座何時開放報名,工具回三句話,各附一個來源。來源 A 是主辦單位公告,寫線上報名自 7 月 1 日上午起受理;來源 B 是活動網站的轉貼,寫 7 月 8 日開放,沒有更新日期。三句是:7 月 1 日開放線上報名(附 A);7 月 1 日起可線上或到現場報名(附 A);另有網站寫 7 月 8 日才開放(附 B)。

  1. 拆句:每句只留一個可查的主張,記下附的來源。
  2. 開來源:在原文找到對應那一句,不能只看網址或標題。
  3. 比對:日期、主體、條件逐項對,標成完整、部分或不支持(分級借自 Liu 等人)。
  4. 看來源:它是原始公布還是轉貼,有沒有更新日期。

預期結果:第一句與來源 A 一致,完整支持。第二句的線上部分有依據,現場報名 A 沒寫,是部分支持;這種最容易漏掉,因為連結對、前半句也對。第三句與來源 B 的原文相符,但 B 是沒有更新日期的轉貼,與公告衝突,不能直接當日期。處理:第一句採用,第二句刪掉現場報名或註明來源沒寫,第三句以主辦單位公告為準,仍不確定就問主辦單位。找不到對應的原文,就當成沒有依據,不要替模型補一個看似合理的出處。

三句示例回答各連到來源 A 或來源 B:第一句完整支持,第二句只有部分支持,第三句文字相符但來源是未標更新日期的轉貼,需要再查
示例的逐句核對:先看這句話被來源支持到哪裡,再看來源是否可靠。 · 圖片:Mokaair (© Mokaair)

與 RAG、幻覺、知識截止日的關係

Google Cloud 文件列出多種接地的接法,例如 Google 搜尋、你自己的搜尋 API、RAG Engine。所以在 Google 的分類裡,是接地的做法之一:接地關心說法能否回到來源,RAG 是先檢索再生成的流程。其他廠商未必同樣劃分。

幻覺方面,Google 的兩份文件都把減少幻覺列為好處,措辭是降低,不是消除;前面的研究也顯示,有引用的回答仍有沒有支持的句子。接地讓錯誤比較容易發現與追查,但核對這一步省不掉。拆解可查主張的做法見。

Gemini 文件也把回答近期事件、引用截止日以後的來源,列為搜尋接地的用途之一;知識截止日的意義可看。

其他用法:符號、影像與對話

符號接地問題最常被引用的是 Harnad 1990 年的同名論文:形式符號系統的意義,如何屬於系統本身,而不是依附人們腦中的解讀?他用「只靠中文對中文字典學中文」作比喻,並勾勒一個候選解法:符號由下而上,接到由感官輸入形成的非符號表徵。用到大型語言模型上,看法分歧:Harnad 在 2024 年的論文認為 ChatGPT 缺少直接的感覺動作接地,Mollo 與 Millière 則論證語言模型可以達成指稱接地。這裡不下結論;這和產品的「附來源」是兩回事。

視覺接地是給一段文字,找出影像中對應的區域。Flickr30k Entities 資料集替圖片說明裡的詞組標上邊界框,用來評測文字所指的實體在圖上的位置;Kosmos-2 則讓多模態模型把文字片段和邊界框一起輸出。這和回答有沒有來源無關。

此外,心理學家 Clark 與 Brennan 在 1991 年的〈Grounding in Communication〉裡用這個詞指對話中的協作:雙方設法確認剛說的話已被理解,納入彼此的共同基礎(common ground)。這是人與人的溝通,這裡不展開。

其他相關概念可從找起。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享