生活分享

知識截止日(Knowledge Cutoff)是什麼:模型知道到哪一天,又為什麼不準

知識截止日是供應商標示模型訓練資料大致到哪個時間的說法,不是模型什麼都知道的保證。內容說明各家怎麼標示、訓練資料截止日與可靠知識截止日的差別,為什麼越近截止日的事越不牢靠,用虛構案例區分承認不知道、過期資訊與幻覺,再比較附上資料、檢索與搜尋工具的補救與失敗點。

閱讀時間約 8 分鐘

左側五排方塊由深到淺逐漸變淡,一條紅色虛線之後只剩空白的虛線方塊,一支放大鏡罩住其中一塊並讓它亮起
圖片:Mokaair (© Mokaair)

知識截止日(knowledge cutoff)是供應商用來說明模型訓練資料時間範圍的標示,意思是這個日期之後發生的事,模型多半沒有學到。它是粗略的參考線,不是保證:日期之前的事,模型不一定知道,知道的也不一定正確;日期之後的事,則要靠你或工具把資料交給它。

本文依 Anthropic、OpenAI、Google 的官方文件與三篇研究(其中一篇是預印本),說明各家怎麼標示、為什麼越靠近截止日越不牢靠,用虛構案例示範三種回答型態,再談附上資料、檢索與搜尋能補到哪裡、在哪裡失敗。訓練資料從哪裡來,見;文中不列模型的截止日期,那會過期,請看供應商當天的頁面。

供應商怎麼標示截止日

各家標示截止日的名稱與定義並不一致。Anthropic 的文件區分「可靠知識截止日」(reliable knowledge cutoff)與「訓練資料截止日」(training data cutoff),兩者不一定是同一天;它的透明度頁面在部分模型條目裡,把前者解釋為模型知識「最廣泛也最可靠」所及的日期,也有條目寫明訓練資料截止日比可靠知識截止日晚。也就是說,訓練資料到了某天,不代表之前最後幾個月都學得牢。

OpenAI 與 Google 的開發者文件多半只寫一個「knowledge cutoff」加日期,這些頁面沒有說明它指訓練資料還是可靠知識;Google 在說明截止日時,也建議需要更新的資訊改用搜尋接地工具。放的位置也不固定:可能在模型頁的欄位、比較表、常見問題或透明度頁面,有些模型頁則完全不列,找不到就翻官方文件的其他頁面。三家沒有共用的定義,同樣寫「截止日」,意思未必相同;比較兩個模型前,先確認標的是哪一種。

為什麼越接近截止日,越不牢靠

把截止日想成一條銳利的邊界,是常見的誤解。Cheng 等人在 COLM 2024 發表的論文提出「有效截止日」(effective cutoff):同一個模型對不同資料來源,表現出的截止時間可以不同,也可能和供應商報的不同。他們主要分析訓練資料公開的模型,用 Wikipedia 每月的版本量困惑度(perplexity),發現有些模型的有效截止日比標示早得多,其中一個的差距甚至以年計。論文歸因於兩點:新的網頁爬取資料混著大量舊內容,去重複的流程擋不住字面略有差異的重複文件。也有模型和標示吻合,所以結論是「常常不一致」,不是「都不準」。

Dai 等人(ICML 2025)的 Daily Oracle 每天從新聞自動出預測題(真假題與選擇題),問某件事在某天前會不會發生、結果如何;答案在截止日之前就揭曉的題目,等於考模型記不記得已發生的事。在不提供資料的設定下,幾個模型在截止日之前的幾個月答對率就開始緩慢下降,作者推測是訓練資料裡近期新聞的比重不足;截止日之後題目才真正要靠預測,有幾個模型在選擇題上下滑得更快。兩篇研究合起來看,標示的日期比較像「大約到這附近」,不是「到這天為止樣樣都知道」。

模型自己說的截止日準不準,有一篇預印本做了直接比對,尚未經同儕審查:Pęzik 等人 2025 年的 LLMLagBench 用 1,713 題新聞問答,交給另一個模型評分,替許多模型估計訓練邊界。在其中某些模型上,直接問模型得到的截止日比量到的邊界早了一年以上;作者也指出,模型可能自述偏保守的日期,同時卻對遠超出實際訓練範圍的事件編造答案。這是單一預印本的結果,還待其他研究驗證。

時間軸分成三段:較早的事件資料較完整、接近截止日的資料可能較少且版本混雜、截止日之後模型沒有訓練到;下方三條補救路徑把資料送進上下文視窗,旁邊標出各自的失敗點
截止日不是一條銳利的線;不更動模型本身的話,補救只能把內容放進上下文視窗,來源本身也可能過期。 · 圖片:Mokaair (© Mokaair)

示範:問一件截止日之後才發生的事

以下是虛構示例,未對任何模型實測。假設虛構的「濱海光影節」在某模型的訓練資料截止後,才公布今年的場次與票價。你問:「今年光影節哪天開始,票價多少?」常見的回答型態有三種。

  • 型態一,承認可能不知道:「我的資料可能沒涵蓋今年的公告,請以主辦單位網站為準。」這是最安全的訊號,但只是沒有答案,下一步要自己查或開搜尋。
  • 型態二,拿舊資料當現在:「光影節通常在夏天舉行,票價大約是……」內容可能曾經正確,只是已過期。線索是沒有年份、用「通常」帶過;可以追問「這是哪一年的資訊」,但模型回答的年份本身也要核對。
  • 型態三,流暢的新細節:「今年改在三個港區舉行,票價調漲。」具體又有細節,卻沒有來源支持,這才是幻覺。把場次與票價拆成可查的主張,逐項對主辦單位的頁面。

最容易被忽略的是型態二:它讀起來既不像拒答,也不像編造。

它和過期資訊、幻覺差在哪

三個詞常被混用,問題卻不同。截止日描述模型「學到哪裡」;過期資訊是內容曾經正確、現在不再正確,成因可能是截止日後世界改變,也可能是舊版本在訓練資料裡佔多數;幻覺是產生缺乏事實支持的內容,不一定和時間有關。過期資訊要問日期並換新來源,幻覺要拆成主張核對,拆法見;三者可能同時出現在一個回答裡。

補救:附上資料、檢索與搜尋工具

不更動模型本身(例如重新訓練或微調)的話,要補上截止日之後的資訊只有一條路:讓內容進到上下文視窗,模型才讀得到。差別在誰找資料,失敗處也不同。

概念對照;來源查證於 2026 年 10 月。
做法誰找資料常見失敗點
自己附上資料你貼上文字或檔案貼的版本過期,或漏了關鍵段落
檢索(RAG)系統從資料庫找資料庫沒更新,或找到不相關的段落
搜尋工具模型決定搜不搜沒搜就直接答,或頁面過期、不支持引用

搜尋工具的失敗點可以更具體。Anthropic、Google 與 OpenAI(Responses API)的文件,都寫明由模型依提示詞判斷搜不搜,所以看似常識的問題可能沒觸發搜尋,答案只來自記憶。Anthropic 說搜尋成功卻沒有結果時回傳空列表,不是錯誤;OpenAI 有只用快取結果的模式,也另有完整來源清單,數量常多於引用。連結存在不等於頁面支持那句話,要點開看日期和內容。原理見與。

Daily Oracle 的受限檢索實驗(BM25 取前 5 篇新聞、每篇最多 512 個英文單字)也看得到:資料庫停在某天,成績就在那天之後掉下來;有個模型在檢索資料只到它標示的知識截止日之前時,表現可能不如不給資料。就算直接給含答案的原文,多數模型的成績仍隨時間下滑。

使用時怎麼檢查

  1. 先看是哪一種日期:訓練資料截止日、可靠知識截止日,還是沒有定義的欄位。
  2. 判斷問題有沒有時效:價格、規定、版本、活動日期屬於時效問題;穩定的概念通常不是。
  3. 把今天的日期告訴模型。Anthropic 的文件說,它的網頁版與手機應用程式會在對話開頭提供目前日期,並註明這些系統提示詞更新不適用於 API;用 API 時,自己放日期比較保險。
  4. 時效性問題開搜尋或附上資料,要求答案標出資料日期,再打開來源核對。

想看更多概念,可回到。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享