生活分享

llms.txt 是什麼:一份社群提案,以及 robots.txt 真正能做的事

llms.txt 是 2024 年提出的社群提案,不是標準:到 2026 年 9 月 14 日為止,只有 Google 在官方文件裡明講搜尋不使用它,其餘幾家沒有表態,也沒有引擎公布過消費它的證據。本文同時寫清楚 robots.txt 擋抓取不擋索引、被擋的網址連 noindex 都讀不到,並把訓練、搜尋索引、代使用者即時取用三類爬蟲分開,最後附本站的做法與理由。

更新日期: 閱讀時間約 7 分鐘

原創插畫:網站根目錄上放著一個實線檔案與一個虛線檔案,三條路徑從網站分別通往三個不同形狀的終點;非產品介面。
圖片:Mokaair (© Mokaair)

這篇回答一個問題:網站根目錄要不要放一個 llms.txt。結論是它是社群提案,不是任何引擎承諾會讀取的檔案;到 2026 年 9 月 14 日為止,唯一明確表態的搜尋引擎是 Google,寫的是搜尋不使用這類檔案。

這篇把常被混在一起的三組東西分開:提案與已部署的機制、擋抓取與擋索引、訓練用爬蟲與搜尋索引爬蟲與代使用者取用的擷取器。文末附本站的做法與理由,那是帶日期的選擇,不是通則。

llms.txt 是誰提的,說要解決什麼

提案網站標明作者是 Jeremy Howard,發表日期是 2024 年 9 月 3 日,現在掛的是第二版。它的定義是:提議統一用一個 llms.txt 檔案,提供資訊協助代理(Agent)使用這個網站——理由是網頁為人而做,還原成乾淨文字既困難又耗 token。

提案原文把分工寫清楚:robots.txt 讓自動化工具知道哪些存取可接受,llms.txt 則是代理需要某個主題的資訊時按需使用——這是提案作者的說法,不是引擎公布的資料。整個系列的地圖放在。

格式:只有一個區塊是必填

規格很短。檔名是 llms.txt,放在網站根目錄或任何子路徑;內容是一個 H1 標題、一段引文格式的摘要,再加上以 H2 分隔的 markdown 連結清單,唯一必填的是那個 H1 標題。規格沒有規定任何引擎必須讀它,也沒有定義讀了之後會怎樣。

提案原文給的範例骨架(依 llmstxt.org 第二版整理) · markdown
# 網站或專案名稱

> 一句話摘要,放理解後面內容所需的關鍵資訊

這裡可以放幾段補充說明,但不能用標題。

## 章節名稱

- [連結標題](https://example.com/page.md): 選填的說明

## Optional

- [次要連結](https://example.com/extra.md)

哪些引擎表態過,哪些沒有

Google 是唯一在官方文件裡寫清楚的。它的 最佳化指南在破除迷思那一節寫:你不需要為了出現在 Google 搜尋而建立機器可讀檔案或 文字檔,搜尋不使用它們;維護它們給其他服務用沒問題,但不會傷害也不會幫助你的能見度或排名。這是官方文件說明的機制;更新記錄把這段註記的日期寫成 2026 年 6 月 15 日。

其他幾家沒有表態。到查證日為止,OpenAI、Anthropic、Perplexity 的爬蟲文件,都沒有把 llms.txt 寫成自家系統會讀取的檔案。沒有表態不等於否認,但也不能當成證據:沒有一家公布過自家系統會消費它。

另一件常被當成證據的事:這幾家的開發者文件站自己都放了 llms.txt——那是發布者的行為,不是它們的爬蟲會去讀別人的。

這個題目的搜尋結果絕大多數是代理商或工具商的行銷內容,常見標題是「放了就能增加 AI 曝光」;那屬於廠商行銷主張這一級,通常沒指出是誰在保證。判準寫在。

robots.txt 擋的是抓取,不是索引

對照組是 robots.txt。Google 的官方說明很直接:它主要用來避免網站被大量請求壓垮,不是讓網頁不出現在 Google 的機制;被擋住的網址如果有別的網站連過來,仍可能被建立索引。抓取、索引、出現在結果裡是三層狀態,分法寫在。

關鍵的一層在這裡:Google 的 noindex 說明寫著,要讓 noindex 生效,該網頁不能被 robots.txt 擋住,必須是爬蟲能存取的。想把一頁移出搜尋結果,就要讓爬蟲讀得到頁面上的 noindex。

robots 指令不是授權控制

robots.txt 的規範原文是 RFC 9309,2022 年 9 月以標準軌發布。規範自己寫明:這些規則不是一種存取授權,也不能取代有效的內容安全措施。一行 Disallow 是告示,不是鎖,遵不遵守靠慣例。

三種爬蟲,三個 user-agent

這是本篇最有用的一段。訓練用爬蟲、搜尋索引爬蟲、代使用者取用的擷取器是三件事,各家用不同的 user-agent 把它們分開;你寫下哪一個名字,後果完全不同。

訓練那一類,寫得最清楚的是 Google-Extended:Google 說發布者可以用它管理抓到的內容是否可用於訓練未來的 Gemini 模型,並明寫它不影響網站在搜尋的收錄,也不是排名訊號。GPTBot 與 ClaudeBot 的官方描述同樣是抓可能用於訓練的內容。

搜尋索引那一類,目的是讓網站出現在該服務的結果裡。OAI-SearchBot 用於搜尋,讓網站出現在 ChatGPT 的搜尋結果中;PerplexityBot 依官方文件是為了在 Perplexity 的結果中呈現並連結網站,而且明說它不用於為基礎模型抓取內容。

第三類是使用者當下觸發的取用。Google 寫明使用者觸發的擷取器通常會忽略 robots.txt 規則,理由是取用由使用者要求;OpenAI 與 Perplexity 對自家的 ChatGPT-User、Perplexity-User 寫了同一件事。所以這一類,robots.txt 裡的一行接近表態,而不是閘門。

三類爬蟲的官方描述對照,依 2026 年 9 月查證的各家官方文件整理;同一家的設定彼此獨立。
這一類是什麼官方文件寫的用途user-agent 例子在 robots.txt 擋掉會怎樣
訓練用爬蟲可能用於訓練生成式基礎模型Google-Extended、GPTBot、ClaudeBot官方文件說會遵守;Google 與 Apple 另寫明不影響收錄
搜尋索引爬蟲建索引,出現在該服務的結果Googlebot、OAI-SearchBot、Claude-SearchBotOpenAI 明寫退出的網站不出現在 ChatGPT 答案裡
代使用者取用的擷取器提問時去讀那一頁並附連結ChatGPT-User、Claude-User、Perplexity-UserGoogle 與 Perplexity 寫通常忽略;OpenAI 寫可能不適用
圖解:把爬蟲分成訓練、搜尋索引、代使用者即時取用三條線,各自對應的 user-agent 與擋掉的後果。
由上往下看三條線:每一類在做什麼、各家的 user-agent 例子,以及在 robots.txt 擋掉它的後果。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

一張三列的對照圖。每一列由左到右是:這一類在做什麼、各家的 user-agent 例子、在 robots.txt 擋掉會怎樣。第一列是訓練用爬蟲,抓內容可能用於訓練生成式基礎模型,例子有 Google-Extended、GPTBot、ClaudeBot,官方文件說會遵守,Google 與 Apple 另寫明擋掉不影響搜尋收錄。第二列是搜尋索引爬蟲,建索引讓網站出現在該服務的結果裡,例子有 Googlebot、OAI-SearchBot、Claude-SearchBot,OpenAI 明寫退出的網站不出現在 ChatGPT 答案裡。第三列是代使用者取用的擷取器,使用者提問時去讀那一頁、答案裡附連結,例子有 ChatGPT-User、Claude-User、Perplexity-User,官方文件寫這一類通常忽略 robots.txt,所以那一行接近表態,不是閘門。圖的底部寫著:三件事各自有名字,你在 robots.txt 寫下哪一個,後果完全不同。

本站目前的做法(2026 年 9 月 14 日查證)

以下是 Mokaair 自己 robots.txt 的內容與理由,它剛好把上面幾條規則用在一個檔案裡。這是本站在這個日期的選擇,不是要你照抄的清單;本站沒有做過任何量測,也不主張這樣設定改變了本站的曝光。

  • 給所有爬蟲的那一組允許整站,只擋機器用的端點與不該被猜到的 token 網址:API、後台、分享與轉址路徑。
  • 會員頁面刻意保持可被抓取,改用頁面上的 noindex,理由就是上一節那一條。
  • 拒絕的名單只留訓練用爬蟲,目前 9 個 user-agent,包含 GPTBot、CCBot、Google-Extended 等;會引用來源的搜尋型爬蟲(PerplexityBot、ClaudeBot)與替使用者取頁的 ChatGPT-User、OAI-SearchBot 刻意不在名單上,政策可由環境變數切換。

取捨的理由寫在程式碼註解裡:被拒絕的是收集頁面拿去訓練、或把內容轉售成一個答案的爬蟲,放行的是代使用者即時取用、並在答案裡附上出處的那一類,因為後者的交換條件跟搜尋引擎一樣。代價算得出來:Google-Extended 是訓練專用的 token,Googlebot 不會參考它。

名單有兩處值得自己判斷:PerplexityBot 依官方文件屬於搜尋索引那一類,本站仍把它放進拒絕名單,那是本站的分類判斷;ChatGPT-User 這類請求官方已寫明可能不適用 robots.txt 規則,放行它更接近一種表態。引擎怎麼挑出處,寫在。

所以要不要放一個 llms.txt

建立一份 llms.txt 的成本很低,維護成本才是重點:它是手寫的索引,網站一改就過期,會把代理帶到不存在的網址。到查證日能確定的只有兩句:Google 說搜尋會忽略它,其他幾家沒有表態。robots.txt 那一側幾乎每一條都可查:它決定誰可以抓,不決定誰會被索引,更不決定誰會被引用。

  • 生活分享

    搜尋沒有點擊怎麼辦:用讀者任務重新看流量價值

    讀者在搜尋頁找到營業時間、電話或簡短答案,可能不必進入網站。這不代表每次未點擊都成功,也不能用網站 CTR 推算整個搜尋的零點擊率。本文以原創衣物修改店案例,從查資料、比較服務與預約需求出發,整理搜尋呈現、商家互動與實際任務的檢查方法,附比較表、操作步驟和原創 SVG 圖解。

  • 生活分享

    Perplexity 入門:附引用的 AI 搜尋、方案與隱私設定

    Perplexity 是把答案和引用放在一起的搜尋 AI。這篇說明一次查詢怎麼跑完五步、和 Google 搜尋與 ChatGPT 搜尋差在哪、官網現在的方案價格與額度、Search 與 Deep Research 等模式怎麼挑、可選哪些模型、Spaces 與檔案上傳限制,以及 AI data retention 在哪裡關。數字查自 2026 年 9 月 14 日的官網。

  • 生活分享

    網站 AI 搜尋怎麼規劃:內容索引、回答與搜尋紀錄

    網站搜尋 AI 上線前,先決定哪些內容可被引用,以及找不到答案時如何回應。本文以原創手作展館網站為例,整理內容索引、來源引用、資料權限與更新驗收,並設計一份可用 Notion 管理的搜尋改善紀錄。附操作步驟、欄位比較表和自繪圖解,協助站長從讀者問題找出內容缺口,同時避免把全部查詢與個人資料直接存進共用工作區。

  • 生活分享

    AI 搜尋曝光怎麼量:提示問題、引用與工具限制

    AI 回答提到品牌、附上網站連結與真正帶來造訪,是不同的觀察結果。本文以原創地方活動網站案例,建立固定問題集、重複觀察及引用核對流程,並比較 Google 生成式 AI 曝光、Bing 引用資料與站內分析各能回答什麼。附操作步驟、工具比較表和原創 SVG,協助讀者保留樣本與分母,不把單次回答寫成市場排名。

最新旅遊情報攻略

資料來源

生活分享