生活分享
llms.txt 是什麼:一份社群提案,以及 robots.txt 真正能做的事
llms.txt 是 2024 年提出的社群提案,不是標準:到 2026 年 9 月 14 日為止,只有 Google 在官方文件裡明講搜尋不使用它,其餘幾家沒有表態,也沒有引擎公布過消費它的證據。本文同時寫清楚 robots.txt 擋抓取不擋索引、被擋的網址連 noindex 都讀不到,並把訓練、搜尋索引、代使用者即時取用三類爬蟲分開,最後附本站的做法與理由。
更新日期: 閱讀時間約 7 分鐘

這篇回答一個問題:網站根目錄要不要放一個 llms.txt。結論是它是社群提案,不是任何引擎承諾會讀取的檔案;到 2026 年 9 月 14 日為止,唯一明確表態的搜尋引擎是 Google,寫的是搜尋不使用這類檔案。
這篇把常被混在一起的三組東西分開:提案與已部署的機制、擋抓取與擋索引、訓練用爬蟲與搜尋索引爬蟲與代使用者取用的擷取器。文末附本站的做法與理由,那是帶日期的選擇,不是通則。
llms.txt 是誰提的,說要解決什麼
提案網站標明作者是 Jeremy Howard,發表日期是 2024 年 9 月 3 日,現在掛的是第二版。它的定義是:提議統一用一個 llms.txt 檔案,提供資訊協助代理(Agent)使用這個網站——理由是網頁為人而做,還原成乾淨文字既困難又耗 token。
提案原文把分工寫清楚:robots.txt 讓自動化工具知道哪些存取可接受,llms.txt 則是代理需要某個主題的資訊時按需使用——這是提案作者的說法,不是引擎公布的資料。整個系列的地圖放在這個系列的總覽GEO、AEO、AIO 與 SEO 名詞總索引:四個縮寫差在哪SEO、GEO、AEO、AIO 常被混著用,但它們想換到的東西不同,定義的共識程度也不同。這份索引用一張比較表把四個縮寫分開,連到各篇專文,並逐條列出目前沒有共識的五個地方,包括 GEO 與 AEO 是不是同一件事,以及 llms.txt 有沒有引擎真的在讀。閱讀全文。
格式:只有一個區塊是必填
規格很短。檔名是 llms.txt,放在網站根目錄或任何子路徑;內容是一個 H1 標題、一段引文格式的摘要,再加上以 H2 分隔的 markdown 連結清單,唯一必填的是那個 H1 標題。規格沒有規定任何引擎必須讀它,也沒有定義讀了之後會怎樣。
# 網站或專案名稱
> 一句話摘要,放理解後面內容所需的關鍵資訊
這裡可以放幾段補充說明,但不能用標題。
## 章節名稱
- [連結標題](https://example.com/page.md): 選填的說明
## Optional
- [次要連結](https://example.com/extra.md)
哪些引擎表態過,哪些沒有
Google 是唯一在官方文件裡寫清楚的。它的生成式 AI生成式 AI(Generative AI)是什麼生成式 AI 從資料學到模式,依輸入條件產生文字、影像、聲音等內容。本文以社區二手市集宣傳素材為例,說明生成與分類、搜尋的差別,介紹語言模型、擴散與對抗生成等不同途徑,並解析內容看起來合理卻可能不忠於事實的原因。讀完能把創意需求、必須保留的資訊與人工驗收分開安排,判斷哪些產物仍只是待確認草稿。閱讀全文 最佳化指南在破除迷思那一節寫:你不需要為了出現在 Google 搜尋而建立機器可讀檔案或 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 文字檔,搜尋不使用它們;維護它們給其他服務用沒問題,但不會傷害也不會幫助你的能見度或排名。這是官方文件說明的機制;更新記錄把這段註記的日期寫成 2026 年 6 月 15 日。
其他幾家沒有表態。到查證日為止,OpenAI、Anthropic、Perplexity 的爬蟲文件,都沒有把 llms.txt 寫成自家系統會讀取的檔案。沒有表態不等於否認,但也不能當成證據:沒有一家公布過自家系統會消費它。
另一件常被當成證據的事:這幾家的開發者文件站自己都放了 llms.txt——那是發布者的行為,不是它們的爬蟲會去讀別人的。
這個題目的搜尋結果絕大多數是代理商或工具商的行銷內容,常見標題是「放了就能增加 AI 曝光」;那屬於廠商行銷主張這一級,通常沒指出是誰在保證。判準寫在量測引用那一篇怎麼量 AI 引用:測得到的、測不到的,與不能相信的分數AI 回答裡出現自己的網站,到底量不量得到?這篇不重複 Search Console 的操作流程,而是講量測邊界:referrer 依規範預設只送來源網域、伺服器日誌記的是爬蟲取用而不是使用者看到引用、自己問一次 AI 不構成樣本。另外整理 Google 與 Bing 官方報表自己寫明的涵蓋範圍與限制,以及看到「AI 能見度分數」時該追問的三個問題。查證日 2026 年 9 月 14 日。閱讀全文。
robots.txt 擋的是抓取,不是索引
對照組是 robots.txt。Google 的官方說明很直接:它主要用來避免網站被大量請求壓垮,不是讓網頁不出現在 Google 的機制;被擋住的網址如果有別的網站連過來,仍可能被建立索引。抓取、索引、出現在結果裡是三層狀態,分法寫在SEO 那一篇SEO 是什麼:搜尋引擎最佳化在 AI 時代沒有改變的那一半這篇說明搜尋引擎最佳化(SEO)裡有官方文件可查的那一半:HTTP 成功、可被抓取、已被索引、出現在結果裡是四件事,canonical、hreflang、sitemap、robots.txt 各自解決不同問題。文中把每個說法分成官方文件說明的機制、業界慣例、廠商行銷主張三級,並說明為什麼生成式答案仍然從被索引的頁面取材。本文不承諾任何排名或引用結果。閱讀全文。
關鍵的一層在這裡:Google 的 noindex 說明寫著,要讓 noindex 生效,該網頁不能被 robots.txt 擋住,必須是爬蟲能存取的。想把一頁移出搜尋結果,就要讓爬蟲讀得到頁面上的 noindex。
robots 指令不是授權控制
robots.txt 的規範原文是 RFC 9309,2022 年 9 月以標準軌發布。規範自己寫明:這些規則不是一種存取授權,也不能取代有效的內容安全措施。一行 Disallow 是告示,不是鎖,遵不遵守靠慣例。
三種爬蟲,三個 user-agent
這是本篇最有用的一段。訓練用爬蟲、搜尋索引爬蟲、代使用者取用的擷取器是三件事,各家用不同的 user-agent 把它們分開;你寫下哪一個名字,後果完全不同。
訓練那一類,寫得最清楚的是 Google-Extended:Google 說發布者可以用它管理抓到的內容是否可用於訓練未來的 Gemini 模型,並明寫它不影響網站在搜尋的收錄,也不是排名訊號。GPTBot 與 ClaudeBot 的官方描述同樣是抓可能用於訓練的內容。
搜尋索引那一類,目的是讓網站出現在該服務的結果裡。OAI-SearchBot 用於搜尋,讓網站出現在 ChatGPT 的搜尋結果中;PerplexityBot 依官方文件是為了在 Perplexity 的結果中呈現並連結網站,而且明說它不用於為基礎模型抓取內容。
第三類是使用者當下觸發的取用。Google 寫明使用者觸發的擷取器通常會忽略 robots.txt 規則,理由是取用由使用者要求;OpenAI 與 Perplexity 對自家的 ChatGPT-User、Perplexity-User 寫了同一件事。所以這一類,robots.txt 裡的一行接近表態,而不是閘門。
| 這一類是什麼 | 官方文件寫的用途 | user-agent 例子 | 在 robots.txt 擋掉會怎樣 |
|---|---|---|---|
| 訓練用爬蟲 | 可能用於訓練生成式基礎模型 | Google-Extended、GPTBot、ClaudeBot | 官方文件說會遵守;Google 與 Apple 另寫明不影響收錄 |
| 搜尋索引爬蟲 | 建索引,出現在該服務的結果 | Googlebot、OAI-SearchBot、Claude-SearchBot | OpenAI 明寫退出的網站不出現在 ChatGPT 答案裡 |
| 代使用者取用的擷取器 | 提問時去讀那一頁並附連結 | ChatGPT-User、Claude-User、Perplexity-User | Google 與 Perplexity 寫通常忽略;OpenAI 寫可能不適用 |
閱讀完整文字說明
一張三列的對照圖。每一列由左到右是:這一類在做什麼、各家的 user-agent 例子、在 robots.txt 擋掉會怎樣。第一列是訓練用爬蟲,抓內容可能用於訓練生成式基礎模型,例子有 Google-Extended、GPTBot、ClaudeBot,官方文件說會遵守,Google 與 Apple 另寫明擋掉不影響搜尋收錄。第二列是搜尋索引爬蟲,建索引讓網站出現在該服務的結果裡,例子有 Googlebot、OAI-SearchBot、Claude-SearchBot,OpenAI 明寫退出的網站不出現在 ChatGPT 答案裡。第三列是代使用者取用的擷取器,使用者提問時去讀那一頁、答案裡附連結,例子有 ChatGPT-User、Claude-User、Perplexity-User,官方文件寫這一類通常忽略 robots.txt,所以那一行接近表態,不是閘門。圖的底部寫著:三件事各自有名字,你在 robots.txt 寫下哪一個,後果完全不同。
本站目前的做法(2026 年 9 月 14 日查證)
以下是 Mokaair 自己 robots.txt 的內容與理由,它剛好把上面幾條規則用在一個檔案裡。這是本站在這個日期的選擇,不是要你照抄的清單;本站沒有做過任何量測,也不主張這樣設定改變了本站的曝光。
- 給所有爬蟲的那一組允許整站,只擋機器用的端點與不該被猜到的 token 網址:API、後台、分享與轉址路徑。
- 會員頁面刻意保持可被抓取,改用頁面上的 noindex,理由就是上一節那一條。
- 拒絕的名單只留訓練用爬蟲,目前 9 個 user-agent,包含 GPTBot、CCBot、Google-Extended 等;會引用來源的搜尋型爬蟲(PerplexityBot、ClaudeBot)與替使用者取頁的 ChatGPT-User、OAI-SearchBot 刻意不在名單上,政策可由環境變數切換。
取捨的理由寫在程式碼註解裡:被拒絕的是收集頁面拿去訓練、或把內容轉售成一個答案的爬蟲,放行的是代使用者即時取用、並在答案裡附上出處的那一類,因為後者的交換條件跟搜尋引擎一樣。代價算得出來:Google-Extended 是訓練專用的 token,Googlebot 不會參考它。
名單有兩處值得自己判斷:PerplexityBot 依官方文件屬於搜尋索引那一類,本站仍把它放進拒絕名單,那是本站的分類判斷;ChatGPT-User 這類請求官方已寫明可能不適用 robots.txt 規則,放行它更接近一種表態。引擎怎麼挑出處,寫在生成式答案那一篇AI 摘要與 AI 模式:生成式答案怎麼組出來,站長能控制什麼這篇只講機制:Google 官方文件對 AI 摘要與 AI 模式寫到哪裡為止,查詢展開、檢索、接地、挑引用各是什麼,為什麼被檢索到、被用來接地、被列為引用是三件不同的事,以及 nosnippet、max-snippet、data-nosnippet 與搜尋生成式 AI 控制各自做什麼、代價是什麼。操作步驟不在這篇,文中連到既有的兩篇教學。本文不承諾任何引用或流量結果。閱讀全文。
所以要不要放一個 llms.txt
建立一份 llms.txt 的成本很低,維護成本才是重點:它是手寫的索引,網站一改就過期,會把代理帶到不存在的網址。到查證日能確定的只有兩句:Google 說搜尋會忽略它,其他幾家沒有表態。robots.txt 那一側幾乎每一條都可查:它決定誰可以抓,不決定誰會被索引,更不決定誰會被引用。
同主題延伸閱讀
生活分享
搜尋沒有點擊怎麼辦:用讀者任務重新看流量價值
讀者在搜尋頁找到營業時間、電話或簡短答案,可能不必進入網站。這不代表每次未點擊都成功,也不能用網站 CTR 推算整個搜尋的零點擊率。本文以原創衣物修改店案例,從查資料、比較服務與預約需求出發,整理搜尋呈現、商家互動與實際任務的檢查方法,附比較表、操作步驟和原創 SVG 圖解。
生活分享
Perplexity 入門:附引用的 AI 搜尋、方案與隱私設定
Perplexity 是把答案和引用放在一起的搜尋 AI。這篇說明一次查詢怎麼跑完五步、和 Google 搜尋與 ChatGPT 搜尋差在哪、官網現在的方案價格與額度、Search 與 Deep Research 等模式怎麼挑、可選哪些模型、Spaces 與檔案上傳限制,以及 AI data retention 在哪裡關。數字查自 2026 年 9 月 14 日的官網。
生活分享
網站 AI 搜尋怎麼規劃:內容索引、回答與搜尋紀錄
網站搜尋 AI 上線前,先決定哪些內容可被引用,以及找不到答案時如何回應。本文以原創手作展館網站為例,整理內容索引、來源引用、資料權限與更新驗收,並設計一份可用 Notion 管理的搜尋改善紀錄。附操作步驟、欄位比較表和自繪圖解,協助站長從讀者問題找出內容缺口,同時避免把全部查詢與個人資料直接存進共用工作區。
生活分享
AI 搜尋曝光怎麼量:提示問題、引用與工具限制
AI 回答提到品牌、附上網站連結與真正帶來造訪,是不同的觀察結果。本文以原創地方活動網站案例,建立固定問題集、重複觀察及引用核對流程,並比較 Google 生成式 AI 曝光、Bing 引用資料與站內分析各能回答什麼。附操作步驟、工具比較表和原創 SVG,協助讀者保留樣本與分母,不把單次回答寫成市場排名。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- llms.txt 提案原文(提案本身的網站,第二版) · 查證日期:
- Google 搜尋中心:生成式 AI 功能最佳化指南(含 llms.txt 說明) · 查證日期:
- Google 搜尋中心:搜尋文件更新記錄(llms.txt 註記的加入日期) · 查證日期:
- RFC 9309:Robots Exclusion Protocol(規範原文) · 查證日期:
- Google 搜尋中心:robots.txt 簡介與指南 · 查證日期:
- Google 搜尋中心:使用 noindex 禁止建立索引 · 查證日期:
- Google 搜尋中心:Google 的常見爬蟲(含 Google-Extended) · 查證日期:
- Google 搜尋中心:使用者觸發的擷取器 · 查證日期:
- OpenAI 開發者文件:OpenAI 爬蟲總覽(GPTBot、OAI-SearchBot、ChatGPT-User) · 查證日期:
- Anthropic 說明中心:Anthropic 是否抓取網路資料,站方如何封鎖(ClaudeBot、Claude-User、Claude-SearchBot) · 查證日期:
- Perplexity 開發者文件:Perplexity 的爬蟲(PerplexityBot、Perplexity-User) · 查證日期:
- Apple 支援:關於 Applebot 與 Applebot-Extended · 查證日期: