生活分享
提示詞快取(Prompt Caching):重用相同字首的計算
提示詞快取重用先前處理過的相同輸入字首,減少重複讀取長指令或文件的計算。本文用同一份活動手冊的連續問答示範首次寫入、後續命中與字首失效,區分提示詞快取、答案快取和長期記憶,也解釋為什麼省輸入處理不等於省下所有輸出時間。讀完能檢查實際命中、版本更新、隱私隔離與費用條件,不把快取當成免費或永久記住資料。
更新日期: 閱讀時間約 7 分鐘

提示詞快取,英文 Prompt Caching,是讓推論系統重用已處理的相同提示詞字首,減少重複計算的做法。若多次請求都包含同一份長手冊,只有最後的問題不同,系統有機會沿用共同字首的處理結果,而不必每次從頭計算全部內容。它是在重用輸入處理,不是讓模型永久學會手冊。
不同服務的啟用方式、最低長度、有效時間與計費規則不同。本篇參考 Anthropic 提示詞快取文件與 vLLM 的自動字首快取說明,只談可共用的機制,不列容易變動的價格與額度。例子以虛構活動手冊作示意,實際是否命中應看服務回傳的使用量或系統指標,不能只憑回答變快就宣稱成功。
重用的是字首處理結果
語言模型處理一個請求,可區分讀取輸入的階段與逐步產生新 token 的階段。像 vLLM 的字首快取,會重用共享字首已有的注意力快取等計算結果,減少重複輸入處理。其官方文件特別指出,這不會直接縮短新 token 的生成工作。因此短輸入、很長輸出的任務,未必得到同樣明顯的整體改善。
字首是從輸入開頭開始的一段連續相同內容,不是只要兩段意思相近就能重用。若每次把不同時間戳記放在最前面,後面的長手冊即使沒改,也可能破壞共享字首。工具定義、系統文字、圖片或其他設定是否影響快取鍵,依服務實作而定,應按正在使用的平臺文件檢查,不能只比較肉眼看得到的最後問題。
第一次寫入,後續才可能命中
首次送入沒有快取的字首,系統仍需完成處理,並依配置儲存可重用結果。後續請求若符合相同字首、有效期、模型與隔離範圍等條件,才可能讀取快取。寫入與命中是不同狀態;應用說「已啟用」只表示功能開關或配置存在,不等於每次請求都會省下運算。
Anthropic 文件提供自動處理與明確快取邊界等方式,並說明相同內容、模型及平臺條件會影響效果。vLLM 則展示推論引擎中的自動字首重用。兩者可用來理解概念,但不能把某個 API 的邊界標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文照搬到另一個系統。最可靠的驗證是比較服務實際報告的快取讀取、建立及未快取輸入資訊。
示範:同一份手冊連續提問
假設應用每次先放固定回答規則和活動手冊,最後才放讀者問題。第一次問「場地何時開放」,系統處理整段共同內容;第二次問「裝置如何借用」,在條件仍符合時,可以重用前面的規則與手冊,只對變化的問題及後續生成做必要處理。這是預期流程,沒有實際呼叫服務或測量速度。
如果應用每次都把問題放到手冊之前,共同字首可能很早就分岔,效果會不同。因此可把穩定內容放前面,變動內容放後面,但仍要維持指令與資料的清楚邊界,不能為了命中率讓模型難以理解任務。資料順序是品質與效率的共同設計,不是只調整快取就能忽略回答行為。
當手冊修訂裝置借用規則時,新的內容應形成相應的輸入版本,不能為了沿用舊快取而繼續傳舊文件。預期答案要依新版,舊版仍可保留給明確的歷史查詢。快取若正確辨認不同內容,未命中不是失敗,而是防止錯誤重用的必要結果。需要追查的是應用究竟送出了哪一版手冊。
和答案快取、記憶的差別
答案快取把先前問題對應的完整答案存起來,之後直接回傳或經其他規則重用。提示詞快取則仍會針對新問題產生答案,不能把它理解成所有人都收到同一段文字。對有取樣或其他變動的模型,兩次輸出可能不同;快取的目標是重用等價的字首計算,而不是保證每次文字逐字相同。
長期記憶則是應用選擇儲存並在未來提供的使用者資訊,例如偏好或專案背景。提示詞快取可能有短暫保留期限,也可能因資源管理被淘汰,不能用它當成持久資料庫。上下文壓縮又是改寫或縮短輸入內容,和重用相同內容的計算不同。把這幾種機制分開,才不會誤解資料是否真的被儲存或改變。
如何檢查效率與資料邊界
評估時分開記錄首次請求、命中請求與字首變更後的請求,檢視輸入處理時間和總回應時間。若沒有命中,檢查字首是否完全一致、最低長度、有效期、模型與配置;若有命中但總時間改善不大,可能瓶頸在輸出生成或工具等待。不要因感覺快慢就反覆重排資料,應先找實際指標。
費用也要按服務規則計算。有些平臺區分快取寫入與讀取,有些自行部署方案主要是硬體資源的節省;命中不代表完全免費。應以當時官方計價與實際使用量核對,而不是把某次宣傳的折扣當成普遍屬性。若內容很少重複,為快取增加的管理或寫入成本也可能不划算。
資料隔離仍需明確設計。服務可能按組織、工作區或其他範圍隔離,應用自己也要確保使用者不能透過共享流程接觸無權讀取的內容。不要把機密資料放入公開共用字首,再期待模型自行判斷不透露。快取功能與資料保留政策是相關但不同的議題,需要按實際平臺與配置確認。一個適合提示詞快取的工作負載,通常有穩定且重複使用的長指令、文件或對話字首。若每次內容都完全不同,先改善資料選取與上下文組織可能更有效。快取的價值在減少同一工作被重做,並沒有替原始內容、來源版本或回答正確性背書。
| 方法 | 處理重點 | 需要留意 |
|---|---|---|
| 提示詞快取 | 重用相同字首的計算 | 仍需生成新回答 |
| 答案快取 | 重用已完成的答案 | 需判斷答案是否仍適用 |
| 長期記憶 | 儲存之後可能使用的資訊 | 需要持久儲存與取回設計 |
上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文
上下文壓縮(Context Compaction)是什麼:讓長任務接得下去上下文壓縮(Context Compaction)是什麼:讓長任務接得下去上下文壓縮是將長對話或工作紀錄整理成較短的續作資訊,讓模型在有限視窗內繼續任務;它不是無損備份,也不會擴大模型本身的容量。本文用搬家規劃的情境,示範交接摘要應保留目標、已確認決策、否定條件與未完成事項,並分清摘要、刪除舊工具結果和外部記憶。附壓縮前後核對方法,避免把待確認事項變成已完成的承諾。閱讀全文
代理記憶(Agent Memory)是什麼:保存、取回與更新資訊代理記憶(Agent Memory)是什麼:保存、取回與更新資訊代理記憶是讓 AI 系統保存並重新取用資訊的機制,可能包含對話狀態、使用者偏好與先前工作紀錄;它不是模型永遠記住全部內容。本文用讀書計畫助理的情境,說明短期狀態與跨對話記憶、原始事實與推論的差別,並提供檢查新增、修正、刪除與取回結果的步驟。附資料流程圖,幫你判斷記憶是否準確、過期或被放錯範圍。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Anthropic:Prompt caching · 查證日期:
- vLLM:Automatic Prefix Caching · 查證日期: