生活分享

提示詞快取(Prompt Caching):重用相同字首的計算

提示詞快取重用先前處理過的相同輸入字首,減少重複讀取長指令或文件的計算。本文用同一份活動手冊的連續問答示範首次寫入、後續命中與字首失效,區分提示詞快取、答案快取和長期記憶,也解釋為什麼省輸入處理不等於省下所有輸出時間。讀完能檢查實際命中、版本更新、隱私隔離與費用條件,不把快取當成免費或永久記住資料。

更新日期: 閱讀時間約 7 分鐘

固定文件字首的處理結果沿多條路徑供不同問題重用
圖片:Mokaair (© Mokaair)

提示詞快取,英文 Prompt Caching,是讓推論系統重用已處理的相同提示詞字首,減少重複計算的做法。若多次請求都包含同一份長手冊,只有最後的問題不同,系統有機會沿用共同字首的處理結果,而不必每次從頭計算全部內容。它是在重用輸入處理,不是讓模型永久學會手冊。

不同服務的啟用方式、最低長度、有效時間與計費規則不同。本篇參考 Anthropic 提示詞快取文件與 vLLM 的自動字首快取說明,只談可共用的機制,不列容易變動的價格與額度。例子以虛構活動手冊作示意,實際是否命中應看服務回傳的使用量或系統指標,不能只憑回答變快就宣稱成功。

重用的是字首處理結果

語言模型處理一個請求,可區分讀取輸入的階段與逐步產生新 token 的階段。像 vLLM 的字首快取,會重用共享字首已有的注意力快取等計算結果,減少重複輸入處理。其官方文件特別指出,這不會直接縮短新 token 的生成工作。因此短輸入、很長輸出的任務,未必得到同樣明顯的整體改善。

字首是從輸入開頭開始的一段連續相同內容,不是只要兩段意思相近就能重用。若每次把不同時間戳記放在最前面,後面的長手冊即使沒改,也可能破壞共享字首。工具定義、系統文字、圖片或其他設定是否影響快取鍵,依服務實作而定,應按正在使用的平臺文件檢查,不能只比較肉眼看得到的最後問題。

第一次寫入,後續才可能命中

首次送入沒有快取的字首,系統仍需完成處理,並依配置儲存可重用結果。後續請求若符合相同字首、有效期、模型與隔離範圍等條件,才可能讀取快取。寫入與命中是不同狀態;應用說「已啟用」只表示功能開關或配置存在,不等於每次請求都會省下運算。

Anthropic 文件提供自動處理與明確快取邊界等方式,並說明相同內容、模型及平臺條件會影響效果。vLLM 則展示推論引擎中的自動字首重用。兩者可用來理解概念,但不能把某個 API 的邊界照搬到另一個系統。最可靠的驗證是比較服務實際報告的快取讀取、建立及未快取輸入資訊。

相同規則與手冊形成共用字首,開放時間與裝置借用兩個不同問題各自接在後面並生成答案,修訂手冊則需新版本
字首相同只是必要條件之一,實際命中仍依平臺設定。 · 圖片:Mokaair (© Mokaair)

示範:同一份手冊連續提問

假設應用每次先放固定回答規則和活動手冊,最後才放讀者問題。第一次問「場地何時開放」,系統處理整段共同內容;第二次問「裝置如何借用」,在條件仍符合時,可以重用前面的規則與手冊,只對變化的問題及後續生成做必要處理。這是預期流程,沒有實際呼叫服務或測量速度。

如果應用每次都把問題放到手冊之前,共同字首可能很早就分岔,效果會不同。因此可把穩定內容放前面,變動內容放後面,但仍要維持指令與資料的清楚邊界,不能為了命中率讓模型難以理解任務。資料順序是品質與效率的共同設計,不是只調整快取就能忽略回答行為。

當手冊修訂裝置借用規則時,新的內容應形成相應的輸入版本,不能為了沿用舊快取而繼續傳舊文件。預期答案要依新版,舊版仍可保留給明確的歷史查詢。快取若正確辨認不同內容,未命中不是失敗,而是防止錯誤重用的必要結果。需要追查的是應用究竟送出了哪一版手冊。

和答案快取、記憶的差別

答案快取把先前問題對應的完整答案存起來,之後直接回傳或經其他規則重用。提示詞快取則仍會針對新問題產生答案,不能把它理解成所有人都收到同一段文字。對有取樣或其他變動的模型,兩次輸出可能不同;快取的目標是重用等價的字首計算,而不是保證每次文字逐字相同。

長期記憶則是應用選擇儲存並在未來提供的使用者資訊,例如偏好或專案背景。提示詞快取可能有短暫保留期限,也可能因資源管理被淘汰,不能用它當成持久資料庫。上下文壓縮又是改寫或縮短輸入內容,和重用相同內容的計算不同。把這幾種機制分開,才不會誤解資料是否真的被儲存或改變。

如何檢查效率與資料邊界

評估時分開記錄首次請求、命中請求與字首變更後的請求,檢視輸入處理時間和總回應時間。若沒有命中,檢查字首是否完全一致、最低長度、有效期、模型與配置;若有命中但總時間改善不大,可能瓶頸在輸出生成或工具等待。不要因感覺快慢就反覆重排資料,應先找實際指標。

費用也要按服務規則計算。有些平臺區分快取寫入與讀取,有些自行部署方案主要是硬體資源的節省;命中不代表完全免費。應以當時官方計價與實際使用量核對,而不是把某次宣傳的折扣當成普遍屬性。若內容很少重複,為快取增加的管理或寫入成本也可能不划算。

資料隔離仍需明確設計。服務可能按組織、工作區或其他範圍隔離,應用自己也要確保使用者不能透過共享流程接觸無權讀取的內容。不要把機密資料放入公開共用字首,再期待模型自行判斷不透露。快取功能與資料保留政策是相關但不同的議題,需要按實際平臺與配置確認。一個適合提示詞快取的工作負載,通常有穩定且重複使用的長指令、文件或對話字首。若每次內容都完全不同,先改善資料選取與上下文組織可能更有效。快取的價值在減少同一工作被重做,並沒有替原始內容、來源版本或回答正確性背書。

概念對照;來源查證於 2026 年 9 月。
方法處理重點需要留意
提示詞快取重用相同字首的計算仍需生成新回答
答案快取重用已完成的答案需判斷答案是否仍適用
長期記憶儲存之後可能使用的資訊需要持久儲存與取回設計

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享