生活分享

單價之外:快取、長上下文門檻與 tokenizer 怎麼改變帳單

每百萬 token 的單價只是起點。這篇把三個官網有寫、但不在主價目表上的欄位攤開:快取命中價(多數家原價 10%,DeepSeek 低到 2%、xAI 要 25%)、長上下文加價門檻(xAI 明寫跨過去整筆請求都用高價計,Anthropic 則完全沒有這道門檻),以及各家 tokenizer 切出來的 token 數不一樣。附一套重估帳單的順序。

更新日期: 閱讀時間約 7 分鐘

一條橫線上有三個大小不同的關卡,線的左端是一個小方塊代表單價,右端是一個較大的方塊代表帳單
圖片:Mokaair (© Mokaair)

把各家的每百萬 token 單價排成一張表之後,下一個問題是:照這張表估出來的數字,跟月底實際收到的帳單差多少。答案通常是差不少,而且差的方向不一定。這篇講三個會讓兩者對不起來的欄位,它們都寫在官網上,只是不在最顯眼的那張價目表裡。

這三件事的共同點是:它們不改變模型能力,只改變同一份工作的計價方式。所以它們不影響你選哪個模型好用,卻可能直接改變哪一家比較便宜的結論。

快取:重複的開頭只付一小筆

如果你每次請求都送同一份系統指示、同一批參考文件,那段內容可以被快取起來,之後只付一筆很小的讀取費。這對正式產品幾乎一定適用,因為提示詞的前半段通常是固定的。

各家的命中價多數落在原輸入價的 10%,但兩端拉得很開:DeepSeek 的 deepseek-flash 只要原價的 2%,xAI 的 grok-4.6 要 25%。同一份固定前綴,在不同家省下來的比例差了十倍以上。

各家官網 2026 年 9 月 17 日當天的快取命中價,依命中價由高到低排。DeepSeek 為尖峰時段價,離峰再對折。百分比為本站以同頁的原輸入價相除後四捨五入。
廠商模型快取命中價/百萬原輸入價/百萬命中價是原價的
OpenAIgpt-6-astra1.00 美元10.00 美元10%
AnthropicClaude Opus 50.50 美元5 美元10%
xAIgrok-4.60.50 美元2.00 美元25%
Moonshotkimi-k30.30 美元3.00 美元10%
AnthropicClaude Fable 5.10.25 美元10 美元2.5%
Googlegemini-3.1-pro-preview0.20 美元(另收儲存費)2.00 美元10%
AnthropicClaude Sonnet 50.20 美元2 美元10%
OpenAIgpt-5.6-terra0.20 美元2.00 美元10%
xAIgrok-4.30.20 美元1.25 美元16%
AnthropicClaude Haiku 4.50.10 美元1 美元10%
Googlegemini-3.8-flash0.075 美元(另收儲存費)0.75 美元10%
OpenAIgpt-5.4-mini0.075 美元0.75 美元10%
MiniMaxMiniMax-M30.06 美元0.30 美元20%
DeepSeekdeepseek-v4-pro0.044 美元1.32 美元3.3%
OpenAIgpt-5.6-luna0.02 美元0.20 美元10%
DeepSeekdeepseek-flash0.006 美元0.30 美元2%
OpenAIgpt-5-nano0.005 美元0.05 美元10%

有三個細節容易漏看。第一,快取通常要先付一筆寫入費:Anthropic 的 5 分鐘寫入是原價的 1.25 倍、1 小時寫入是 2 倍,官網直接寫明 5 分鐘那種讀一次就回本、1 小時要讀兩次。第二,Google 的快取除了單價還另外按小時收儲存費,gemini-3.1-pro-preview 是每百萬 token 每小時 4.50 美元,放著不用也在計費。第三,Anthropic 的 Claude Fable 5.1 命中價是原價的 2.5% 而不是 10%,是它自己家的例外。

長上下文門檻:跨過去就整筆變貴

幾家把上下文分成兩段計價,超過某個 token 數就換一套價。關鍵在於跨過去之後怎麼算——多數人以為只有超出的部分變貴,但官網寫的不是這樣。

2026 年 9 月 17 日各家官網定價頁。Anthropic 與其他家相反,明文寫出全程同一個單價,沒有第二段價。
廠商門檻跨過去之後怎麼算
Anthropic沒有門檻100 萬 token 全程標準價官網明寫 90 萬 token 的請求與 9 千 token 同一個單價
Google20 萬 token輸入 2.00 → 4.00、輸出 12.00 → 18.00 美元快取價也同步從 0.20 跳到 0.40 美元
xAI20 萬 token輸入 2.00 → 4.00、輸出 6.00 → 12.00 美元官網明寫:整筆請求的所有 token 都用高價計
MiniMax51.2 萬 token輸入 0.30 → 0.60、輸出 1.20 → 2.40 美元快取命中價同步 0.06 → 0.12 美元
OpenAI官網未標門檻定價頁分短脈絡與長脈絡兩欄有兩種價,但當天頁面沒有寫切換的 token 數

xAI 的定價頁把規則寫得最直白:請求的提示詞達到門檻,整筆請求的所有 token 都用高價計。也就是說一個 19.9 萬 token 的請求和一個 20.1 萬 token 的請求,後者不是多付那 2 千 token 的錢,而是整整二十萬 token 都換成兩倍單價。這種計價方式下,把提示詞壓在門檻以下是很具體的省錢動作。

Tokenizer:同一份文件不是同一個 token 數

最後一件事會動搖前面所有比較的前提:token 不是一個跨廠商的標準單位。同一份文件送進不同家,被切成的 token 數不一樣,所以「每百萬 token 多少錢」相同,不代表跑同一份工作的花費相同。

Anthropic 是少數把這件事寫在定價頁上的:Claude 4.7 以後的模型換了新的 tokenizer,同一段文字大約會多產生 30% 的 token,官網並註明實際增幅依內容而定,而 Claude Sonnet 4.6 以前的模型用的是舊的。換句話說,同一家的新舊模型之間,單價相同也不代表帳單相同。

這件事的實際後果是:單價便宜一成,如果 token 數多三成,總花費反而是貴的。所以拿兩家比價的時候,真正能比的是「同一份文件各自數出來幾個 token、乘上各自的單價」,不是把兩個單價並排看。各家官網都有 token 計數的端點或工具,拿你自己真正會送出去的內容去數一次,比看價目表準得多。

另外兩家的 tokenizer 差異,官網當天沒有可以直接引用的對照說明,所以這篇沒有替它們填數字。要比的話只能自己拿同一份文件分別去數。

一條從左到右的流程,把單價乘上 token 數之後,依序經過快取、長上下文門檻與 tokenizer 三個會改變金額的關卡,最後才是帳單
單價乘以 token 數只是起點,中間還要經過三道會改變金額的關卡才是帳單。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

由左到右的流程。最左邊是單價乘以 token 數,那只是起點。往右依序經過三個橘色的關卡:快取會把重複的前綴降到很低的命中價;長上下文門檻在跨過去之後可能讓整筆請求換一套價;tokenizer 決定同一份文件被切成幾個 token。三道都走過之後,最右邊才是實際的帳單。

各家的基礎單價、上下文視窗與權重授權排在一起的總表在;只想看價目表與免費層條款的話, 那篇寫得更細。快取本身的原理另有一篇。

怎麼用這三件事重估一次

這三欄不用全部算過,照下面的順序看一遍,通常兩三分鐘就知道自己的估算偏在哪裡。

  1. 先看提示詞裡有多少是每次都一樣的。超過一半就把那部分改用快取命中價重算,這通常是最大的一筆差額。
  2. 確認快取的寫入費與回本次數。Anthropic 官網寫得最清楚:5 分鐘快取讀一次回本,1 小時快取要讀兩次;用 Google 的還要另外把每小時儲存費加進去。
  3. 量一下實際請求的 token 數,跟你那家的長上下文門檻比。壓在門檻以下的價值,在 xAI 那種整筆改價的規則下特別高。
  4. 換模型時重新量 token 數,不要沿用舊模型的數字。Anthropic 的 4.7 以後多約三成,別家官網當天沒有可引用的對照說明。
  5. 最後拿一天的真實流量跑一次,把帳單跟估算對一次,差多少就把差額補進假設再估一輪。

怎麼實際數自己的 token、有哪些官方計數工具,站上有;與兩個名詞如果還不熟,也各有一篇。

  • 生活分享

    各家 AI 模型總表:同級距的 token 規格與官方自報分數

    把 OpenAI、Anthropic、Google、xAI、阿里巴巴、Mistral、MiniMax、DeepSeek、Moonshot、Z.AI 各家官網當天的模型攤成四張表:旗艦、中階、輕量各一張,每一列同時給上下文視窗、最大輸出與每百萬 token 輸入輸出價,另加一張十二個開放權重模型的參數與授權表。效能欄只抄官網自己公布的分數,並說明為什麼六家官網用的 benchmark 幾乎沒有交集。

  • 生活分享

    API 價格比較:每百萬 token 各家多少

    接 API 之前先把價目表攤開:這篇抄下 OpenAI、Anthropic、Google Gemini、xAI、阿里雲百鍊、Mistral、MiniMax、DeepSeek 八家官網當天的旗艦、中階、輕量三級每百萬 token 輸入與輸出價,寫出快取價、批次折扣、免費層條款與計費幣別,最後附一段一萬次對話的算式讓你代入自己的用量。不評分、不宣稱實測,只照官網欄位排。

  • 生活分享

    token 計算與費用估算:官方計數工具、一次對話的算式與費用上限

    費用估算只有三個數字:輸入 token、輸出 token、每百萬 token 單價。這篇抄下 OpenAI、Anthropic、Google 官網當天寫的 token 與字元比例原文,給出 tiktoken、輸入 token 計數 API 與 countTokens 的官方範例,畫出一次對話裡系統提示詞與歷史怎麼累加,再用客服、翻譯一本書、每天摘要新聞三個情境把算式與假設寫出來,最後是三家設費用上限的位置。

  • 生活分享

    提示詞快取(Prompt Caching):重用相同字首的計算

    提示詞快取重用先前處理過的相同輸入字首,減少重複讀取長指令或文件的計算。本文用同一份活動手冊的連續問答示範首次寫入、後續命中與字首失效,區分提示詞快取、答案快取和長期記憶,也解釋為什麼省輸入處理不等於省下所有輸出時間。讀完能檢查實際命中、版本更新、隱私隔離與費用條件,不把快取當成免費或永久記住資料。

最新旅遊情報攻略

資料來源

生活分享