生活分享
單價之外:快取、長上下文門檻與 tokenizer 怎麼改變帳單
每百萬 token 的單價只是起點。這篇把三個官網有寫、但不在主價目表上的欄位攤開:快取命中價(多數家原價 10%,DeepSeek 低到 2%、xAI 要 25%)、長上下文加價門檻(xAI 明寫跨過去整筆請求都用高價計,Anthropic 則完全沒有這道門檻),以及各家 tokenizer 切出來的 token 數不一樣。附一套重估帳單的順序。
更新日期: 閱讀時間約 7 分鐘

把各家的每百萬 token 單價排成一張表之後,下一個問題是:照這張表估出來的數字,跟月底實際收到的帳單差多少。答案通常是差不少,而且差的方向不一定。這篇講三個會讓兩者對不起來的欄位,它們都寫在官網上,只是不在最顯眼的那張價目表裡。
這三件事的共同點是:它們不改變模型能力,只改變同一份工作的計價方式。所以它們不影響你選哪個模型好用,卻可能直接改變哪一家比較便宜的結論。
快取:重複的開頭只付一小筆
如果你每次請求都送同一份系統指示、同一批參考文件,那段內容可以被快取起來,之後只付一筆很小的讀取費。這對正式產品幾乎一定適用,因為提示詞的前半段通常是固定的。
各家的命中價多數落在原輸入價的 10%,但兩端拉得很開:DeepSeek 的 deepseek-flash 只要原價的 2%,xAI 的 grok-4.6 要 25%。同一份固定前綴,在不同家省下來的比例差了十倍以上。
| 廠商 | 模型 | 快取命中價/百萬 | 原輸入價/百萬 | 命中價是原價的 |
|---|---|---|---|---|
| OpenAI | gpt-6-astra | 1.00 美元 | 10.00 美元 | 10% |
| Anthropic | Claude Opus 5 | 0.50 美元 | 5 美元 | 10% |
| xAI | grok-4.6 | 0.50 美元 | 2.00 美元 | 25% |
| Moonshot | kimi-k3 | 0.30 美元 | 3.00 美元 | 10% |
| Anthropic | Claude Fable 5.1 | 0.25 美元 | 10 美元 | 2.5% |
| gemini-3.1-pro-preview | 0.20 美元(另收儲存費) | 2.00 美元 | 10% | |
| Anthropic | Claude Sonnet 5 | 0.20 美元 | 2 美元 | 10% |
| OpenAI | gpt-5.6-terra | 0.20 美元 | 2.00 美元 | 10% |
| xAI | grok-4.3 | 0.20 美元 | 1.25 美元 | 16% |
| Anthropic | Claude Haiku 4.5 | 0.10 美元 | 1 美元 | 10% |
| gemini-3.8-flash | 0.075 美元(另收儲存費) | 0.75 美元 | 10% | |
| OpenAI | gpt-5.4-mini | 0.075 美元 | 0.75 美元 | 10% |
| MiniMax | MiniMax-M3 | 0.06 美元 | 0.30 美元 | 20% |
| DeepSeek | deepseek-v4-pro | 0.044 美元 | 1.32 美元 | 3.3% |
| OpenAI | gpt-5.6-luna | 0.02 美元 | 0.20 美元 | 10% |
| DeepSeek | deepseek-flash | 0.006 美元 | 0.30 美元 | 2% |
| OpenAI | gpt-5-nano | 0.005 美元 | 0.05 美元 | 10% |
有三個細節容易漏看。第一,快取通常要先付一筆寫入費:Anthropic 的 5 分鐘寫入是原價的 1.25 倍、1 小時寫入是 2 倍,官網直接寫明 5 分鐘那種讀一次就回本、1 小時要讀兩次。第二,Google 的快取除了單價還另外按小時收儲存費,gemini-3.1-pro-preview 是每百萬 token 每小時 4.50 美元,放著不用也在計費。第三,Anthropic 的 Claude Fable 5.1 命中價是原價的 2.5% 而不是 10%,是它自己家的例外。
長上下文門檻:跨過去就整筆變貴
幾家把上下文分成兩段計價,超過某個 token 數就換一套價。關鍵在於跨過去之後怎麼算——多數人以為只有超出的部分變貴,但官網寫的不是這樣。
| 廠商 | 門檻 | 跨過去之後 | 怎麼算 |
|---|---|---|---|
| Anthropic | 沒有門檻 | 100 萬 token 全程標準價 | 官網明寫 90 萬 token 的請求與 9 千 token 同一個單價 |
| 20 萬 token | 輸入 2.00 → 4.00、輸出 12.00 → 18.00 美元 | 快取價也同步從 0.20 跳到 0.40 美元 | |
| xAI | 20 萬 token | 輸入 2.00 → 4.00、輸出 6.00 → 12.00 美元 | 官網明寫:整筆請求的所有 token 都用高價計 |
| MiniMax | 51.2 萬 token | 輸入 0.30 → 0.60、輸出 1.20 → 2.40 美元 | 快取命中價同步 0.06 → 0.12 美元 |
| OpenAI | 官網未標門檻 | 定價頁分短脈絡與長脈絡兩欄 | 有兩種價,但當天頁面沒有寫切換的 token 數 |
xAI 的定價頁把規則寫得最直白:請求的提示詞達到門檻,整筆請求的所有 token 都用高價計。也就是說一個 19.9 萬 token 的請求和一個 20.1 萬 token 的請求,後者不是多付那 2 千 token 的錢,而是整整二十萬 token 都換成兩倍單價。這種計價方式下,把提示詞壓在門檻以下是很具體的省錢動作。
Tokenizer:同一份文件不是同一個 token 數
最後一件事會動搖前面所有比較的前提:token 不是一個跨廠商的標準單位。同一份文件送進不同家,被切成的 token 數不一樣,所以「每百萬 token 多少錢」相同,不代表跑同一份工作的花費相同。
Anthropic 是少數把這件事寫在定價頁上的:Claude 4.7 以後的模型換了新的 tokenizer,同一段文字大約會多產生 30% 的 token,官網並註明實際增幅依內容而定,而 Claude Sonnet 4.6 以前的模型用的是舊的。換句話說,同一家的新舊模型之間,單價相同也不代表帳單相同。
這件事的實際後果是:單價便宜一成,如果 token 數多三成,總花費反而是貴的。所以拿兩家比價的時候,真正能比的是「同一份文件各自數出來幾個 token、乘上各自的單價」,不是把兩個單價並排看。各家官網都有 token 計數的端點或工具,拿你自己真正會送出去的內容去數一次,比看價目表準得多。
另外兩家的 tokenizer 差異,官網當天沒有可以直接引用的對照說明,所以這篇沒有替它們填數字。要比的話只能自己拿同一份文件分別去數。
閱讀完整文字說明
由左到右的流程。最左邊是單價乘以 token 數,那只是起點。往右依序經過三個橘色的關卡:快取會把重複的前綴降到很低的命中價;長上下文門檻在跨過去之後可能讓整筆請求換一套價;tokenizer 決定同一份文件被切成幾個 token。三道都走過之後,最右邊才是實際的帳單。
各家的基礎單價、上下文視窗與權重授權排在一起的總表在各家 AI 模型總表各家 AI 模型總表:同級距的 token 規格與官方自報分數把 OpenAI、Anthropic、Google、xAI、阿里巴巴、Mistral、MiniMax、DeepSeek、Moonshot、Z.AI 各家官網當天的模型攤成四張表:旗艦、中階、輕量各一張,每一列同時給上下文視窗、最大輸出與每百萬 token 輸入輸出價,另加一張十二個開放權重模型的參數與授權表。效能欄只抄官網自己公布的分數,並說明為什麼六家官網用的 benchmark 幾乎沒有交集。閱讀全文;只想看價目表與免費層條款的話,API 價格比較API 價格比較:每百萬 token 各家多少接 API 之前先把價目表攤開:這篇抄下 OpenAI、Anthropic、Google Gemini、xAI、阿里雲百鍊、Mistral、MiniMax、DeepSeek 八家官網當天的旗艦、中階、輕量三級每百萬 token 輸入與輸出價,寫出快取價、批次折扣、免費層條款與計費幣別,最後附一段一萬次對話的算式讓你代入自己的用量。不評分、不宣稱實測,只照官網欄位排。閱讀全文 那篇寫得更細。快取本身的原理另有提示詞快取提示詞快取(Prompt Caching):重用相同字首的計算提示詞快取重用先前處理過的相同輸入字首,減少重複讀取長指令或文件的計算。本文用同一份活動手冊的連續問答示範首次寫入、後續命中與字首失效,區分提示詞快取、答案快取和長期記憶,也解釋為什麼省輸入處理不等於省下所有輸出時間。讀完能檢查實際命中、版本更新、隱私隔離與費用條件,不把快取當成免費或永久記住資料。閱讀全文一篇。
怎麼用這三件事重估一次
這三欄不用全部算過,照下面的順序看一遍,通常兩三分鐘就知道自己的估算偏在哪裡。
- 先看提示詞裡有多少是每次都一樣的。超過一半就把那部分改用快取命中價重算,這通常是最大的一筆差額。
- 確認快取的寫入費與回本次數。Anthropic 官網寫得最清楚:5 分鐘快取讀一次回本,1 小時快取要讀兩次;用 Google 的還要另外把每小時儲存費加進去。
- 量一下實際請求的 token 數,跟你那家的長上下文門檻比。壓在門檻以下的價值,在 xAI 那種整筆改價的規則下特別高。
- 換模型時重新量 token 數,不要沿用舊模型的數字。Anthropic 的 4.7 以後多約三成,別家官網當天沒有可引用的對照說明。
- 最後拿一天的真實流量跑一次,把帳單跟估算對一次,差多少就把差額補進假設再估一輪。
怎麼實際數自己的 token、有哪些官方計數工具,站上有token 計算與費用估算token 計算與費用估算:官方計數工具、一次對話的算式與費用上限費用估算只有三個數字:輸入 token、輸出 token、每百萬 token 單價。這篇抄下 OpenAI、Anthropic、Google 官網當天寫的 token 與字元比例原文,給出 tiktoken、輸入 token 計數 API 與 countTokens 的官方範例,畫出一次對話裡系統提示詞與歷史怎麼累加,再用客服、翻譯一本書、每天摘要新聞三個情境把算式與假設寫出來,最後是三家設費用上限的位置。閱讀全文;tokentoken(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文與上下文視窗上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文兩個名詞如果還不熟,也各有一篇。
同主題延伸閱讀
生活分享
各家 AI 模型總表:同級距的 token 規格與官方自報分數
把 OpenAI、Anthropic、Google、xAI、阿里巴巴、Mistral、MiniMax、DeepSeek、Moonshot、Z.AI 各家官網當天的模型攤成四張表:旗艦、中階、輕量各一張,每一列同時給上下文視窗、最大輸出與每百萬 token 輸入輸出價,另加一張十二個開放權重模型的參數與授權表。效能欄只抄官網自己公布的分數,並說明為什麼六家官網用的 benchmark 幾乎沒有交集。
生活分享
API 價格比較:每百萬 token 各家多少
接 API 之前先把價目表攤開:這篇抄下 OpenAI、Anthropic、Google Gemini、xAI、阿里雲百鍊、Mistral、MiniMax、DeepSeek 八家官網當天的旗艦、中階、輕量三級每百萬 token 輸入與輸出價,寫出快取價、批次折扣、免費層條款與計費幣別,最後附一段一萬次對話的算式讓你代入自己的用量。不評分、不宣稱實測,只照官網欄位排。
生活分享
token 計算與費用估算:官方計數工具、一次對話的算式與費用上限
費用估算只有三個數字:輸入 token、輸出 token、每百萬 token 單價。這篇抄下 OpenAI、Anthropic、Google 官網當天寫的 token 與字元比例原文,給出 tiktoken、輸入 token 計數 API 與 countTokens 的官方範例,畫出一次對話裡系統提示詞與歷史怎麼累加,再用客服、翻譯一本書、每天摘要新聞三個情境把算式與假設寫出來,最後是三家設費用上限的位置。
生活分享
提示詞快取(Prompt Caching):重用相同字首的計算
提示詞快取重用先前處理過的相同輸入字首,減少重複讀取長指令或文件的計算。本文用同一份活動手冊的連續問答示範首次寫入、後續命中與字首失效,區分提示詞快取、答案快取和長期記憶,也解釋為什麼省輸入處理不等於省下所有輸出時間。讀完能檢查實際命中、版本更新、隱私隔離與費用條件,不把快取當成免費或永久記住資料。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- OpenAI API 定價頁(各型號的快取輸入價,以及短脈絡與長脈絡兩欄) · 查證日期:
- Anthropic Claude 平台定價頁(快取寫入與命中倍率、Fable 5.1 的 0.025 倍例外、100 萬 token 全程標準價、新舊 tokenizer 約差 30% 的註記) · 查證日期:
- Anthropic Claude 模型總覽頁(各模型的基礎輸入輸出價與上下文視窗) · 查證日期:
- Gemini API 定價頁(內容快取單價、每小時儲存費,以及 20 萬 token 的分段門檻) · 查證日期:
- xAI 開發者文件:定價頁(快取輸入價,以及達到門檻後整筆請求都用高價計的規則) · 查證日期:
- DeepSeek API 文件:模型與定價(快取命中與未命中、尖峰與離峰四欄價) · 查證日期:
- MiniMax API 文件:隨用隨付定價(M3 與 M2.7 的快取讀寫價與 51.2 萬 token 分段) · 查證日期:
- Moonshot Kimi 平台文件:對話模型定價(kimi-k3 與 k2.7-code 的快取命中與未命中價) · 查證日期: