生活分享
成本、品質、延遲:多模型流程怎麼取捨
多模型流程的成本、品質與延遲要分開量:成本是官方每百萬 token 單價乘上呼叫次數與 token 數,品質要靠自己建的評測集分數而不是各家公布的跑分,延遲要看 p50 與 p95 兩個百分位數而不是平均值。這篇說明串行與並行架構怎麼影響這三個量,快取與批次該放進流程的哪一步,並用 2026 年 9 月當日的官方定價,換算單一旗艦、級聯與並行互審三種流程處理同一個假設請求的估算成本,附上每一步的假設,方便換成自己的用量重算。
更新日期: 閱讀時間約 9 分鐘

多模型流程該用單一旗艦模型、便宜先試的級聯,還是同時問多個模型再互相校對,答案要看成本、品質與延遲這三個量分別算出來多少,而不是憑感覺挑架構。三個量都要各自量:同一個架構常常在一個量上贏、在另一個量上退,例如平均成本最低的級聯,尾端延遲反而可能比單一旗艦更長(本文的推論,前提見下)。
讀完這篇,你會知道這三個量各自怎麼量,看懂串行與並行架構怎麼影響總延遲,知道快取與批次該放進流程的哪一步,並看到三種流程在同一組假設下的估算成本。這篇是入門篇,不需要寫程式,只需要會做百分比與乘除;把不同廠商的模型接上同一套程式、寫路由規則、讓模型互審,是系列後面幾篇的主題。
三個量:成本、分數與延遲怎麼分開算
第一個量是成本:把官方定價頁當天的每百萬 token 輸入與輸出單價,乘上一次請求送出與收到的 token 數,再乘呼叫次數。Anthropic、OpenAI 與 Google 的定價頁都用「每百萬 token」計價;各家三個級距的實際價格,《API 價格比較:每百萬 token 各家多少》整理過,這篇不重列。定價頁上有些價格附帶生效日期:Google 的 Gemini 開發者 API 定價頁在 Gemini 3.8 Flash 付費層標準價那欄寫「$0.75 through December 31, 2026. $1.50 starting January 1, 2027.」,也就是每百萬輸入 token 在 2026 年底前 0.75 美元、2027 年起 1.50 美元;那一欄沒有寫促銷或限時,只印出兩段各自帶日期的價格,抄價格要連日期一起抄。
第二個量是品質,沒有標準答案。一種做法是看公開評測模型與代理評測(Evals)是什麼模型與代理評測把任務、輸入、執行條件和成功標準固定下來,觀察 AI 是否真的符合需求。本文用志工排班助理為例,說明案例、重複嘗試、評分器與外部結果的差別,比較程式、人類與模型評分,解釋為何單次答對和平均高分都不足以證明可靠。讀完能建立一組小而實用的評測,讓提示詞或模型更新有可比較的證據,也能保留尚未驗證的限制。閱讀全文基準:Anthropic 的文件寫,它把近幾代 Claude Opus、Sonnet 與 Fable 型號放進同一套測試框架(harness)跑 SWE-bench Pro 3 的子集,各自用出廠預設值、照定價表計價;同一頁註明除非另有出處,頁上的量測都是 Anthropic 自己跑的,要讀者先在自己的工作量上量過再假設會省,本站沒有實測。另一種是自己建評測集,同一頁描述的做法是從正式環境紀錄抽出幾個任務、照真實流量加權,替每個任務寫可自動判定的結果檢查(測試通過、工單結案、列數正確),把成本記在分數旁邊。評測集怎麼建留給本系列談追蹤與評測那篇,讓另一個模型當評審留給《多模型互審:LLM大型語言模型(Large Language Model)是什麼大型語言模型從大量資料學習語言與其他模式,依上下文處理文字、生成回答或提出工具請求。本文以失物招領紀錄為例,說明 token、參數、預訓練、提示詞與上下文如何配合,區分模型、聊天產品、搜尋與外部工具,並解釋為何流暢答案仍需查證。讀完能更精確描述任務,知道何時該補檔案、要求工具計算或保留無法確認的答案。閱讀全文 當評審、投票與集成怎麼做》。
第三個量是延遲:使用者從送出請求到看到答案要等多久。工程上常看兩個百分位數而不是平均值:把一段時間內所有請求的等待時間由快到慢排序,p50 是第 50 百分位、也就是中間那一筆,一半的請求比它快、一半比它慢;p95 是第 95 百分位那一筆,只有最慢的 5% 比它更久。平均值把快的與慢的混成一個數字,看不出尾端那 5%,所以至少要同時記錄 p50 與 p95。本站沒有實測,實際秒數要在自己的環境量。
串行與並行:同樣三次呼叫,時間不一樣
同一個問題,依序呼叫三個模型跟同時呼叫三個模型,總延遲差很多,即使呼叫次數與付的錢一樣。串行是前一步的結果決定要不要進行下一步,例如級聯先問便宜模型,信心不夠、逾時或出錯才呼叫貴的模型救援——第二步要等第一步的答案才能開始,兩步的時間相加。並行是同一份輸入同時送給好幾個模型,彼此不必等對方,例如並行互審把同一個問題丟給兩個模型各自作答——時間不是相加,而是取最慢的那一個。
下面這段是本文的推論,不是官方數字,前提有兩個:升級時會多打一次呼叫,兩次的時間相加;輕量模型單次回應比旗艦快。本站沒有實測,這兩個前提要在自己的環境確認。在這兩個前提下,級聯的多數請求只經過便宜模型那一步,p50 會比一路用旗艦快;被升級的那部分請求疊加了兩次呼叫的時間,落在 p95 要抓的尾端,所以 p95 反而可能比單一旗艦更慢。並行互審的總延遲是一次並行時間(取較慢的模型)加一次評審時間,評審要讀兩份答案,沒辦法跟並行呼叫同時跑;它的呼叫次數是單一旗艦的三倍,換到的是品質,不是速度。
快取與批次放在流程的哪一步
多模型流程裡,同一段系統提示或背景資料常常重複出現:級聯每一步都要重講一次規則,並行互審的每個模型也都拿到同一份問題與資料。快取讓這種重複的輸入不必每次都用全額單價計費;確切的折扣倍率與存活時間,《Claude API 省錢:提示快取與批次處理怎麼用》已經整理過,這篇不重複。Anthropic 的提示快取文件寫,提示快取對輸出 token 的生成沒有影響,收到的回應與沒有用快取時一模一樣;那是 Anthropic 對自家快取的說法,別家要看該家文件。
批次處理是另一個方向:用等待時間換更低的單價。Anthropic 的定價頁寫,批次 API 非同步處理大量請求、輸入與輸出 token 都打 50% 折扣;OpenAI 定價頁上本篇引用的 gpt-6-astra,批次價正好是標準價的一半;Google 把「Batch API (50% cost reduction)」列在付費方案的功能裡。Anthropic 另一份文件把取捨寫成 batch processing trades latency for its discount,同一張表把批次的品質成本記成 None、延遲記成結果在 24 小時內,節省那欄的標題寫明只是這些測試裡的數字,量測也都是 Anthropic 自己跑的。批次適合放在不必當場等結果的那一步,例如離線跑評測;使用者正在等回覆的那次呼叫不適合。
共同假設,以及單一旗艦與級聯的成本
為了把三種流程放進同一張表比較,這裡固定一組共同假設:每次請求平均送出 3,000 個輸入 token(含系統提示、檢索資料與使用者問題),平均回覆 600 個輸出 token;金額一律用定價頁的標準價,不算批次、快取與加速模式,都取到小數點後四位。這組數字是示範用的假設,不是量到的真實流量;要換成自己的請求,可以照《token 計算與費用估算:官方計數工具、一次對話的算式與費用上限》教的方法量出實際 token 數,再套進同一套算法重算。
單一旗艦最簡單:每次請求只呼叫一次旗艦模型。以 Claude Opus 5.5 當旗艦為例,Anthropic 定價頁列出的基礎輸入單價是每百萬 token 4 美元、輸出單價 20 美元,套進 3,000 個輸入與 600 個輸出 token,一次請求的成本是 3,000 乘以 4、加上 600 乘以 20,兩者都除以一百萬再相加,等於 0.024 美元,一萬次請求 240 美元。
級聯先用便宜模型過濾,只有一部分請求會被送進旗艦模型。以 Gemini 3.5 Flash-Lite 當第一層為例,Google 定價頁付費層標準價列出的輸入單價是每百萬 token 0.30 美元、輸出單價 2.50 美元,套進 3,000 個輸入與 600 個輸出,一次成本 0.0024 美元。這篇假設其中 30% 的請求被判斷為不夠有把握,再升級呼叫一次 Claude Opus 5.5;平均每次成本是 0.0024 加上 30% 乘以 0.024,等於 0.0096 美元,比一路用旗艦模型少 60%。《模型路由與級聯:便宜先試、貴的兜底》的範例分三階,這裡只算兩階;門檻與升級比例是那篇的主題。
並行互審的成本,以及下一步
並行互審是兩個模型同時作答、再由第三個模型評審以語言模型擔任評審(LLM-as-a-Judge)是什麼以語言模型擔任評審,是讓模型依準則判斷另一段回答、比較候選內容或檢查特定條件,適合協助大量語意評測。本文以展覽說明改寫為例,說明評分準則、參考資料、人工校準與位置偏差,解釋為何長答案可能討好評審、模型評語也可能錯。讀完能設計可核對的評審工作,區分偏好、忠實性與事實正確,並知道哪些部分應交給程式或人檢查。閱讀全文。以 Claude Opus 5.5 與 gpt-6-astra 為例,OpenAI 定價頁標準價的短上下文欄列出後者的輸入單價每百萬 token 10 美元、輸出 50 美元,套進 3,000 與 600,一次成本 0.06 美元,加上 Opus 5.5 的 0.024 美元,合計 0.084 美元。評審要讀原始問題與兩份回答,輸入是 3,000 加 600 加 600、等於 4,200 個 token,輸出假設 200 個;以 Claude Sonnet 5 當評審,基礎輸入單價每百萬 token 2 美元、輸出 10 美元,這一步 0.0104 美元。三步加起來 0.0944 美元,是單一旗艦的三倍以上;評分標準怎麼設計留給《多模型互審:LLM 當評審、投票與集成怎麼做》。
下圖與下表把三種流程放在一起對照。
這張表只回答架構要付多少錢、時間形狀長怎樣,不會告訴你哪一種品質比較好。實際導入前至少要把 3,000 與 600 換成自己量到的 token 數、30% 換成從請求記錄量到的比例,並在自己的環境記錄 p50 與 p95。
| 流程 | 呼叫組成 | 標準價(每百萬 token,輸入/輸出) | 一次請求估算成本 | 每萬次估算成本 | 延遲的形狀 |
|---|---|---|---|---|---|
| 單一旗艦 | 1 次 Claude Opus 5.5 | Opus 5.5:4 美元/20 美元 | 0.024 美元 | 240 美元 | 1 次呼叫的時間 |
| 級聯(先便宜後升級) | 1 次 Gemini 3.5 Flash-Lite,其中 30% 再加 1 次 Claude Opus 5.5 | Flash-Lite:0.30 美元/2.50 美元;Opus 5.5:4 美元/20 美元 | 平均 0.0096 美元 | 平均 96 美元 | 多數 1 次呼叫;被升級的請求是 2 次相加(本文的推論) |
| 並行互審 | Claude Opus 5.5 與 gpt-6-astra 同時作答,再由 Claude Sonnet 5 評審 | Opus 5.5:4/20;gpt-6-astra:10/50;Sonnet 5:2/10(美元) | 0.0944 美元 | 944 美元 | 2 次並行取較慢者,再加 1 次評審 |
常見問題
多模型流程一定比用單一個模型便宜嗎?
不一定。級聯架構因為大部分請求只用便宜模型處理,平均成本通常比一路用旗艦模型低;但並行互審架構要兩個模型各答一次再加一次評審,一共三次呼叫,是單一旗艦的三倍,用本文的假設算出來成本也是三倍以上,換到的是品質而不是省錢。
p50 與 p95 延遲差在哪裡?
兩個都是百分位數。把一段時間內所有請求的等待時間由快到慢排序,p50 是第 50 百分位、也就是中間那一筆,一半的請求比它快、一半比它慢;p95 是第 95 百分位那一筆,只有最慢的 5% 比它更久。平均值把快的與慢的混成一個數字,看不出尾端那 5%。
級聯架構的延遲一定比較短嗎?
不一定,而且以下是本文的推論、不是官方數字。只要升級時會多打一次呼叫、而且輕量模型單次回應比旗艦快,只跑便宜模型那一步的多數請求就比較快,級聯的 p50 會比單一旗艦快;但被升級的那部分請求要把兩步的時間加起來,p95 反而可能比一路用旗艦模型更慢。本站沒有實測,這兩個前提要在自己的環境確認。
快取與批次可以用在同一個流程裡嗎?
可以,兩者處理的是不同的重複:快取針對同一段輸入被重複送出的情況,適合放在級聯或並行互審裡每一步都要重講一次的系統提示上;批次針對不需要馬上得到答案的那一步,適合放在離線重跑的評測或整理工作,不適合放進使用者正在等待回覆的那一次呼叫。Anthropic 的文件說自家的提示快取不影響輸出、批次的品質成本記成 None,那是 Anthropic 對自家產品的說法,換別家要看該家文件怎麼寫。
這篇的 30% 升級比例與 3,000/600 個 token 是官方數字嗎?
不是,這兩組數字都是這篇示範用的假設,方便把三種流程放進同一張表比較。實際比例要從自己的請求記錄量出來,實際 token 數要用官方計數工具量過,再套進同樣的算法重新計算一次。
多模型 AI 工作流教學:從拆任務到串接不同模型多模型 AI 工作流教學:從拆任務到串接不同模型這個系列教的是怎麼把一件工作拆開、交給合適的模型,再把結果接回同一條流程:判斷該不該拆、拆給誰,換供應商不改程式,設計便宜先試的路由與級聯,讓模型之間用結構化輸出交接資料,再到代理式工具怎麼分工、同一套工具怎麼給多個客戶端共用、Claude Code 與 Codex 怎麼搭本機模型,以及上線後怎麼追蹤與防護。一般使用者可以從判斷該不該拆的觀念讀起,已經會寫 Python 的人能直接進到換供應商、寫路由與交接資料的幾篇。閱讀全文
token 計算與費用估算:官方計數工具、一次對話的算式與費用上限token 計算與費用估算:官方計數工具、一次對話的算式與費用上限費用估算只有三個數字:輸入 token、輸出 token、每百萬 token 單價。這篇抄下 OpenAI、Anthropic、Google 官網當天寫的 token 與字元比例原文,給出 tiktoken、輸入 token 計數 API 與 countTokens 的官方範例,畫出一次對話裡系統提示詞與歷史怎麼累加,再用客服、翻譯一本書、每天摘要新聞三個情境把算式與假設寫出來,最後是三家設費用上限的位置。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Pricing - Claude Platform Docs · 查證日期:
- Pricing | OpenAI API · 查證日期:
- Gemini Developer API pricing · 查證日期:
- Prompt caching - Claude Platform Docs · 查證日期:
- Optimizing for cost and intelligence - Claude Platform Docs · 查證日期: