生活分享

成本、品質、延遲:多模型流程怎麼取捨

多模型流程的成本、品質與延遲要分開量:成本是官方每百萬 token 單價乘上呼叫次數與 token 數,品質要靠自己建的評測集分數而不是各家公布的跑分,延遲要看 p50 與 p95 兩個百分位數而不是平均值。這篇說明串行與並行架構怎麼影響這三個量,快取與批次該放進流程的哪一步,並用 2026 年 9 月當日的官方定價,換算單一旗艦、級聯與並行互審三種流程處理同一個假設請求的估算成本,附上每一步的假設,方便換成自己的用量重算。

更新日期: 閱讀時間約 9 分鐘

原創插圖:一張帳單與時鐘並排的插畫,天秤兩端分別放著代表成本與品質的符號,時鐘指針暗示延遲,象徵多模型流程的三個取捨量。
圖片:Mokaair (© Mokaair)
本篇目錄
  1. 三個量:成本、分數與延遲怎麼分開算
  2. 串行與並行:同樣三次呼叫,時間不一樣
  3. 快取與批次放在流程的哪一步
  4. 共同假設,以及單一旗艦與級聯的成本
  5. 並行互審的成本,以及下一步

多模型流程該用單一旗艦模型、便宜先試的級聯,還是同時問多個模型再互相校對,答案要看成本、品質與延遲這三個量分別算出來多少,而不是憑感覺挑架構。三個量都要各自量:同一個架構常常在一個量上贏、在另一個量上退,例如平均成本最低的級聯,尾端延遲反而可能比單一旗艦更長(本文的推論,前提見下)。

讀完這篇,你會知道這三個量各自怎麼量,看懂串行與並行架構怎麼影響總延遲,知道快取與批次該放進流程的哪一步,並看到三種流程在同一組假設下的估算成本。這篇是入門篇,不需要寫程式,只需要會做百分比與乘除;把不同廠商的模型接上同一套程式、寫路由規則、讓模型互審,是系列後面幾篇的主題。

三個量:成本、分數與延遲怎麼分開算

第一個量是成本:把官方定價頁當天的每百萬 token 輸入與輸出單價,乘上一次請求送出與收到的 token 數,再乘呼叫次數。Anthropic、OpenAI 與 Google 的定價頁都用「每百萬 token」計價;各家三個級距的實際價格,《API 價格比較:每百萬 token 各家多少》整理過,這篇不重列。定價頁上有些價格附帶生效日期:Google 的 Gemini 開發者 API 定價頁在 Gemini 3.8 Flash 付費層標準價那欄寫「$0.75 through December 31, 2026. $1.50 starting January 1, 2027.」,也就是每百萬輸入 token 在 2026 年底前 0.75 美元、2027 年起 1.50 美元;那一欄沒有寫促銷或限時,只印出兩段各自帶日期的價格,抄價格要連日期一起抄。

第二個量是品質,沒有標準答案。一種做法是看公開基準:Anthropic 的文件寫,它把近幾代 Claude Opus、Sonnet 與 Fable 型號放進同一套測試框架(harness)跑 SWE-bench Pro 3 的子集,各自用出廠預設值、照定價表計價;同一頁註明除非另有出處,頁上的量測都是 Anthropic 自己跑的,要讀者先在自己的工作量上量過再假設會省,本站沒有實測。另一種是自己建評測集,同一頁描述的做法是從正式環境紀錄抽出幾個任務、照真實流量加權,替每個任務寫可自動判定的結果檢查(測試通過、工單結案、列數正確),把成本記在分數旁邊。評測集怎麼建留給本系列談追蹤與評測那篇,讓另一個模型當評審留給《多模型互審: 當評審、投票與集成怎麼做》。

第三個量是延遲:使用者從送出請求到看到答案要等多久。工程上常看兩個百分位數而不是平均值:把一段時間內所有請求的等待時間由快到慢排序,p50 是第 50 百分位、也就是中間那一筆,一半的請求比它快、一半比它慢;p95 是第 95 百分位那一筆,只有最慢的 5% 比它更久。平均值把快的與慢的混成一個數字,看不出尾端那 5%,所以至少要同時記錄 p50 與 p95。本站沒有實測,實際秒數要在自己的環境量。

串行與並行:同樣三次呼叫,時間不一樣

同一個問題,依序呼叫三個模型跟同時呼叫三個模型,總延遲差很多,即使呼叫次數與付的錢一樣。串行是前一步的結果決定要不要進行下一步,例如級聯先問便宜模型,信心不夠、逾時或出錯才呼叫貴的模型救援——第二步要等第一步的答案才能開始,兩步的時間相加。並行是同一份輸入同時送給好幾個模型,彼此不必等對方,例如並行互審把同一個問題丟給兩個模型各自作答——時間不是相加,而是取最慢的那一個。

下面這段是本文的推論,不是官方數字,前提有兩個:升級時會多打一次呼叫,兩次的時間相加;輕量模型單次回應比旗艦快。本站沒有實測,這兩個前提要在自己的環境確認。在這兩個前提下,級聯的多數請求只經過便宜模型那一步,p50 會比一路用旗艦快;被升級的那部分請求疊加了兩次呼叫的時間,落在 p95 要抓的尾端,所以 p95 反而可能比單一旗艦更慢。並行互審的總延遲是一次並行時間(取較慢的模型)加一次評審時間,評審要讀兩份答案,沒辦法跟並行呼叫同時跑;它的呼叫次數是單一旗艦的三倍,換到的是品質,不是速度。

快取與批次放在流程的哪一步

多模型流程裡,同一段系統提示或背景資料常常重複出現:級聯每一步都要重講一次規則,並行互審的每個模型也都拿到同一份問題與資料。快取讓這種重複的輸入不必每次都用全額單價計費;確切的折扣倍率與存活時間,《Claude API 省錢:提示快取與批次處理怎麼用》已經整理過,這篇不重複。Anthropic 的提示快取文件寫,提示快取對輸出 token 的生成沒有影響,收到的回應與沒有用快取時一模一樣;那是 Anthropic 對自家快取的說法,別家要看該家文件。

批次處理是另一個方向:用等待時間換更低的單價。Anthropic 的定價頁寫,批次 API 非同步處理大量請求、輸入與輸出 token 都打 50% 折扣;OpenAI 定價頁上本篇引用的 gpt-6-astra,批次價正好是標準價的一半;Google 把「Batch API (50% cost reduction)」列在付費方案的功能裡。Anthropic 另一份文件把取捨寫成 batch processing trades latency for its discount,同一張表把批次的品質成本記成 None、延遲記成結果在 24 小時內,節省那欄的標題寫明只是這些測試裡的數字,量測也都是 Anthropic 自己跑的。批次適合放在不必當場等結果的那一步,例如離線跑評測;使用者正在等回覆的那次呼叫不適合。

共同假設,以及單一旗艦與級聯的成本

為了把三種流程放進同一張表比較,這裡固定一組共同假設:每次請求平均送出 3,000 個輸入 token(含系統提示、檢索資料與使用者問題),平均回覆 600 個輸出 token;金額一律用定價頁的標準價,不算批次、快取與加速模式,都取到小數點後四位。這組數字是示範用的假設,不是量到的真實流量;要換成自己的請求,可以照《token 計算與費用估算:官方計數工具、一次對話的算式與費用上限》教的方法量出實際 token 數,再套進同一套算法重算。

單一旗艦最簡單:每次請求只呼叫一次旗艦模型。以 Claude Opus 5.5 當旗艦為例,Anthropic 定價頁列出的基礎輸入單價是每百萬 token 4 美元、輸出單價 20 美元,套進 3,000 個輸入與 600 個輸出 token,一次請求的成本是 3,000 乘以 4、加上 600 乘以 20,兩者都除以一百萬再相加,等於 0.024 美元,一萬次請求 240 美元。

級聯先用便宜模型過濾,只有一部分請求會被送進旗艦模型。以 Gemini 3.5 Flash-Lite 當第一層為例,Google 定價頁付費層標準價列出的輸入單價是每百萬 token 0.30 美元、輸出單價 2.50 美元,套進 3,000 個輸入與 600 個輸出,一次成本 0.0024 美元。這篇假設其中 30% 的請求被判斷為不夠有把握,再升級呼叫一次 Claude Opus 5.5;平均每次成本是 0.0024 加上 30% 乘以 0.024,等於 0.0096 美元,比一路用旗艦模型少 60%。《模型路由與級聯:便宜先試、貴的兜底》的範例分三階,這裡只算兩階;門檻與升級比例是那篇的主題。

並行互審的成本,以及下一步

並行互審是兩個模型同時作答、再由第三個。以 Claude Opus 5.5 與 gpt-6-astra 為例,OpenAI 定價頁標準價的短上下文欄列出後者的輸入單價每百萬 token 10 美元、輸出 50 美元,套進 3,000 與 600,一次成本 0.06 美元,加上 Opus 5.5 的 0.024 美元,合計 0.084 美元。評審要讀原始問題與兩份回答,輸入是 3,000 加 600 加 600、等於 4,200 個 token,輸出假設 200 個;以 Claude Sonnet 5 當評審,基礎輸入單價每百萬 token 2 美元、輸出 10 美元,這一步 0.0104 美元。三步加起來 0.0944 美元,是單一旗艦的三倍以上;評分標準怎麼設計留給《多模型互審:LLM 當評審、投票與集成怎麼做》。

下圖與下表把三種流程放在一起對照。

這張表只回答架構要付多少錢、時間形狀長怎樣,不會告訴你哪一種品質比較好。實際導入前至少要把 3,000 與 600 換成自己量到的 token 數、30% 換成從請求記錄量到的比例,並在自己的環境記錄 p50 與 p95。

流程圖:共同假設出發,分別對照單一旗艦、級聯與並行互審三種流程的估算成本
三種流程處理同一個假設請求(輸入 3,000 個 token、輸出 600 個 token)的估算成本;單價查證於 2026 年 9 月 24 日官方定價頁的標準價,實際費用以官網當日公告為準。 · 圖片:Mokaair (© Mokaair)
單價查證於 2026 年 9 月 24 日官方定價頁的標準價(不含批次、快取與加速模式);估算以輸入 3,000、輸出 600 個 token 為共同假設,金額取到小數點後四位,每萬次是一次成本乘上一萬,僅供比較架構之間的相對差異。
流程呼叫組成標準價(每百萬 token,輸入/輸出)一次請求估算成本每萬次估算成本延遲的形狀
單一旗艦1 次 Claude Opus 5.5Opus 5.5:4 美元/20 美元0.024 美元240 美元1 次呼叫的時間
級聯(先便宜後升級)1 次 Gemini 3.5 Flash-Lite,其中 30% 再加 1 次 Claude Opus 5.5Flash-Lite:0.30 美元/2.50 美元;Opus 5.5:4 美元/20 美元平均 0.0096 美元平均 96 美元多數 1 次呼叫;被升級的請求是 2 次相加(本文的推論)
並行互審Claude Opus 5.5 與 gpt-6-astra 同時作答,再由 Claude Sonnet 5 評審Opus 5.5:4/20;gpt-6-astra:10/50;Sonnet 5:2/10(美元)0.0944 美元944 美元2 次並行取較慢者,再加 1 次評審

常見問題

多模型流程一定比用單一個模型便宜嗎?

不一定。級聯架構因為大部分請求只用便宜模型處理,平均成本通常比一路用旗艦模型低;但並行互審架構要兩個模型各答一次再加一次評審,一共三次呼叫,是單一旗艦的三倍,用本文的假設算出來成本也是三倍以上,換到的是品質而不是省錢。

p50 與 p95 延遲差在哪裡?

兩個都是百分位數。把一段時間內所有請求的等待時間由快到慢排序,p50 是第 50 百分位、也就是中間那一筆,一半的請求比它快、一半比它慢;p95 是第 95 百分位那一筆,只有最慢的 5% 比它更久。平均值把快的與慢的混成一個數字,看不出尾端那 5%。

級聯架構的延遲一定比較短嗎?

不一定,而且以下是本文的推論、不是官方數字。只要升級時會多打一次呼叫、而且輕量模型單次回應比旗艦快,只跑便宜模型那一步的多數請求就比較快,級聯的 p50 會比單一旗艦快;但被升級的那部分請求要把兩步的時間加起來,p95 反而可能比一路用旗艦模型更慢。本站沒有實測,這兩個前提要在自己的環境確認。

快取與批次可以用在同一個流程裡嗎?

可以,兩者處理的是不同的重複:快取針對同一段輸入被重複送出的情況,適合放在級聯或並行互審裡每一步都要重講一次的系統提示上;批次針對不需要馬上得到答案的那一步,適合放在離線重跑的評測或整理工作,不適合放進使用者正在等待回覆的那一次呼叫。Anthropic 的文件說自家的提示快取不影響輸出、批次的品質成本記成 None,那是 Anthropic 對自家產品的說法,換別家要看該家文件怎麼寫。

這篇的 30% 升級比例與 3,000/600 個 token 是官方數字嗎?

不是,這兩組數字都是這篇示範用的假設,方便把三種流程放進同一張表比較。實際比例要從自己的請求記錄量出來,實際 token 數要用官方計數工具量過,再套進同樣的算法重新計算一次。

回總目錄

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

最新旅遊情報攻略

資料來源

生活分享