生活分享

多模型 AI 工作流教學:從拆任務到串接不同模型

這個系列教的是怎麼把一件工作拆開、交給合適的模型,再把結果接回同一條流程:判斷該不該拆、拆給誰,換供應商不改程式,設計便宜先試的路由與級聯,讓模型之間用結構化輸出交接資料,再到代理式工具怎麼分工、同一套工具怎麼給多個客戶端共用、Claude Code 與 Codex 怎麼搭本機模型,以及上線後怎麼追蹤與防護。一般使用者可以從判斷該不該拆的觀念讀起,已經會寫 Python 的人能直接進到換供應商、寫路由與交接資料的幾篇。

更新日期: 閱讀時間約 13 分鐘

原創插圖:一個對話框分出幾條線,各接到一個不同的模型,結果再匯回同一張卡片並打上勾,代表把一件工作拆給不同模型、再接回同一條流程
圖片:Mokaair (© Mokaair)

推薦學習路線

已更新篩選結果

A.觀念:流程、拆法與取捨

  1. AI 工作流是什麼:從一次對話到可重跑的流程

    AI 工作流是把原本擠在一次對話裡臨場決定的每一步,拆成可以個別檢查、重新執行、彼此交接的固定步驟,讓同一件事下次不必重新臨場發揮。

    入門 · 6 分鐘

    • Web
  2. 一件事拆給多個模型:依步驟、能力、風險、資料敏感度四種切法

    把一件工作拆給多個模型分工,可以讓便宜的模型分擔簡單的部分,也更容易看出是哪一步出了問題,但不保證變快。

    入門 · 8 分鐘

    • Web
  3. 成本、品質、延遲:多模型流程怎麼取捨

    多模型流程的成本、品質與延遲要分開量:成本是官方每百萬 token 單價乘上呼叫次數與 token 數,品質要靠自己建的評測集分數而不是各家公布的跑分,延遲要看 p50 與 p95 兩個百分位數而不是平均值。

    入門 · 9 分鐘

    • Web

B.接線:統一 API、路由與交接

  1. 統一 API 層:OpenRouter 與 LiteLLM 換模型不改程式

    OpenAI 相容端點是供應商提供的 REST 介面,形狀和 OpenAI 的 Chat Completions 端點相同,程式只要換 base_url、金鑰與 model 字串就能連到別家模型,不必重寫呼叫邏輯。

    實作 · 10 分鐘

    • CLI
  2. 模型路由與級聯:便宜先試、貴的兜底

    多模型級聯(cascade)讓便宜的輕量模型先答,模型自己評估的信心不夠、逾時或呼叫失敗才升級到更貴的模型,藉此把大多數請求的成本壓低,同時對少數困難的請求保留品質。

    實作 · 8 分鐘

    • CLI
  3. 模型之間交接資料:JSON Schema 與結構化輸出

    把交接寫成 JSON Schema,上游模型的輸出先驗證再送下游,是讓多模型流程穩定下來的做法。

    實作 · 9 分鐘

    • CLI

C.協作:互審、代理分工與 MCP

  1. 多模型互審:LLM 當評審、投票與集成怎麼做

    多模型互審是讓一個獨立的模型依照寫死的評分準則,對其他模型的答案逐條打分,再用投票或集成整理出判斷。

    實作 · 8 分鐘

    • CLI
  2. Claude Code、Codex、Gemini CLI 分工:規劃、執行、審查

    把 Claude Code、Codex 與 Gemini CLI 接成規劃、執行、審查的一條管線,靠的是三支命令列各自的非互動旗標,本文查證的文件沒有跨工具的整合功能。

    實作 · 10 分鐘

    • CLI
  3. 一個 MCP 伺服器,同時接上 Claude Code、Codex、Gemini CLI 三個客戶端

    同一支用官方 Python SDK 寫成的 MCP 伺服器,不必改一行程式碼就能同時登記進 Claude Code、Codex 與 Gemini CLI:三邊的設定檔位置與加入指令都不一樣,Codex 寫成 TOML、另外兩邊是 JSON,但讀到的是同一份工具名稱、輸入 Schema 與回傳格式。

    實作 · 9 分鐘

    • CLI

D.營運:本機混搭、追蹤與防護

  1. 本機去識別化、雲端收尾:用 Ollama 打造混合式 AI 工作流

    這篇教你用 Ollama 的 OpenAI 相容端點,把分類與去識別化這類會碰到原始個資的步驟留在本機執行,換成代號的乾淨文字才送進雲端模型收尾,同一支 Python 程式靠 base_url 切換兩端。

    實作 · 10 分鐘

    • CLI
  2. 追蹤、評測與可觀測性:知道流程哪一步出錯

    多模型工作流串起幾個步驟後,一步答錯或變慢,只看最後輸出看不出問題在哪,必須每一步都留下可查的紀錄。

    進階 · 9 分鐘

    • CLI
  3. 失敗案例與防護:迴圈、費用爆炸與代理間注入

    多模型工作流常見的三種失控,是無限重試迴圈、fan-out 呼叫的費用爆炸,以及上游模型的輸出被下游模型當成指令,三種情況各自可以配一種對應的防護。

    進階 · 9 分鐘

    • CLI

E.實作:代理工具搭本機模型

  1. Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。

    入門 · 9 分鐘

    • CLI
  2. GLM、Qwen、DeepSeek 接上 Claude Code 與 Codex:哪些在本機、哪些其實在雲端

    同一個模型名字有三種跑法:權重下載到自己電腦、Ollama 的 :cloud 標籤、供應商自己的端點,只有第一種的提示詞由自己的電腦處理。

    實作 · 11 分鐘

    • CLI
  3. 讓 Claude Code、Codex 把大量雜務交給本機模型:一支 Python 腳本

    要讓雲端代理處理一批含個資的文字檔又不讓它讀原始檔,可以把這件事交給一支不到 80 行的 Python 腳本:腳本逐封問本機的 Ollama 模型,用 JSON schema 要求固定欄位,結果寫成 out 資料夾,代理只讀結果。

    實作 · 10 分鐘

    • CLI
  4. 把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。

    實作 · 9 分鐘

    • CLI
  5. 把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。

    實作 · 11 分鐘

    • CLI
  6. Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。

    入門 · 10 分鐘

    • CLI

把一件工作拆開、分別交給不同模型、再把結果接回同一條流程,中間牽涉到好幾個問題:這件事該不該拆、要拆給誰、不同供應商的模型要怎麼接在同一支程式裡、模型之間怎麼交接資料與互相審查,以及流程正式上線之後要怎麼追蹤與防護。這個系列把這幾個問題,依照從觀念到動手接線、再到長期營運的順序,一篇一篇拆開講清楚;另有一節專講 Claude Code、Codex 這類代理工具怎麼搭配自己電腦上的本機模型。

一般使用者可以先從觀念的幾篇看起,弄懂一次對話、可重跑的流程與自己決定下一步的代理三個層次有什麼差別,以及把工作拆給多個模型有哪些依據與代價;已經會寫 Python 與命令列的人,可以直接跳進接線的幾篇,學怎麼用同一支程式換供應商、設計便宜先試的路由與級聯、讓模型之間用結構化輸出交接資料;已經在用 Claude Code 或 Codex、想接上自己電腦上的模型的人,可以從搭本機模型的那一節開始。讀完整個系列,你會有一套判斷什麼時候該拆、依什麼依據拆、拆完怎麼接起來、怎麼量成本與抓錯,以及上線後怎麼防止流程自己失控的完整想法,不只是學會單一工具的操作。

先懂觀念:拆解、切法與取捨

一次對話、可重跑的流程與自己決定下一步的代理,三者的差別,《》先把這三層分清楚,才看得出一件事目前卡在哪一層。接著要判斷該不該拆、又該怎麼拆,《》整理出依步驟、依能力、依風險、依資料敏感度四種切法,讓你照工作本身的性質決定要不要拆、又該挑哪一種切法,而不是憑感覺亂拆。拆完了值不值得,還要看怎麼取捨,《》把成本、品質、延遲三個量分開算清楚,比較單一旗艦、級聯與並行互審幾種架構各自的代價,讓你在動手接線之前,先想清楚值不值得多拆一層。

接線:統一介面、路由級聯、交接資料

決定要拆之後,第一件事是讓程式不用為每家供應商重寫一份呼叫邏輯,《》示範同一段程式換掉 base_url、金鑰與 model 字串,就能連到別家模型。介面統一了,再往上疊一層判斷,《》講的是便宜的模型先答,信心不夠或逾時出錯才升級給更貴的模型,把多數請求的成本壓低,同時保留少數困難請求的品質。模型換來換去,交接的格式也要先講好,《》把交接寫成 JSON Schema,讓上游模型的輸出先驗證再送下游,下游只讀取通過驗證的欄位。

協作與工具:代理分工、共用工具、混合部署

接線接好之後,實際動手寫程式常常不是一個代理從頭做到尾,《》示範怎麼讓三支命令列代理接力完成同一個編碼任務,一支只負責規劃、一支負責動手改程式、一支負責審查,靠檔案交接而不是共用對話紀錄。三支代理要用同一批工具時,《》示範同一支 伺服器不必改程式,就能同時登記進三個客戶端,只是每邊的設定檔與白名單要分開設定。工具接好了,還要決定哪一段該留在自己的電腦上,《》示範用本機模型先做分類與去識別化這類會碰到原始個資的步驟,換成代號的乾淨文字才送進雲端模型收尾。

營運與防護:互審、追蹤、擋住失敗

模型接起來之後,答案好不好不能只靠自己的印象,《》示範讓一個獨立的模型依照寫死的評分準則,對其他模型的答案逐條打分,再用投票或集成整理出判斷。流程正式上線,還要知道哪一步出了問題,《》示範只用 Python 標準函式庫自寫一支追蹤器,記下每一步的輸入雜湊、模型與延遲,再用離線集比較新舊兩版流程。最後,《》整理無限重試迴圈、fan-out 費用爆炸、上游輸出被下游當成指令這三種常見失控,各自配一種對應的防護,讓流程在失控之前就先擋下來。

搭本機模型:代理工具的接法、標籤與檢查清單

Claude Code、Codex 這類代理工具要怎麼搭配自己電腦上的本機模型,這一節各篇的步驟都來自官方文件,本站沒有實測。要先決定怎麼接,《》不需要寫程式,依資料能不能出門、上下文開得夠不夠長、工作的類型,在代理照常連雲端、把雜務交給本機模型,與把代理的模型整個換成本機模型之間選出接法,並對照 Anthropic、Ollama、LM Studio 與 OpenAI 的官方文件怎麼寫,包括 Anthropic 的文件對把 Claude Code 接到非 Claude 模型的說法。選好接法之後,要分清楚名字相同的模型到底跑在哪裡,《》逐家看 GLM、Qwen、DeepSeek 在 Ollama 的標籤哪些能下載到自己電腦、哪些只有 :cloud,也整理供應商自己的端點怎麼接 Claude Code 與 Codex,每一處都標明資料會送到哪裡,讓你不會把 :cloud 標籤或供應商端點誤當成本機。要讓雲端代理把大量雜務交給本機模型,《》示範把一批文字檔交給一支 Python 腳本,由腳本逐檔問本機的 Ollama 模型、照 JSON schema 回答並寫成結果檔,代理只讀結果,也寫了 Claude Code 的 deny 規則與 Codex 的 permission profile(文件標示為 beta)各擋得住原始檔到什麼程度,以及逾時、分批與失敗標記。同樣的事也能做成工具,《》把本機模型包成一支 stdio 的 MCP 伺服器,Claude Code 與 Codex 各登記一次就能共用,並列出兩邊逾時的官方預設值差在哪裡、輸出量又各怎麼管。如果想讓整個代理都改用本機模型,《》寫出 Ollama 與 LM Studio 的指令、這兩家文件建議的上下文長度、怎麼用 /status 確認 Claude Code 現在連到的是誰,以及用完怎麼還原。動手之前,《》把前面各篇的坑收成一張表,每一項只問一句怎麼檢查,讓你能逐項核對資料有沒有離開電腦、現在連的是誰、上下文開了多長與結果怎麼驗收。

流程圖:觀念、接線、協作與工具、營運、搭本機模型各條路線各自要解決的問題
觀念、接線、協作與工具、營運、搭本機模型,各條路線各自要解決的問題(查證:2026 年 10 月) · 圖片:Mokaair (© Mokaair)
各篇文章的路線與重點(查證:2026 年 10 月)
路線篇名讀完能做到什麼
觀念AI 工作流是什麼:從一次對話到可重跑的流程判斷一件事該留在一次對話、寫成流程,還是交給代理自己決定下一步
觀念一件事拆給多個模型:依步驟、能力、風險、資料敏感度四種切法用依步驟、依能力、依風險、依資料敏感度四種依據,決定要不要拆、怎麼拆給不同模型
觀念成本、品質、延遲:多模型流程怎麼取捨分開估算成本、品質與延遲,比較單一旗艦、級聯、並行互審幾種架構的代價
接線統一 API 層:OpenRouter 與 LiteLLM 換模型不改程式用同一段程式,靠換 base_url、金鑰與 model 字串接上不同供應商的模型
接線模型路由與級聯:便宜先試、貴的兜底寫一段便宜模型先試、信心不夠或出錯才升級的級聯,並設好成本上限
接線模型之間交接資料:JSON Schema 與結構化輸出把模型之間交接的資料寫成 JSON Schema,驗證失敗就重試,下游只吃驗證過的欄位
協作與工具Claude Code、Codex、Gemini CLI 分工:規劃、執行、審查把規劃、執行、審查分給三支命令列代理,靠交接檔接力完成同一個編碼任務
協作與工具一個 MCP 伺服器,同時接上 Claude Code、Codex、Gemini CLI 三個客戶端寫一支 MCP 伺服器,同時登記進三個客戶端,並分別收窄各自的工具權限
協作與工具本機去識別化、雲端收尾:用 Ollama 打造混合式 AI 工作流把會碰到原始個資的步驟留在本機處理,乾淨的文字才交給雲端模型收尾
營運多模型互審:LLM 當評審、投票與集成怎麼做讓另一個模型依評分準則評審答案,再用投票整理出多個模型的共同判斷
營運追蹤、評測與可觀測性:知道流程哪一步出錯自寫一支追蹤器記下每一步的細節,並用離線評測集比較新舊兩版流程的分數
營運失敗案例與防護:迴圈、費用爆炸與代理間注入替重試迴圈設步數與預算上限,替規劃輸出加 schema 驗證,把模型輸出當資料而非指令
搭本機模型Claude Code、Codex 搭本機模型:兩種接法怎麼選依資料能不能出門、上下文開得夠不夠長、工作的類型,選出要讓代理連雲端、雜務交給本機,還是整個換成本機模型
搭本機模型GLM、Qwen、DeepSeek 接上 Claude Code 與 Codex:哪些在本機、哪些其實在雲端分辨 GLM、Qwen、DeepSeek 的標籤哪些能下載到自己電腦、哪些只有 :cloud,並知道供應商端點的設定與資料會送到哪裡
搭本機模型讓 Claude Code、Codex 把大量雜務交給本機模型:一支 Python 腳本寫一支只用標準函式庫的 Python 腳本逐檔問本機模型、代理只讀結果,並設好代理讀原始檔的規則、逾時、分批與失敗標記
搭本機模型把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器寫一支 stdio MCP 伺服器,把本機模型包成只回分類結果與結果檔路徑的工具,在 Claude Code 與 Codex 各登記一次並設好逾時與輸出上限
搭本機模型把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原照 Ollama 與 LM Studio 的官方指令把代理整個接到本機模型,確認上下文與 Claude Code 現在連到誰,用完再還原
搭本機模型Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單動手前照一張表逐項核對資料、憑證、標籤是不是 :cloud、上下文、逾時與輸出量和驗收,並知道每一項詳見哪一篇

常見問題

要照順序讀完這個系列嗎?

不用照特定順序讀完。一般使用者可以先從觀念的幾篇看起,弄懂一次對話、流程與代理三個層次的差別,以及把工作拆給多個模型的依據;已經會寫 Python 與命令列的人,可以直接跳進接線的幾篇,看怎麼換供應商、寫路由與級聯、讓模型之間交接資料。

不會寫程式,也能看懂這個系列嗎?

觀念的幾篇不假設你會寫程式,先弄懂該不該拆、拆給誰、拆完怎麼取捨這幾個判斷就夠;等你想真的動手把不同供應商的模型接在同一支程式裡、設計路由與級聯、讓模型之間交接資料,才需要能跑 Python 與命令列。

接線的幾篇和協作與工具的幾篇,差別在哪裡?

接線的幾篇講的是在自己的程式裡把不同供應商的模型串起來:換掉 base_url、金鑰與 model 字串就連到別家模型,往上疊一層便宜先試、貴的兜底的路由與級聯,再用 JSON Schema 把交接的資料驗證過才送給下游。協作與工具的幾篇則是現成的代理式命令列工具怎麼分規劃、執行、審查三個角色,同一支 MCP 伺服器怎麼同時登記進多個客戶端,以及哪一段留在自己的電腦上、換成代號的乾淨文字才交給雲端模型收尾。

想讓 Claude Code 或 Codex 搭本機模型,要從哪一篇開始讀?

先讀講兩種接法怎麼選的那一篇,它不需要寫程式,會依資料能不能出門、上下文開得夠不夠長、工作的類型,幫你在代理照常連雲端、把雜務交給本機模型,與把代理的模型整個換成本機模型之間選出接法。選好之後,要把大量雜務交給本機模型,就讀批次腳本與 MCP 工具那幾篇;要整個換成本機模型,就讀 Ollama 與 LM Studio 設定與還原那一篇;GLM、Qwen、DeepSeek 的標籤哪些能下載到自己電腦、哪些其實在雲端,看講這幾個家族的那一篇;開工之前,再用檢查清單逐項核對。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享