生活分享

各家 AI 模型總表:同級距的 token 規格與官方自報分數

把 OpenAI、Anthropic、Google、xAI、阿里巴巴、Mistral、MiniMax、DeepSeek、Moonshot、Z.AI 各家官網當天的模型攤成四張表:旗艦、中階、輕量各一張,每一列同時給上下文視窗、最大輸出與每百萬 token 輸入輸出價,另加一張十二個開放權重模型的參數與授權表。效能欄只抄官網自己公布的分數,並說明為什麼六家官網用的 benchmark 幾乎沒有交集。

更新日期: 閱讀時間約 11 分鐘

三個由大到小的圓角方塊並排,每個方塊上有數量不同的小圓點,右側一條縱線把畫面分成可比與不可比兩半
圖片:Mokaair (© Mokaair)

想比較各家模型的時候,真正能攤在同一張表上的只有一半:上下文視窗、最大輸出與每百萬 token 的輸入輸出價,各家官網都寫得清楚,欄位對得起來;但是效能不行。這篇把十家官網當天的模型排成三張分級表,效能欄只抄官網自己公布的分數,抄不到的就寫「官網未公布」,不從第三方比價站或排行榜補。

讀完你會知道三件事:同一個級距裡各家的 token 規格差多少、同一個級距裡各家的價差有多大,以及為什麼「同級距的效能」這個問題,用官網資料回答不了。最後一件事不是這篇偷懶,是查證的結果,後面有一張表把六家官網的揭露情況列出來。

這張表怎麼分級

級距用的是各家自己的命名習慣,不是本站的評分:每家都有一個最貴、標榜最強的旗艦,一個主打速度與能力平衡的中階,以及一個為跑量與即時回應設計的輕量。分級的意義在於同級距的模型通常被拿來做同一類工作,所以放在一起比才有意義;跨級距比價格沒有結論,因為那本來就是兩種用途。

  • 上下文視窗:單次請求能塞進去的總量,輸入與輸出共用,數字越大能一次讀完的文件越長。
  • 最大輸出:單次回應最多能生成多少 token。這一欄很多家的定價頁不寫,要翻到模型文件才有,翻不到就是「官網未公布」。
  • 價格:照官網幣別(都是美元)沒有換算,也沒有套用快取、批次與離峰折扣。DeepSeek 用的是尖峰、快取未命中的價;MiniMax-M3 用的是官網標「永久五折」之後的價。
  • 官方自報分數:只有廠商自己在官網或官方模型卡公布的數字才會出現在這一欄。

旗艦級:十家攤在同一張表上

旗艦這一級最值得注意的不是誰最強,是這一級內部的價差。同樣掛著旗艦名字,最貴的每百萬輸出 token 要 50 美元,最便宜的 1.20 美元,中間差了四十倍以上。上下文視窗反而趨於一致,多數已經站上 100 萬 token。

十家官網 2026 年 9 月 16 日當天的標準價,未套用快取、批次與離峰折扣。分數為廠商自報、測試條件不同,不可直接相減排名次。
廠商模型上下文/最大輸出每百萬 token 輸入/輸出官方自報分數
OpenAIgpt-6-astra1.05M/128K10.00 美元/50.00 美元GPQA Diamond 96.0%
AnthropicClaude Fable 5.11M/128K10 美元/50 美元官網未列分數
AnthropicClaude Opus 51M/128K5 美元/25 美元官網未列分數
OpenAIgpt-5.6-sol1.05M/128K4.00 美元/20.00 美元官網未公布
Moonshotkimi-k31.05M/官網未公布3.00 美元/15.00 美元官網未公布
Googlegemini-3.1-pro-preview1M/64K2.00 美元/12.00 美元GPQA Diamond 94.3%、SWE-Bench Verified 80.6%
xAIgrok-4.650 萬/官網未公布2.00 美元/6.00 美元官網用另一組 benchmark
阿里雲百鍊qwen3.8-max1M/官網未公布2 美元/6 美元官網未列分數
Z.AIGLM-5.3官網未公布1.40 美元/4.40 美元官網未公布
DeepSeekdeepseek-v4-pro1M/384K1.32 美元/3.96 美元官網未列分數
MistralMistral Large 3官網未公布0.50 美元/1.50 美元官網未公布
MiniMaxMiniMax-M351.2 萬/官網未公布0.30 美元/1.20 美元官網未公布

有幾個欄位要小心讀。gemini-3.1-pro-preview 與 grok-4.6 的價格是 20 萬 token 以內的價,超過門檻兩欄都會往上跳。deepseek-v4-pro 寫的是尖峰價,離峰對折,而且官網的輸入價分「快取命中」與「快取未命中」兩欄,表上用的是未命中那一欄。kimi-k3 同樣有快取命中價,未命中是 3.00 美元、命中只要 0.30 美元。Mistral 的命名跟價位帶對不上:掛著 Large 的 Mistral Large 3 反而比掛著 Medium 的便宜。

這些欄位背後還有三件會改變帳單的事——快取命中價、長上下文加價門檻,以及各家 tokenizer 切出來的 token 數不一樣——寫在那篇。

中階級:多數正式產品實際在用的一層

中階是實際流量最常落在的一層,因為它通常已經夠用,而價格只有旗艦的幾分之一。這一級的價差比旗艦收斂,輸出價大致落在每百萬 token 1.20 到 12 美元之間。

同上,2026 年 9 月 16 日各家官網標準價。gemini-3.8-flash 的 0.75 美元與 3.75 美元官網標到 2026 年 12 月 31 日,之後回到 1.50 美元與 7.50 美元。
廠商模型上下文/最大輸出每百萬 token 輸入/輸出官方自報分數
OpenAIgpt-5.6-terra1.05M/128K2.00 美元/12.00 美元官網未公布
AnthropicClaude Sonnet 51M/128K2 美元/10 美元官網未列分數
Googlegemini-3.5-flash官網未公布1.50 美元/9.00 美元官網未公布
MistralMistral Medium 3.5官網未公布1.50 美元/7.50 美元官網未公布
xAIgrok-4.31M/官網未公布1.25 美元/2.50 美元官網用另一組 benchmark
Moonshotkimi-k2.7-code26.2 萬/官網未公布0.95 美元/4.00 美元官網未公布
Googlegemini-3.8-flash官網未公布0.75 美元/3.75 美元官網未公布
阿里雲百鍊qwen3.7-plus1M/官網未公布0.40 美元起/1.60 美元起官網未列分數
MiniMaxMiniMax-M2.7官網未公布0.30 美元/1.20 美元官網未公布
DeepSeekdeepseek-flash1M/384K0.30 美元/1.20 美元官網未列分數

輕量級:跑量、分類與即時回應

輕量級是量大、單次任務簡單時的選擇,例如分類、抽取欄位、改寫短句。這一級的價格已經低到跟旗艦不是同一個數量級:最便宜的輸入價每百萬 token 0.05 美元,是旗艦最高價的兩百分之一。要注意的是這一級的上下文視窗官網多半不在定價頁寫,得自己翻模型文件確認。

同上,2026 年 9 月 16 日各家官網標準價。Z.AI 另有 GLM-4.7-Flash 與 GLM-4.5-Flash 官網標免費,沒有列進表。
廠商模型上下文/最大輸出每百萬 token 輸入/輸出官方自報分數
AnthropicClaude Haiku 4.5200K/64K1 美元/5 美元官網未列分數
OpenAIgpt-5.4-mini官網未公布0.75 美元/4.50 美元官網未公布
Googlegemini-3.5-flash-lite官網未公布0.30 美元/2.50 美元官網未公布
Googlegemini-3.1-flash-lite官網未公布0.25 美元/1.50 美元官網未公布
OpenAIgpt-5.6-luna1.05M/128K0.20 美元/1.20 美元官網未公布
阿里雲百鍊qwen3.8-flash1M/官網未公布0.15 美元/0.47 美元官網未列分數
MistralMistral Small 4官網未公布0.15 美元/0.60 美元官網未公布
Z.AIGLM-5.3-Flash官網未公布0.15 美元/0.50 美元官網未公布
Googlegemini-2.5-flash-lite官網未公布0.10 美元/0.40 美元官網未公布
MistralMinistral 3(3B)官網未公布0.10 美元/0.10 美元官網未公布
OpenAIgpt-5-nano官網未公布0.05 美元/0.40 美元官網未公布

開放權重:可以自己下載回來跑的那些

上面三張表的模型都只能透過 API 使用。另外有一批模型是把權重直接放出來的,可以下載回自己的機器或自己的雲上跑,不必把資料送給廠商。這一級的比較重點跟前三張不一樣:沒有每百萬 token 的價格可比,取而代之的是參數規模與授權條款。授權才是這張表真正要看的欄位。

2026 年 9 月 16 日各家自己的權重發布頁,授權欄照權重庫裡 LICENSE 檔的正式名稱。上半是 OSI 認可的標準授權,下半是廠商自訂授權,兩段之間的差別在正文說明。
廠商模型參數規模上下文視窗權重授權
MetaMuse Glimmer 30B30B(密集)13.1 萬Apache 2.0
GoogleGemma 4 31B30.7B(密集)26.2 萬Apache 2.0
OpenAIgpt-oss-120b117B,啟用 5.1B13.1 萬Apache 2.0
Ai2Olmo Hybrid 7B7B(密集)6.5 萬Apache 2.0
DeepSeekDeepSeek-V4.1-Flash552B 骨幹,啟用 8B 到 16B100 萬MIT
Z.AIGLM-5.3-Flash320B,啟用 18B100 萬MIT
NVIDIANemotron 3.5 Lightning 30B-A3B30B,啟用 3B100 萬OpenMDW 1.1(非 OSI)
MistralMistral Medium 3.5 128B128B(密集)26.2 萬Modified MIT(非 OSI)
阿里巴巴(Qwen)Qwen3.8-Flash-Next125B,啟用 6B26.2 萬(可延伸至 100 萬)Qwen Community License 1.0(非 OSI)
阿里巴巴(Qwen)Qwen3.8-2.4T-A95B2.4T,啟用 95B26.2 萬(可延伸至 101 萬)Qwen3.8-Max License(非 OSI)
MiniMaxMiniMax-M3428B,啟用 23B100 萬MiniMax Community License(非 OSI)
MoonshotKimi K32.8T,啟用 104B100 萬Kimi K3 License(非 OSI)

表分成兩段不是排版,是兩種法律狀態。上半六個是 Apache 2.0 與 MIT,OSI 認可的標準授權,商用沒有額外義務。下半六個都是廠商自訂的授權,名字看起來像標準授權也一樣:Mistral 的「Modified MIT」在 MIT 上加了一條,公司月營收超過 2,000 萬美元就不能依這份授權使用;MiniMax 要求商用時在網站或文件顯著標示「Built with MiniMax M3」;阿里巴巴與 Moonshot 都設了月活躍用戶一億或月營收 2,000 萬美元的標示義務,拿去做 Model-as-a-Service 或辦公與程式助理類產品還要另外簽商用授權。這些條款不會出現在 API 定價頁上,只在權重庫的 LICENSE 檔裡。

還有一個陷阱是同一個家族不同型號的授權可能不同。阿里巴巴的 Qwen3.8-27B 是 Apache 2.0,但同系列的 Qwen3.8-Flash-Next 是 Qwen Community License 1.0、Qwen3.8-2.4T-A95B 又是另一份 Qwen3.8-Max License,三份條款不一樣。所以授權要看你實際要下載的那個型號,不能看家族名稱就套。

開放權重跟閉源在使用上的差別,站上有;想真的把模型跑在自己電腦上,先看估一下記憶體與顯示記憶體夠不夠——這張表裡好幾個是幾千億參數,不是桌機跑得動的。個別家族另有、與三篇。

效能為什麼比不了:六家用的不是同一組 benchmark

上面三張表的效能欄大量出現「官網未公布」,這不是漏抄。2026 年 9 月 16 日逐一打開六家官網之後,結論是各家連量的東西都不一樣,所以沒有一把尺能把它們排在一起。

2026 年 9 月 16 日各家官方發布頁、模型卡與 API 文件的揭露情況。
廠商官網有沒有列跑分用的是哪一組 benchmark
OpenAI有,列了分數GPQA Diamond(gpt-6-astra 96.0%)
Google有,列了分數GPQA Diamond、SWE-Bench Verified、長上下文與多模態各項
xAI有,列了分數AA Intelligence Index、Terminal-Bench v3.0、CursorBench v3.2、APEX-SWE 等十項
Anthropic有提到項目,沒有數字Frontier-Bench v0.1、ARC-AGI 3、OSWorld 2.0、GDPval-AA v2 等,只給相對說法
阿里雲百鍊有,但用自家測試環境SWE-Bench 系列,官方註明用自家 agent scaffold、20 萬 token 上下文
DeepSeekAPI 文件沒有跑分表官網未公布
左側四個方塊代表旗艦、中階、輕量與開放權重四個級距,四個方塊接到中間一條縱線後分成兩條箭頭,一條通往標示可比的規格欄位,一條通往標示不可比的效能欄位
同一張表裡有兩種欄位:左半的 token 規格與價格各家寫法一致,可以直接比;右半的效能欄各家量的東西不同,只能各自看。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

左邊由上而下是旗艦級、中階級、輕量級與開放權重四個級距的方塊,四個方塊接到中間一條縱向的線,再分成兩條箭頭指向右邊兩個面板。上面的綠色面板寫「可以直接比」,列出上下文視窗、最大輸出、每百萬 token 價與權重授權,因為各家官網的寫法一致。下面的紅色面板寫「不能直接比」,列出官方自報分數,因為各家用的 benchmark 與測試條件不同。

跑分本身怎麼讀、有哪些常見陷阱,站上另外寫過一篇。想知道旗艦、中階、輕量這三個級距在使用上的實際差別,可以看;只想看價格、不看規格與分數的話, 那篇把快取價、批次折扣與免費層條款寫得更細。

這張表什麼時候會過期

很快。光是 2026 年 1 月到 9 月,各家就發了三十次以上的模型,節奏可以看。表格 caption 裡的日期就是這張表的有效期起點:看到這篇時若已經過了幾個月,把要用的那一列拿去官網對一次再下決定,特別是價格與上下文視窗這兩欄,改動最頻繁。另外兩個名詞如果還不熟,與各有一篇。

  • 生活分享

    API 價格比較:每百萬 token 各家多少

    接 API 之前先把價目表攤開:這篇抄下 OpenAI、Anthropic、Google Gemini、xAI、阿里雲百鍊、Mistral、MiniMax、DeepSeek 八家官網當天的旗艦、中階、輕量三級每百萬 token 輸入與輸出價,寫出快取價、批次折扣、免費層條款與計費幣別,最後附一段一萬次對話的算式讓你代入自己的用量。不評分、不宣稱實測,只照官網欄位排。

  • 生活分享

    模型跑分怎麼看:LMArena、SWE-bench 與三個陷阱

    跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。本文照 2026 年 9 月 15 日的官方頁面,拆開 Arena(原 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼用五百題真實 GitHub issue 算修復率,以及 GPQA、MMLU-Pro、AIME 這些題庫官方怎麼定義,再談題目外洩、廠商自報的測試條件、榜單更新三個陷阱,最後給一套自己出題的驗收法。

  • 生活分享

    同一家為什麼有好幾個模型:旗艦、中階、輕量怎麼選

    打開 ChatGPT、Claude、Gemini 的模型選單,同一家就有三四個名字,差別其實只有兩個軸:旗艦、中階、輕量三階對應能力、速度、價格的取捨,加上「要不要先想一下」的推理開關。這篇依三家官網在 2026 年 10 月 5 日的資料整理家族名單與每百萬 token 的 API 價格,說明免費版拿到哪一階,並用五種日常任務示範怎麼選:多數事情先用中階就夠。

  • 生活分享

    2026 年 AI 模型大事記:1 月到 9 月 15 日的官方發布時間軸

    2026 年 1 月 1 日到 9 月 15 日,各家 AI 公司在官方公告頁上宣布了哪些模型?這篇只收各家官網自己寫的發布:OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen、Mistral、SpaceXAI 與 MiniMax,依月份排成一條時間軸,每一筆記下公告日期、模型名、官方那句定位,以及對一般使用者的實際影響:免費層能不能用、要不要付費方案、開放權重能不能下載,最後附一張三十筆的對照表。不做排名、不轉述媒體報導,只抄各家官方公告的原文。

最新旅遊情報攻略

資料來源

生活分享