生活分享

模型跑分怎麼看:LMArena、SWE-bench 與三個陷阱

跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。本文照 2026 年 9 月 15 日的官方頁面,拆開 Arena(原 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼用五百題真實 GitHub issue 算修復率,以及 GPQA、MMLU-Pro、AIME 這些題庫官方怎麼定義,再談題目外洩、廠商自報的測試條件、榜單更新三個陷阱,最後給一套自己出題的驗收法。

更新日期: 閱讀時間約 12 分鐘

一面白色排行榜面板上有四條長短不一的彩色橫條,右邊一個大放大鏡罩住其中三條短橫條。
圖片:Mokaair (© Mokaair)

跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。這篇回答的是:那些到處被引用的「某模型拿下第一」怎麼算出來、你該不該信、又該怎麼用。結論先講:跑分只能告訴你「在這套題目、這個跑法下誰比較高」,換一套題目或換一個跑法,順序就可能不一樣。有用的讀法是找到跟你任務最像的那一欄,確認數字的條件,再自己出題驗一次。

讀完你會知道三件事:Arena(原本的 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼把真實的 GitHub issue 變成可以打勾的題目、還有 GPQA 與 AIME 這類題庫官方怎麼定義。接著是三個最常踩的陷阱,最後是一張把任務對到榜單的圖,和一套自己出五題驗收的作法。方法描述與日期都來自 2026 年 9 月 15 日各官方頁面當天的內容;本文沒有執行任何評測,也不寫任何模型當天的名次,因為名次每天都在動。

跑分是什麼、誰在出題

一個跑分要成立,得先有三樣東西:一組題目、一個判對錯的規則、一個統一的跑法。題目可能是選擇題,可能是一個壞掉的程式庫,也可能是「隨便你問」。判對錯可能是比對標準答案、跑單元測試,或是請人投票。跑法則包含能不能用工具、能試幾次、想多久、用哪一版的外框程式。三樣裡少寫一樣,數字就沒辦法跟別人的放在一起比。

出題的人大致分三種,可信程度不一樣,混在同一張表上比通常就是誤讀的開始。

  • 榜單機構自己出題、自己統一跑:環境與跑法由榜單決定,官方頁面會寫清楚方法與版本,Arena 與 SWE-bench 屬於這種
  • 各家模型公司自報:數字寫在自家的 system card 或 model card 裡,跑法自己決定,條件常藏在圖表底下的小字
  • 開放平台彙整:由模型作者上傳自己的結果,平台彙整成該題庫的排行榜,並標示有沒有經過驗證

LMArena:投票怎麼變成分數

先講名字。查證當天,LMArena 原本的網域會以 301 永久轉址到 Arena 的新網域,頁尾署名 Arena Intelligence,所以下面統一叫它 Arena;很多文章仍沿用 LMArena,指的是同一個榜。玩法官方寫得很白:你輸入提示詞,系統給你兩個匿名模型的回答,你挑一個比較合用的,投完票才揭曉是哪兩個模型。官方說明頁另外寫,自 2024 年 3 月起也幫各家測試尚未公開的模型。

票怎麼變成分數?官方常見問題寫的是 Bradley-Terry 評分系統,一個用來處理成對比較的統計模型;官方自己說它和西洋棋用的 Elo 很像,選它是因為成對比較上很成熟、算得快,也容易再加進其他特徵。分數旁邊的正負號是 95% 信賴區間;官方 2025 年 12 月 18 日發表的 Arena-Rank 套件說明裡寫,信賴區間改用封閉解計算,比舊版快三十倍以上。

有兩件事會讓你誤讀這個分數。第一,版面會影響人類的偏好。官方 2024 年 8 月 29 日發表的風格控制文章,把回答長度、Markdown 標題數、粗體數與清單數這四個特徵加進迴歸,排名確實動了;但同一篇的限制段落寫得很老實,這仍是觀察性分析,可能有沒被觀察到的干擾因子。第二,2026 年 7 月 30 日上線的 AutoEval:人類票還沒夠時,官方會用一個學人類偏好的獎勵模型自動投票先給分,榜上標成 AutoEval,等人票夠了才更新;看到這個標籤,你看的就不是純人類投票的結果。

還有幾條規則值得記住。官方常見問題寫明,只有在模型還匿名時投的票才算進正式排名,揭曉身分之後投的不算;並排比較與直接對話模式的票也不進公開榜。榜單政策頁(2026 年 9 月 1 日最後更新)寫,廠商可以在公開前用代號測試多個版本,但必須提供給榜單至少 30 天的模型使用權,並書面確認公開版與測試版相同;公開後累積足夠新票之前,分數標成暫定。

SWE-bench:真實 issue 的修復率

SWE-bench 的題目不是選擇題,是真的壞掉的程式。官方文件寫的任務是:給定一個程式庫與一個 issue,語言模型要產生一個能解決該問題的修補檔。判對錯完全機械化,把修補檔套進真實的程式庫,在 Docker 容器裡跑該專案自己的測試,測試轉綠才算解決,所以這個榜不容易被文筆影響。

榜單上的分數只有一個欄位叫 % Resolved,官方圖例寫的是解決的題目占全部題目的百分比。原始題庫是十二個 Python 專案的 2,294 題;最常被引用的 Verified 是人工篩過的 500 題子集,官方頁面寫它是與 OpenAI 合作做出來的,由人工逐題檢查問題描述是否清楚、測試修補是否正確、在現有資訊下是否解得出來。官方另有 Lite 300 題、Multilingual 300 題與 480 題。

同樣是那 500 題,還分兩種看法。完整榜放的是各式各樣的系統,從最陽春的模型迴圈到多次重跑再挑一份交出去的都有;Bash Only 榜則把所有模型放進同一個極簡環境,官方寫的是用 mini-SWE-agent,沒有工具、沒有特殊外框。要比模型本身看後者,要比整套產品看前者。官方也提醒 mini-SWE-agent 1.x 與 2.x 的結果不一定可比,因為 2.x 改用工具呼叫執行動作,也不再設定溫度。

榜上還有一個打勾值得認得,官方圖例寫的是由 SWE-bench 團隊執行或直接查核過的結果;沒有打勾的就是投稿者自己跑的。投稿規則要求把預測檔、每題的執行紀錄與推理軌跡放在公開倉庫裡。

三欄對照圖,左欄是五種常見任務,中欄是對應的榜單,右欄是看那個數字之前要先確認的條件。
由左往右看:先找到你的任務那一列,再看中欄該查哪個榜,最後照右欄的條件核對數字。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

一張三欄對照表。左欄「你的任務」由上到下五列:日常問答與寫作、寫程式與修 bug、代理跑多步任務、專業知識與數學、長文件與長對話。中欄「該看哪個榜」依序對應:Arena 文字榜與子分類,由人類盲測投票以 Bradley-Terry 算分;SWE-bench Verified 的 Bash Only 榜,500 題放在同一個極簡環境;Arena 代理榜,2026 年 8 月 14 日起依任務分類並標出成本;各家 model card 裡的 GPQA 與 AIME,由廠商自己跑、自己寫條件;長上下文題庫,官方會寫測的是哪個長度。右欄「看數字前先確認」依序對應:分數旁的 95% 信賴區間與有沒有標 AutoEval;是不是同一個子集、外框與嘗試次數對不對;任務類別對不對、一次任務要花多少錢;有沒有給工具、跑幾次取平均;測的是多長的內容、是累積分還是單點分。最下方一條橫帶寫著三個陷阱:題目外洩與過擬合、廠商自報數字的測試條件、榜單更新速度與方法都會變;並提醒三個都對不上時,自己出五題,同一份提示詞讓兩個候選各跑一次。

知識與推理題庫:名字與定義

除了上面兩個榜,各家發表模型時最常列的是一串題庫名字。這裡只寫官方頁面怎麼定義它們,不引第三方彙整站的說法。

  • GPQA:官方說明寫,這是由生物、物理、化學等領域的博士級專家出的高難度知識題,設計成外行人很難、專家相對容易,並用權限控管限制取得,以降低資料汙染的風險
  • MMLU-Pro:官方說明寫它是 MMLU 的改良版,選項從 4 個增加到 10 個、需要推理的題目變多;因為原本的 MMLU 有雜訊題,且隨著模型變強與資料汙染增加,難度一直在下降
  • AIME:官方評測設定檔的範例把它寫成美國高中數學邀請賽,題目每年出一次,所以常看到後面接年份
  • HLE:官方設定檔寫它是橫跨數十個學科、2,500 題的多模態題庫,由全球領域專家出題,形式是選擇題與簡答題

Hugging Face 也把這些分數的來歷寫清楚了:模型作者把結果以檔案放進自己的模型庫,平台依中繼資料給標記,跑在官方環境、帶有效驗證憑證的標成已驗證,以 Pull Request 投稿、還沒合併的標成社群提供。官方文件直接寫,如果分數有爭議,模型作者可以把 Pull Request 關掉讓分數消失;文件最上面還掛著「這是進行中的功能」的警告。

三個陷阱

陷阱一是題目外洩與過擬合。題庫大多公開,公開就可能被寫進訓練資料,分數於是變成背答案。榜單方也在防:GPQA 用權限控管限制取得,Google DeepMind 的評測方法頁寫,跑需要搜尋的評測時會加一份黑名單,擋掉可能含有評測數字的網站。SWE-bench 官方 2025 年 11 月 19 日的文章更直接,他們寫了一支腳本,把標準答案與投稿的修補檔去掉註解後逐段比對,量出各榜的逐字命中率約在 2% 到 7% 之間,並宣布往後超過 20% 的投稿就要求說明。

陷阱二是廠商自報數字的測試條件。同一個題庫,工具給不給、跑幾次取平均、讓它想多久,數字可以差很多。Google DeepMind 在 2026 年 2 月發表的 Gemini 3.1 Pro 評測方法頁寫得很細:所有分數是 pass@1,單次嘗試的設定不允許多數投票與平行的測試期運算;小題庫會跑多次取平均降低變異,SWE-bench Verified 平均 10 次;他們自己的外框只有 bash、檔案操作與送出三種工具。同一頁還寫,非 Gemini 模型的數字取自各家自報,預設取可得的最高思考設定。Anthropic 在 2026 年 7 月 24 日 Claude Opus 5 的發表頁上,圖表註腳也寫明是內部跑的、用哪個外框、每題取 5 次的平均分。

陷阱三是榜單更新的速度不一樣,方法本身也會變。查證當天,Arena 的榜單更新紀錄最新一筆是 2026 年 9 月 14 日,幾乎每天都有模型加入;SWE-bench 官方榜單資料裡,最新一筆投稿是 2026 年 2 月 26 日。同一句「這是最新排名」,在兩個榜上的意思完全不同。方法也一直在動:Arena 在 2026 年 8 月 14 日改了代理榜,加上任務分類與成本欄。所以看跑分時,先看頁面上的日期與版本號,再看數字。

三段官方方法頁原文:票怎麼算分、怎麼算解決、一個數字帶了哪些條件 · text
[Arena FAQ - How is my feedback used to rank AI models?]
Your votes directly shape the model rankings through the Bradley-Terry rating
system, a statistical model originally developed for paired comparison experiments.
Note: Only votes made while the models are anonymous count toward official rankings.

[SWE-bench - Official Leaderboards]
Each entry reports % Resolved, the percentage of task instances solved.
Run performed or directly checked by the SWE-bench team.

[Gemini 3.1 Pro Model Evaluation - Approach, Methodology & Results, February 2026]
All Gemini scores are pass@1 except where otherwise noted. "Single attempt" settings
allow no majority voting or parallel test-time compute. To reduce variance, we average
over multiple trials for smaller benchmarks. All the results for non-Gemini models are
sourced from providers' self reported numbers unless mentioned otherwise below.
各榜的方法與限制以 2026 年 9 月 15 日各官方頁面當天內容為準,本表不列任何模型的名次或分數。
榜單測什麼怎麼算分官方寫的限制
Arena 文字榜兩個匿名模型同題對打,由人投票Bradley-Terry 迴歸,附 95% 信賴區間只有匿名時投的票算進正式排名
Arena 風格控制榜同上,但把版面因素抽掉迴歸再加長度與 Markdown 三項共四個特徵官方寫這仍是觀察性分析,可能有未觀察到的干擾因子
Arena AutoEval 分數人類票還不夠時的暫時分數用學人類偏好的獎勵模型自動投票,再與人票合併榜上標成 AutoEval,等人票夠了才更新
Arena 代理榜多步驟的真實任務同樣是投票分數,另外標出任務成本2026 年 8 月 14 日才改成依任務分類
SWE-bench Verified500 題真實 GitHub issue 的修補% Resolved,測試轉綠的題目比例人工篩過,確認題目講清楚且解得出來
SWE-bench Bash Only同樣 500 題,統一極簡環境同上,全部用 mini-SWE-agent 跑1.x 與 2.x 版本的結果不一定可比
SWE-bench 原始題庫十二個 Python 專案的 2,294 題同上另有 Lite、Multilingual、Multimodal 子集
Hugging Face 模型卡評測結果各家自己貼上的題庫分數由模型庫裡的評測結果檔彙整成榜分已驗證與社群提供;文件標示為進行中的功能

怎麼用:三步讀法加五題自測

把上面收斂成三個動作,看到任何跑分都照這三步走一次。

  1. 先對任務:寫程式看 SWE-bench 的 Bash Only 榜,多步驟任務看 Arena 的代理榜,日常問答與寫作看 Arena 文字榜裡跟你最像的子分類,長文件看長上下文題庫。總榜第一名跟你的任務多半沒什麼關係
  2. 再對條件:確認是同一個子集、同一個外框、同樣的嘗試次數與思考設定;這些通常在圖表底下的小字裡,找不到條件的數字就當它不存在
  3. 最後對日期:記下榜單的更新日期與版本號,下次再看時先確認日期有沒有動

第三步之後才是真正決定你怎麼選的事:自己出五題。挑你每週真的會做的工作,五題涵蓋最常見與最麻煩的情況,兩個候選各跑一次,用同一份提示詞與同一份資料。你評的不是「哪個比較聰明」,而是「哪個少讓我改一次」;你的資料、格式要求與容錯標準,沒有一個題庫測得到。

五題自測的題目表、記錄表與評分原則,兩個候選各跑一次 · text
【題目表|先寫死,兩邊用同一份】
1. <你每週一定會做的事,例如:把這封客戶信改成三段的回覆>
2. <最常見的情況>
3. <最麻煩的情況,例如資料不齊或前後矛盾>
4. <你最怕它亂編的情況,例如問一個沒有答案的問題>
5. <長一點的,例如一份十頁文件的重點整理>

【記錄表|每題一列】
題號 | 模型 | 一次過關 | 我改了幾處 | 有沒有編造 | 花了幾分鐘

【評分只問三件事】
- 少讓我改一次的那個贏
- 遇到資料不足時,會回頭問我的,贏過自己填一個的
- 同一題再跑一次,結果差很多的扣分

自測時順手記一件事:它有沒有把不確定的內容講得很肯定。

跑分是篩選工具,不是決策工具。它幫你把候選名單從十個縮到三個,剩下的靠你自己那五題。看到漂亮的數字,先問三個問題:哪個子集、什麼跑法、哪一天的榜。三個都答得出來,那個數字才值得放進你的判斷。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享