生活分享
模型跑分怎麼看:LMArena、SWE-bench 與三個陷阱
跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。本文照 2026 年 9 月 15 日的官方頁面,拆開 Arena(原 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼用五百題真實 GitHub issue 算修復率,以及 GPQA、MMLU-Pro、AIME 這些題庫官方怎麼定義,再談題目外洩、廠商自報的測試條件、榜單更新三個陷阱,最後給一套自己出題的驗收法。
更新日期: 閱讀時間約 12 分鐘

跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。這篇回答的是:那些到處被引用的「某模型拿下第一」怎麼算出來、你該不該信、又該怎麼用。結論先講:跑分只能告訴你「在這套題目、這個跑法下誰比較高」,換一套題目或換一個跑法,順序就可能不一樣。有用的讀法是找到跟你任務最像的那一欄,確認數字的條件,再自己出題驗一次。
讀完你會知道三件事:Arena(原本的 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼把真實的 GitHub issue 變成可以打勾的題目、還有 GPQA 與 AIME 這類題庫官方怎麼定義。接著是三個最常踩的陷阱,最後是一張把任務對到榜單的圖,和一套自己出五題驗收的作法。方法描述與日期都來自 2026 年 9 月 15 日各官方頁面當天的內容;本文沒有執行任何評測,也不寫任何模型當天的名次,因為名次每天都在動。
跑分是什麼、誰在出題
一個跑分要成立,得先有三樣東西:一組題目、一個判對錯的規則、一個統一的跑法。題目可能是選擇題,可能是一個壞掉的程式庫,也可能是「隨便你問」。判對錯可能是比對標準答案、跑單元測試,或是請人投票。跑法則包含能不能用工具、能試幾次、想多久、用哪一版的外框程式。三樣裡少寫一樣,數字就沒辦法跟別人的放在一起比。
出題的人大致分三種,可信程度不一樣,混在同一張表上比通常就是誤讀的開始。
- 榜單機構自己出題、自己統一跑:環境與跑法由榜單決定,官方頁面會寫清楚方法與版本,Arena 與 SWE-bench 屬於這種
- 各家模型公司自報:數字寫在自家的 system card 或 model card 裡,跑法自己決定,條件常藏在圖表底下的小字
- 開放平台彙整:由模型作者上傳自己的結果,平台彙整成該題庫的排行榜,並標示有沒有經過驗證
基準測試(Benchmark)是什麼基準測試(Benchmark)是什麼基準測試用共同題目、執行設定與評分方法比較系統,是理解 AI 能力的一種參考,不能直接當成所有用途的排名。本文以圖書館資料整理需求為例,說明題型、指標、提示詞、工具與測試汙染如何影響分數,解釋平均值與排名變動的限制。讀完能閱讀基準的適用範圍,判斷不同報告是否真的可比,並把公開成績接到自己的實際任務驗證。閱讀全文
LMArena:投票怎麼變成分數
先講名字。查證當天,LMArena 原本的網域會以 301 永久轉址到 Arena 的新網域,頁尾署名 Arena Intelligence,所以下面統一叫它 Arena;很多文章仍沿用 LMArena,指的是同一個榜。玩法官方寫得很白:你輸入提示詞,系統給你兩個匿名模型的回答,你挑一個比較合用的,投完票才揭曉是哪兩個模型。官方說明頁另外寫,自 2024 年 3 月起也幫各家測試尚未公開的模型。
票怎麼變成分數?官方常見問題寫的是 Bradley-Terry 評分系統,一個用來處理成對比較的統計模型;官方自己說它和西洋棋用的 Elo 很像,選它是因為成對比較上很成熟、算得快,也容易再加進其他特徵。分數旁邊的正負號是 95% 信賴區間;官方 2025 年 12 月 18 日發表的 Arena-Rank 套件說明裡寫,信賴區間改用封閉解計算,比舊版快三十倍以上。
有兩件事會讓你誤讀這個分數。第一,版面會影響人類的偏好。官方 2024 年 8 月 29 日發表的風格控制文章,把回答長度、Markdown 標題數、粗體數與清單數這四個特徵加進迴歸,排名確實動了;但同一篇的限制段落寫得很老實,這仍是觀察性分析,可能有沒被觀察到的干擾因子。第二,2026 年 7 月 30 日上線的 AutoEval:人類票還沒夠時,官方會用一個學人類偏好的獎勵模型自動投票先給分,榜上標成 AutoEval,等人票夠了才更新;看到這個標籤,你看的就不是純人類投票的結果。
以語言模型擔任評審(LLM-as-a-Judge)是什麼以語言模型擔任評審(LLM-as-a-Judge)是什麼以語言模型擔任評審,是讓模型依準則判斷另一段回答、比較候選內容或檢查特定條件,適合協助大量語意評測。本文以展覽說明改寫為例,說明評分準則、參考資料、人工校準與位置偏差,解釋為何長答案可能討好評審、模型評語也可能錯。讀完能設計可核對的評審工作,區分偏好、忠實性與事實正確,並知道哪些部分應交給程式或人檢查。閱讀全文
還有幾條規則值得記住。官方常見問題寫明,只有在模型還匿名時投的票才算進正式排名,揭曉身分之後投的不算;並排比較與直接對話模式的票也不進公開榜。榜單政策頁(2026 年 9 月 1 日最後更新)寫,廠商可以在公開前用代號測試多個版本,但必須提供給榜單至少 30 天的模型使用權,並書面確認公開版與測試版相同;公開後累積足夠新票之前,分數標成暫定。
SWE-bench:真實 issue 的修復率
SWE-bench 的題目不是選擇題,是真的壞掉的程式。官方文件寫的任務是:給定一個程式庫與一個 issue,語言模型要產生一個能解決該問題的修補檔。判對錯完全機械化,把修補檔套進真實的程式庫,在 Docker 容器裡跑該專案自己的測試,測試轉綠才算解決,所以這個榜不容易被文筆影響。
榜單上的分數只有一個欄位叫 % Resolved,官方圖例寫的是解決的題目占全部題目的百分比。原始題庫是十二個 Python 專案的 2,294 題;最常被引用的 Verified 是人工篩過的 500 題子集,官方頁面寫它是與 OpenAI 合作做出來的,由人工逐題檢查問題描述是否清楚、測試修補是否正確、在現有資訊下是否解得出來。官方另有 Lite 300 題、Multilingual 300 題與 Multimodal多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI 能處理不只一種資訊形式,例如文字、圖像、聲音或影片,但支援多種輸入不代表也能產生所有輸出。本文用組裝收納架的情境,說明影像與文字如何互相補充、原生整合與串接流程的差別,以及看見圖片為何仍可能漏讀細節。附輸入設計和交叉核對方法,幫你判斷模型依據畫面回答,還是把合理猜測當成看見的事實。閱讀全文 480 題。
同樣是那 500 題,還分兩種看法。完整榜放的是各式各樣的系統,從最陽春的模型迴圈到多次重跑再挑一份交出去的都有;Bash Only 榜則把所有模型放進同一個極簡環境,官方寫的是用 mini-SWE-agent,沒有工具、沒有特殊外框。要比模型本身看後者,要比整套產品看前者。官方也提醒 mini-SWE-agent 1.x 與 2.x 的結果不一定可比,因為 2.x 改用工具呼叫執行動作,也不再設定溫度參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文。
榜上還有一個打勾標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文值得認得,官方圖例寫的是由 SWE-bench 團隊執行或直接查核過的結果;沒有打勾的就是投稿者自己跑的。投稿規則要求把預測檔、每題的執行紀錄與推理軌跡放在公開倉庫裡。
AI 寫程式工具總覽:Claude Code、Codex、Gemini CLI、Cursor、CopilotAI 寫程式工具總覽:Claude Code、Codex、Gemini CLI、Cursor、Copilot五個常一起出現的寫程式 AI 工具,差別在跑在哪裡:終端機代理、編輯器內建、雲端代理。依 2026 年 9 月官網資料,整理 Claude Code、OpenAI Codex、Gemini CLI、Cursor 與 GitHub Copilot 各自要什麼帳號、有沒有免費額度、入門要多少錢、適合誰,最後給一個「你是哪種人就先裝哪個」的決策,並回答信用卡、中文與 Windows 三個常見問題。閱讀全文
閱讀完整文字說明
一張三欄對照表。左欄「你的任務」由上到下五列:日常問答與寫作、寫程式與修 bug、代理跑多步任務、專業知識與數學、長文件與長對話。中欄「該看哪個榜」依序對應:Arena 文字榜與子分類,由人類盲測投票以 Bradley-Terry 算分;SWE-bench Verified 的 Bash Only 榜,500 題放在同一個極簡環境;Arena 代理榜,2026 年 8 月 14 日起依任務分類並標出成本;各家 model card 裡的 GPQA 與 AIME,由廠商自己跑、自己寫條件;長上下文題庫,官方會寫測的是哪個長度。右欄「看數字前先確認」依序對應:分數旁的 95% 信賴區間與有沒有標 AutoEval;是不是同一個子集、外框與嘗試次數對不對;任務類別對不對、一次任務要花多少錢;有沒有給工具、跑幾次取平均;測的是多長的內容、是累積分還是單點分。最下方一條橫帶寫著三個陷阱:題目外洩與過擬合、廠商自報數字的測試條件、榜單更新速度與方法都會變;並提醒三個都對不上時,自己出五題,同一份提示詞讓兩個候選各跑一次。
知識與推理題庫:名字與定義
除了上面兩個榜,各家發表模型時最常列的是一串題庫名字。這裡只寫官方頁面怎麼定義它們,不引第三方彙整站的說法。
- GPQA:官方說明寫,這是由生物、物理、化學等領域的博士級專家出的高難度知識題,設計成外行人很難、專家相對容易,並用權限控管限制取得,以降低資料汙染的風險
- MMLU-Pro:官方說明寫它是 MMLU 的改良版,選項從 4 個增加到 10 個、需要推理的題目變多;因為原本的 MMLU 有雜訊題,且隨著模型變強與資料汙染增加,難度一直在下降
- AIME:官方評測設定檔的範例把它寫成美國高中數學邀請賽,題目每年出一次,所以常看到後面接年份
- HLE:官方設定檔寫它是橫跨數十個學科、2,500 題的多模態題庫,由全球領域專家出題,形式是選擇題與簡答題
Hugging Face 也把這些分數的來歷寫清楚了:模型作者把結果以檔案放進自己的模型庫,平台依中繼資料給標記,跑在官方環境、帶有效驗證憑證的標成已驗證,以 Pull Request 投稿、還沒合併的標成社群提供。官方文件直接寫,如果分數有爭議,模型作者可以把 Pull Request 關掉讓分數消失;文件最上面還掛著「這是進行中的功能」的警告。
模型與代理評測(Evals)是什麼模型與代理評測(Evals)是什麼模型與代理評測把任務、輸入、執行條件和成功標準固定下來,觀察 AI 是否真的符合需求。本文用志工排班助理為例,說明案例、重複嘗試、評分器與外部結果的差別,比較程式、人類與模型評分,解釋為何單次答對和平均高分都不足以證明可靠。讀完能建立一組小而實用的評測,讓提示詞或模型更新有可比較的證據,也能保留尚未驗證的限制。閱讀全文
三個陷阱
陷阱一是題目外洩與過擬合。題庫大多公開,公開就可能被寫進訓練資料,分數於是變成背答案。榜單方也在防:GPQA 用權限控管限制取得,Google DeepMind 的評測方法頁寫,跑需要搜尋的評測時會加一份黑名單,擋掉可能含有評測數字的網站。SWE-bench 官方 2025 年 11 月 19 日的文章更直接,他們寫了一支腳本,把標準答案與投稿的修補檔去掉註解後逐段比對,量出各榜的逐字命中率約在 2% 到 7% 之間,並宣布往後超過 20% 的投稿就要求說明。
陷阱二是廠商自報數字的測試條件。同一個題庫,工具給不給、跑幾次取平均、讓它想多久,數字可以差很多。Google DeepMind 在 2026 年 2 月發表的 Gemini 3.1 Pro 評測方法頁寫得很細:所有分數是 pass@1,單次嘗試的設定不允許多數投票與平行的測試期運算;小題庫會跑多次取平均降低變異,SWE-bench Verified 平均 10 次;他們自己的外框只有 bash、檔案操作與送出三種工具。同一頁還寫,非 Gemini 模型的數字取自各家自報,預設取可得的最高思考設定。Anthropic 在 2026 年 7 月 24 日 Claude Opus 5 的發表頁上,圖表註腳也寫明是內部跑的、用哪個外框、每題取 5 次的平均分。
陷阱三是榜單更新的速度不一樣,方法本身也會變。查證當天,Arena 的榜單更新紀錄最新一筆是 2026 年 9 月 14 日,幾乎每天都有模型加入;SWE-bench 官方榜單資料裡,最新一筆投稿是 2026 年 2 月 26 日。同一句「這是最新排名」,在兩個榜上的意思完全不同。方法也一直在動:Arena 在 2026 年 8 月 14 日改了代理榜,加上任務分類與成本欄。所以看跑分時,先看頁面上的日期與版本號,再看數字。
[Arena FAQ - How is my feedback used to rank AI models?]
Your votes directly shape the model rankings through the Bradley-Terry rating
system, a statistical model originally developed for paired comparison experiments.
Note: Only votes made while the models are anonymous count toward official rankings.
[SWE-bench - Official Leaderboards]
Each entry reports % Resolved, the percentage of task instances solved.
Run performed or directly checked by the SWE-bench team.
[Gemini 3.1 Pro Model Evaluation - Approach, Methodology & Results, February 2026]
All Gemini scores are pass@1 except where otherwise noted. "Single attempt" settings
allow no majority voting or parallel test-time compute. To reduce variance, we average
over multiple trials for smaller benchmarks. All the results for non-Gemini models are
sourced from providers' self reported numbers unless mentioned otherwise below.| 榜單 | 測什麼 | 怎麼算分 | 官方寫的限制 |
|---|---|---|---|
| Arena 文字榜 | 兩個匿名模型同題對打,由人投票 | Bradley-Terry 迴歸,附 95% 信賴區間 | 只有匿名時投的票算進正式排名 |
| Arena 風格控制榜 | 同上,但把版面因素抽掉 | 迴歸再加長度與 Markdown 三項共四個特徵 | 官方寫這仍是觀察性分析,可能有未觀察到的干擾因子 |
| Arena AutoEval 分數 | 人類票還不夠時的暫時分數 | 用學人類偏好的獎勵模型自動投票,再與人票合併 | 榜上標成 AutoEval,等人票夠了才更新 |
| Arena 代理榜 | 多步驟的真實任務 | 同樣是投票分數,另外標出任務成本 | 2026 年 8 月 14 日才改成依任務分類 |
| SWE-bench Verified | 500 題真實 GitHub issue 的修補 | % Resolved,測試轉綠的題目比例 | 人工篩過,確認題目講清楚且解得出來 |
| SWE-bench Bash Only | 同樣 500 題,統一極簡環境 | 同上,全部用 mini-SWE-agent 跑 | 1.x 與 2.x 版本的結果不一定可比 |
| SWE-bench 原始題庫 | 十二個 Python 專案的 2,294 題 | 同上 | 另有 Lite、Multilingual、Multimodal 子集 |
| Hugging Face 模型卡評測結果 | 各家自己貼上的題庫分數 | 由模型庫裡的評測結果檔彙整成榜 | 分已驗證與社群提供;文件標示為進行中的功能 |
怎麼用:三步讀法加五題自測
把上面收斂成三個動作,看到任何跑分都照這三步走一次。
- 先對任務:寫程式看 SWE-bench 的 Bash Only 榜,多步驟任務看 Arena 的代理榜,日常問答與寫作看 Arena 文字榜裡跟你最像的子分類,長文件看長上下文題庫。總榜第一名跟你的任務多半沒什麼關係
- 再對條件:確認是同一個子集、同一個外框、同樣的嘗試次數與思考設定;這些通常在圖表底下的小字裡,找不到條件的數字就當它不存在
- 最後對日期:記下榜單的更新日期與版本號,下次再看時先確認日期有沒有動
第三步之後才是真正決定你怎麼選的事:自己出五題。挑你每週真的會做的工作,五題涵蓋最常見與最麻煩的情況,兩個候選各跑一次,用同一份提示詞與同一份資料。你評的不是「哪個比較聰明」,而是「哪個少讓我改一次」;你的資料、格式要求與容錯標準,沒有一個題庫測得到。
【題目表|先寫死,兩邊用同一份】
1. <你每週一定會做的事,例如:把這封客戶信改成三段的回覆>
2. <最常見的情況>
3. <最麻煩的情況,例如資料不齊或前後矛盾>
4. <你最怕它亂編的情況,例如問一個沒有答案的問題>
5. <長一點的,例如一份十頁文件的重點整理>
【記錄表|每題一列】
題號 | 模型 | 一次過關 | 我改了幾處 | 有沒有編造 | 花了幾分鐘
【評分只問三件事】
- 少讓我改一次的那個贏
- 遇到資料不足時,會回頭問我的,贏過自己填一個的
- 同一題再跑一次,結果差很多的扣分自測時順手記一件事:它有沒有把不確定的內容講得很肯定。
AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文
跑分是篩選工具,不是決策工具。它幫你把候選名單從十個縮到三個,剩下的靠你自己那五題。看到漂亮的數字,先問三個問題:哪個子集、什麼跑法、哪一天的榜。三個都答得出來,那個數字才值得放進你的判斷。
同一家為什麼有好幾個模型:旗艦、中階、輕量怎麼選同一家為什麼有好幾個模型:旗艦、中階、輕量怎麼選打開 ChatGPT、Claude、Gemini 的模型選單,同一家就有三四個名字,差別其實只有兩個軸:旗艦、中階、輕量三階對應能力、速度、價格的取捨,加上「要不要先想一下」的推理開關。這篇依三家官網在 2026 年 10 月 5 日的資料整理家族名單與每百萬 token 的 API 價格,說明免費版拿到哪一階,並用五種日常任務示範怎麼選:多數事情先用中階就夠。閱讀全文
推理模型(Reasoning Model):多想幾步能解決什麼推理模型(Reasoning Model):多想幾步能解決什麼推理模型通常經過針對多步問題的訓練或推論設計,能在回答前投入更多計算來拆解、檢查與修正。本文用活動排程示範條件推理,區分推理能力、搜尋、工具和思考摘要,也說明為什麼等待更久或寫得更長不保證正確。讀完能判斷任務缺的是證據還是推導,並用可驗證的限制清單評估結果,而不必依賴產品等級與價格比較。閱讀全文
AI 能與不能:2026 年的誠實盤點AI 能與不能:2026 年的誠實盤點這篇不引媒體、不做預測,只抄各家 system card、model card 與官方文件裡自己寫下的限制,分成今天做得到、要人盯著、還做不到三欄:Claude Opus 5 系統卡承認幻覺比前一版多、OpenAI 寫信心不等於可靠、Gemini 說它會把不正確的事呈現得像事實。附官方原文出處、任務對照表,以及一套用五個任務替自己的工作盤點一次的方法。查證日為 2026 年 9 月 15 日。閱讀全文
開源 vs 閉源模型:對使用者的差別開源 vs 閉源模型:對使用者的差別日常講的「開源模型」多半是開放權重:權重檔能下載,但不一定符合 OSI 的開源 AI 定義。這篇用當天官方檔案原文比五件事:能不能離線自架、資料去哪裡、授權能不能商用(Llama 4、Gemma 4、Qwen、gpt-oss、DeepSeek 各是哪一份)、模型退場與支援期限、費用結構,最後給決策表與自測方法。閱讀全文
2026 年 AI 模型大事記:1 月到 9 月 15 日的官方發布時間軸2026 年 AI 模型大事記:1 月到 9 月 15 日的官方發布時間軸2026 年 1 月 1 日到 9 月 15 日,各家 AI 公司在官方公告頁上宣布了哪些模型?這篇只收各家官網自己寫的發布:OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen、Mistral、SpaceXAI 與 MiniMax,依月份排成一條時間軸,每一筆記下公告日期、模型名、官方那句定位,以及對一般使用者的實際影響:免費層能不能用、要不要付費方案、開放權重能不能下載,最後附一張三十筆的對照表。不做排名、不轉述媒體報導,只抄各家官方公告的原文。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Arena:How It Works(battle 模式給兩個匿名模型、投票後揭曉身分;自 2024 年 3 月起測試已公開與未公開模型) · 查證日期:
- Arena:FAQ(Bradley-Terry 評分系統、與 Elo 的關係、只有匿名時的票算進正式排名、並排與直接模式不計入榜) · 查證日期:
- Arena:Leaderboard Policy(2024 年 3 月 2 日發表、2026 年 9 月 1 日更新;公開前測試多個版本、至少 30 天模型使用權、暫定分數、下架規則) · 查證日期:
- Arena:Leaderboard Changelog(最新一筆為 2026 年 9 月 14 日,幾乎每日新增模型) · 查證日期:
- Arena:Does Style Matter?(2024 年 8 月 29 日發表、2025 年 6 月 13 日更新;控制長度與三項 Markdown 特徵;限制段落寫明仍是觀察性分析) · 查證日期:
- Arena:Arena-Rank 開源排名方法(2025 年 12 月 18 日發表、2026 年 2 月 21 日更新;封閉解信賴區間、比舊版快三十倍以上) · 查證日期:
- Arena:Introducing AutoEval to the Arena leaderboards(2026 年 7 月 30 日發表、8 月 12 日更新;獎勵模型自動投票、榜上標示 AutoEval) · 查證日期:
- Arena:Agent Leaderboard Improvements: Categories & Task Cost(2026 年 8 月 14 日;代理榜加上任務分類與成本) · 查證日期:
- SWE-bench 官方排行榜首頁(% Resolved 定義、打勾代表由官方執行或查核、各子集題數與最新投稿日期) · 查證日期:
- SWE-bench Verified 排行榜頁(500 題人工篩選子集、與 OpenAI 合作、Bash Only 用 mini-SWE-agent、1.x 與 2.x 不一定可比) · 查證日期:
- SWE-bench 官方文件:總覽(給定程式庫與 issue,模型要產生解決問題的修補檔;Docker 評測環境) · 查證日期:
- SWE-bench 官方文件:資料集指南(各子集的題數與用途說明) · 查證日期:
- SWE-bench 官方文件:評測指南(套用修補檔後跑專案自己的測試,測試通過才算解決) · 查證日期:
- SWE-bench 官方部落格:Detecting cheating in submissions(2025 年 11 月 19 日;逐字比對腳本、各榜命中率約 2% 到 7%、超過 20% 要求說明) · 查證日期:
- SWE-bench 官方投稿說明頁(投稿走官方實驗倉庫,需附預測檔、執行紀錄與推理軌跡) · 查證日期:
- Google DeepMind:Gemini 3.1 Pro Model Evaluation(2026 年 2 月;pass@1、單次嘗試定義、小題庫取多次平均、SWE-bench Verified 平均 10 次、非 Gemini 數字取自各家自報) · 查證日期:
- Anthropic:Introducing Claude Opus 5(2026 年 7 月 24 日;圖表註腳寫明內部執行、使用的外框與後端、每題取 5 次平均) · 查證日期:
- Hugging Face 官方文件:Evaluation Results(模型庫評測結果檔、已驗證與社群提供的標記、爭議時作者可關閉;標示為進行中的功能) · 查證日期:
- Hugging Face 官方文件:Open LLM Leaderboard About(GPQA 與 MMLU-Pro 的官方定義、六個題庫與可自行重跑的指令) · 查證日期: