生活分享

OpenAI 的開放權重模型 gpt-oss:怎麼跑、和 ChatGPT 差在哪

gpt-oss 有 120b 與 20b 兩個版本,授權 Apache 2.0,官方寫 120b 要單張 80GB GPU、20b 要 16GB 記憶體,上下文視窗 128k。這篇照 OpenAI 公告、Hugging Face 模型卡與 Ollama 文件,整理版本與規格、能在哪些軟體跑、推理力道與 harmony 怎麼設定,以及和 ChatGPT 的差別與授權允許的事。

更新日期: 閱讀時間約 7 分鐘

插圖:一個裝著模型權重的方塊,箭頭指向右邊一台螢幕,表示權重下載到自己的機器上執行。
圖片:Mokaair (© Mokaair)

gpt-oss 是 OpenAI 開放下載的開放權重模型,分成 gpt-oss-120b 與 gpt-oss-20b 兩個版本,授權 Apache 2.0,可以裝在自己的電腦或伺服器上跑;OpenAI 說明中心寫得很直接,它不透過 OpenAI API 提供,也不會出現在 ChatGPT 裡。

這篇照 OpenAI 公告與開放模型頁、Hugging Face 的模型卡與授權檔、GitHub 專案說明與 Ollama 文件,整理版本與規格、能在哪些軟體跑、官方寫的硬體需求與推理力道設定,以及和 ChatGPT 差在哪。

gpt-oss 是什麼:OpenAI 開放下載的是權重

OpenAI 在公告裡寫明,gpt-oss 是繼 GPT-2 之後自家第一批開放權重的語言模型(Whisper 與 CLIP 這類模型更早就開放過)。兩個版本都是混合專家架構,每個 token 只啟用一部分,所以總參數量大、實際算的參數量小很多。

  • gpt-oss-120b:117B 總參數,每個 token 活躍 5.1B,36 層,128 個專家、每個 token 取 4 個。
  • gpt-oss-20b:21B 總參數,每個 token 活躍 3.6B,24 層,32 個專家、每個 token 取 4 個。
  • 兩個版本都原生支援到 128k 的上下文視窗。
  • 訓練資料以英文純文字為主,說明中心把它們列為純文字(text-only)推理模型。
  • 授權 Apache 2.0,模型庫另附一份 USAGE_POLICY 檔。

Hugging Face 的 openai 組織頁顯示,這兩個版本都在 2025 年 8 月 4 日上架;同一個組織在 2025 年 9 月 18 日另外上架了 gpt-oss-safeguard-120b 與 gpt-oss-safeguard-20b,授權一樣是 Apache 2.0。說明中心把 safeguard 標為研究預覽,它從 gpt-oss 而來、架構沒改,用途是照你寫的安全政策分類內容;一般聊天與代理(Agent)建議還是用原本的 gpt-oss。

能在哪裡跑:官方點名的執行環境

權重放在 Hugging Face 上,模型卡同時給了 Transformers、vLLM、Ollama 與 LM Studio 幾種執行方式;GitHub 專案另有 PyTorch、Triton 與 Apple Metal 參考實作,官方註明那是教學用途,不預期拿去正式環境跑。想先在自己的電腦試,模型卡直接給 Ollama 指令。

用 Ollama 下載並執行 gpt-oss(官方模型卡的指令) · bash
ollama pull gpt-oss:20b
ollama run gpt-oss:20b

ollama pull gpt-oss:120b
ollama run gpt-oss:120b

用 LM Studio 的話,模型卡給的是 lms 指令,抓回本機後再從圖形介面開對話。

用 LM Studio 的指令列下載 gpt-oss-20b · bash
lms get openai/gpt-oss-20b

不想自己準備硬體,OpenAI 公告列出上線前就合作的部署平台:Azure、Hugging Face、vLLM、Ollama、llama.cpp、LM Studio、AWS、Fireworks、Together 、Baseten、Databricks、Vercel、Cloudflare 與 OpenRouter,硬體端點名 NVIDIA、AMD、Cerebras 與 Groq。公告也寫到微軟用 ONNX Runtime 把 gpt-oss-20b 帶上 Windows。名單以外的供應商以官網目前頁面為準。

硬體需求:官方只寫了兩個數字

公告與模型卡對硬體只給兩句話:gpt-oss-120b 能在單張 80GB 的 GPU 上跑,官方舉例 NVIDIA H100 或 AMD MI300X;gpt-oss-20b 在 16GB 記憶體裡就能執行。靠的是 MXFP4 量化,混合專家的權重在後訓練階段就量化成每個參數 4.25 bits,而這部分佔總參數量九成以上。

OpenAI 的 Cookbook 在 Ollama 那篇說得再具體些:gpt-oss-20b 最好有 16GB 以上的顯示記憶體或統一記憶體,gpt-oss-120b 最好有 60GB 以上。Ollama 模型庫頁顯示 gpt-oss:20b 下載大小 14GB、gpt-oss:120b 是 65GB,上下文視窗都標 128K。更細的機型對照以官網為準。

推理力道與 harmony:跑起來之後的兩個設定

gpt-oss 是推理模型,官方給了三段推理力道:low、medium、high,在系統訊息裡用一句話切換,公告說這是延遲與表現之間的取捨。官方對話模板顯示,沒指定時預設是 medium。

在系統訊息裡設定推理力道(官方模型卡的寫法) · text
Reasoning: high

在 Ollama 上設定方式不同:文件寫 gpt-oss 要在 think 欄位放 low、medium 或 high,傳 true 或 false 會被忽略,而且思考軌跡沒辦法完全關掉。

在 Ollama 的本機 API 指定推理力道 · bash
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [{"role": "user", "content": "Hello!"}],
  "think": "high",
  "stream": false
}'

另一件事是 harmony 回應格式:官方說兩個模型都用 harmony 訓練,不照這個格式用就不會正常運作;它把回應拆成 analysis、commentary、final 三個頻道,只有 final 是給使用者看的。官方文件也寫明,透過 Ollama 這類推論方案使用時格式由工具處理。

和 ChatGPT 差在哪:只看官方文件寫出來的

最關鍵的一條寫在說明中心的常見問題:這些模型不在 OpenAI API 上提供,也不會出現在 ChatGPT 裡。你在 ChatGPT 用到的搜尋、記憶、圖片、語音是那個產品的功能,不是模型檔案帶著的;下載回來的是一個純文字的推理模型。

  • 不在 ChatGPT、也不在 OpenAI API:說明中心直接寫「No」,API 計價與速率限制不適用。
  • 純文字:官方把 gpt-oss 列為 text-only 的推理模型,支援哪些功能看執行環境文件。
  • 知識截止在 2024 年 6 月:官方對話模板把 Knowledge cutoff 寫成 2024-06,模型自己不會上網查。
  • 想要多模態、內建工具與平台整合,公告直接建議改用 API 平台上的模型。
  • 支援是自助的:說明中心寫 OpenAI 不為自架或第三方託管的部署提供除錯協助。
  • 資料留在你這邊:除非你主動分享或用託管夥伴,OpenAI 不會收到或處理你送給模型的資料。
  • 費用自己算:權重免費,運算、儲存與第三方託管的費用由你負擔。
三欄對照圖,左到右是 ChatGPT、OpenAI API 平台與開放權重 gpt-oss,各自列出取得方式、功能與誰負責機器。
由左往右看:前兩條路的模型與機器都由 OpenAI 代管,第三條把權重交到你手上,規格與費用也一起換手。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

三欄對照。左欄 ChatGPT:網頁與 App 登入就用,搜尋、記憶、圖片、語音由產品提供,模型與機器由 OpenAI 代管,裡面沒有 gpt-oss。中欄 OpenAI API 平台:開發者用程式呼叫,有多模態與內建工具,依用量計費,模型與機器一樣由 OpenAI 代管,也沒有 gpt-oss。右欄開放權重 gpt-oss:gpt-oss-120b 與 gpt-oss-20b 兩個版本,授權 Apache 2.0、權重免費下載,上下文視窗 128K,120b 要單張 80GB GPU、20b 要 16GB 記憶體,在自己的機器上執行,純文字,不在 ChatGPT 與 API 裡。下方一行結論:前兩條路的模型與機器由 OpenAI 代管,你付訂閱費或用量費;第三條把權重交到你手上,可以商用與微調,機器與費用也歸你。

授權允許什麼:Apache 2.0 加一份很短的使用政策

模型庫裡的 LICENSE 檔就是標準的 Apache License 2.0:可以商用、可以修改、可以再散布,條文裡沒有月活躍使用者上限或營收門檻,也沒有 copyleft 的傳染性要求。旁邊另附一份 USAGE_POLICY,全文只有兩句,大意是希望工具被安全、負責任而且民主地使用,並且你同意遵守所有適用法律。

微調也允許:說明中心寫你可以用開源工具與自己的機器微調,但 OpenAI 的 API 不提供這兩個模型的微調服務。官方也公布了自己測的成績,開放模型頁列出 gpt-oss-120b 的 MMLU 是 90.0、gpt-oss-20b 是 85.3,旁邊對照 o3 與 o4-mini。這些是官方自報的數字。

四個版本的規格、授權與執行方式,查證於 2026 年 9 月;數字引自 OpenAI 公告、Hugging Face 模型卡與 OpenAI 說明中心。
版本參數與官方寫的需求授權怎麼跑
gpt-oss-120b117B 總參數、活躍 5.1B;單張 80GB GPUApache 2.0 加使用政策Ollama、vLLM、Transformers
gpt-oss-20b21B 總參數、活躍 3.6B;16GB 記憶體Apache 2.0 加使用政策Ollama、LM Studio
gpt-oss-safeguard-120b117B 總參數、約 5.1B 活躍;單張 80GB GPUApache 2.0與 gpt-oss 同一套模板
gpt-oss-safeguard-20b21B 總參數、約 3.6B 活躍;16GB 顯示記憶體Apache 2.0同上,用於政策分類

同樣能下載的模型,各家授權差很多,選之前先把授權原文和硬體需求放在一起看。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享