生活分享
OpenAI 的開放權重模型 gpt-oss:怎麼跑、和 ChatGPT 差在哪
gpt-oss 有 120b 與 20b 兩個版本,授權 Apache 2.0,官方寫 120b 要單張 80GB GPU、20b 要 16GB 記憶體,上下文視窗 128k。這篇照 OpenAI 公告、Hugging Face 模型卡與 Ollama 文件,整理版本與規格、能在哪些軟體跑、推理力道與 harmony 怎麼設定,以及和 ChatGPT 的差別與授權允許的事。
更新日期: 閱讀時間約 7 分鐘

gpt-oss 是 OpenAI 開放下載的開放權重模型,分成 gpt-oss-120b 與 gpt-oss-20b 兩個版本,授權 Apache 2.0,可以裝在自己的電腦或伺服器上跑;OpenAI 說明中心寫得很直接,它不透過 OpenAI API 提供,也不會出現在 ChatGPT 裡。
這篇照 OpenAI 公告與開放模型頁、Hugging Face 的模型卡與授權檔、GitHub 專案說明與 Ollama 文件,整理版本與規格、能在哪些軟體跑、官方寫的硬體需求與推理力道設定,以及和 ChatGPT 差在哪。
gpt-oss 是什麼:OpenAI 開放下載的是權重
OpenAI 在公告裡寫明,gpt-oss 是繼 GPT-2 之後自家第一批開放權重的語言模型(Whisper 與 CLIP 這類模型更早就開放過)。兩個版本都是混合專家架構,每個 token 只啟用一部分參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文,所以總參數量大、實際算的參數量小很多。
- gpt-oss-120b:117B 總參數,每個 token 活躍 5.1B,36 層,128 個專家、每個 token 取 4 個。
- gpt-oss-20b:21B 總參數,每個 token 活躍 3.6B,24 層,32 個專家、每個 token 取 4 個。
- 兩個版本都原生支援到 128k 的上下文視窗。
- 訓練資料以英文純文字為主,說明中心把它們列為純文字(text-only)推理模型。
- 授權 Apache 2.0,模型庫另附一份 USAGE_POLICY 檔。
Hugging Face 的 openai 組織頁顯示,這兩個版本都在 2025 年 8 月 4 日上架;同一個組織在 2025 年 9 月 18 日另外上架了 gpt-oss-safeguard-120b 與 gpt-oss-safeguard-20b,授權一樣是 Apache 2.0。說明中心把 safeguard 標為研究預覽,它從 gpt-oss 微調微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文而來、架構沒改,用途是照你寫的安全政策分類內容;一般聊天與代理(Agent)建議還是用原本的 gpt-oss。
開放權重(Open Weights):能下載模型,還要確認什麼開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文
混合專家模型(Mixture of Experts)是什麼混合專家模型(Mixture of Experts)是什麼混合專家模型透過路由器,讓輸入在某些層只使用部分專家網路,以不同方式安排模型容量與運算。本文以檔案分類的小型路由示意,說明總參數、啟用參數、專家與路由的角色,解釋它為何不是多個聊天代理開會,也不能只用啟用參數推算記憶體或品質。讀完能更準確閱讀 MoE 模型規格,理解速度、部署、訓練穩定性與負載分配的取捨。閱讀全文
能在哪裡跑:官方點名的執行環境
權重放在 Hugging Face 上,模型卡同時給了 Transformers、vLLM、Ollama 與 LM Studio 幾種執行方式;GitHub 專案另有 PyTorch、Triton 與 Apple Metal 參考實作,官方註明那是教學用途,不預期拿去正式環境跑。想先在自己的電腦試,模型卡直接給 Ollama 指令。
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
ollama pull gpt-oss:120b
ollama run gpt-oss:120b用 LM Studio 的話,模型卡給的是 lms 指令,抓回本機後再從圖形介面開對話。
lms get openai/gpt-oss-20b不想自己準備硬體,OpenAI 公告列出上線前就合作的部署平台:Azure、Hugging Face、vLLM、Ollama、llama.cpp、LM Studio、AWS、Fireworks、Together AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文、Baseten、Databricks、Vercel、Cloudflare 與 OpenRouter,硬體端點名 NVIDIA、AMD、Cerebras 與 Groq。公告也寫到微軟用 ONNX Runtime 把 gpt-oss-20b 帶上 Windows。名單以外的供應商以官網目前頁面為準。
Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 是在自己電腦跑本機 AI 的入門工具,官網下載頁寫 macOS 要 14 Sonoma 或更新版本、Windows 要 10 或更新版本。這篇照官方文件走完安裝、第一次對話、看懂模型庫的標籤與大小、用 ollama ps 確認模型跑在顯示卡還是 CPU,再從 curl 與 Python 呼叫本機 11434 埠的 API,最後說清楚結尾帶 cloud 的標籤是雲端模型、怎麼關掉。閱讀全文
LM Studio 入門:圖形介面跑本機模型LM Studio 入門:圖形介面跑本機模型LM Studio 是一套桌面軟體,不用打指令就能在自己的電腦下載並執行開放權重模型。本文照官方文件整理系統需求、在 Discover 分頁搜尋與下載 GGUF 或 MLX 模型、對話時的上下文視窗與 GPU offload 設定、把本機伺服器開在埠 1234 的 OpenAI 相容端點,以及使用條款對個人與內部商業用途的說法。閱讀全文
硬體需求:官方只寫了兩個數字
公告與模型卡對硬體只給兩句話:gpt-oss-120b 能在單張 80GB 的 GPU 上跑,官方舉例 NVIDIA H100 或 AMD MI300X;gpt-oss-20b 在 16GB 記憶體裡就能執行。靠的是 MXFP4 量化,混合專家的權重在後訓練階段就量化成每個參數 4.25 bits,而這部分佔總參數量九成以上。
OpenAI 的 Cookbook 在 Ollama 那篇說得再具體些:gpt-oss-20b 最好有 16GB 以上的顯示記憶體或統一記憶體,gpt-oss-120b 最好有 60GB 以上。Ollama 模型庫頁顯示 gpt-oss:20b 下載大小 14GB、gpt-oss:120b 是 65GB,上下文視窗都標 128K。更細的機型對照以官網為準。
跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文
推理力道與 harmony:跑起來之後的兩個設定
gpt-oss 是推理模型,官方給了三段推理力道:low、medium、high,在系統訊息裡用一句話切換,公告說這是延遲與表現之間的取捨。官方對話模板顯示,沒指定時預設是 medium。
Reasoning: high在 Ollama 上設定方式不同:文件寫 gpt-oss 要在 think 欄位放 low、medium 或 high,傳 true 或 false 會被忽略,而且思考軌跡沒辦法完全關掉。
curl http://localhost:11434/api/chat -d '{
"model": "gpt-oss:20b",
"messages": [{"role": "user", "content": "Hello!"}],
"think": "high",
"stream": false
}'另一件事是 harmony 回應格式:官方說兩個模型都用 harmony 訓練,不照這個格式用就不會正常運作;它把回應拆成 analysis、commentary、final 三個頻道,只有 final 是給使用者看的。官方文件也寫明,透過 Ollama 這類推論方案使用時格式由工具處理。
推理模型(Reasoning Model):多想幾步能解決什麼推理模型(Reasoning Model):多想幾步能解決什麼推理模型通常經過針對多步問題的訓練或推論設計,能在回答前投入更多計算來拆解、檢查與修正。本文用活動排程示範條件推理,區分推理能力、搜尋、工具和思考摘要,也說明為什麼等待更久或寫得更長不保證正確。讀完能判斷任務缺的是證據還是推導,並用可驗證的限制清單評估結果,而不必依賴產品等級與價格比較。閱讀全文
和 ChatGPT 差在哪:只看官方文件寫出來的
最關鍵的一條寫在說明中心的常見問題:這些模型不在 OpenAI API 上提供,也不會出現在 ChatGPT 裡。你在 ChatGPT 用到的搜尋、記憶、圖片、語音是那個產品的功能,不是模型檔案帶著的;下載回來的是一個純文字的推理模型。
- 不在 ChatGPT、也不在 OpenAI API:說明中心直接寫「No」,API 計價與速率限制不適用。
- 純文字:官方把 gpt-oss 列為 text-only 的推理模型,支援哪些功能看執行環境文件。
- 知識截止在 2024 年 6 月:官方對話模板把 Knowledge cutoff 寫成 2024-06,模型自己不會上網查。
- 想要多模態、內建工具與平台整合,公告直接建議改用 API 平台上的模型。
- 支援是自助的:說明中心寫 OpenAI 不為自架或第三方託管的部署提供除錯協助。
- 資料留在你這邊:除非你主動分享或用託管夥伴,OpenAI 不會收到或處理你送給模型的資料。
- 費用自己算:權重免費,運算、儲存與第三方託管的費用由你負擔。
閱讀完整文字說明
三欄對照。左欄 ChatGPT:網頁與 App 登入就用,搜尋、記憶、圖片、語音由產品提供,模型與機器由 OpenAI 代管,裡面沒有 gpt-oss。中欄 OpenAI API 平台:開發者用程式呼叫,有多模態與內建工具,依用量計費,模型與機器一樣由 OpenAI 代管,也沒有 gpt-oss。右欄開放權重 gpt-oss:gpt-oss-120b 與 gpt-oss-20b 兩個版本,授權 Apache 2.0、權重免費下載,上下文視窗 128K,120b 要單張 80GB GPU、20b 要 16GB 記憶體,在自己的機器上執行,純文字,不在 ChatGPT 與 API 裡。下方一行結論:前兩條路的模型與機器由 OpenAI 代管,你付訂閱費或用量費;第三條把權重交到你手上,可以商用與微調,機器與費用也歸你。
ChatGPT 新手入門:註冊、免費與付費差別、第一個對話ChatGPT 新手入門:註冊、免費與付費差別、第一個對話第一次打開 ChatGPT 這個聊天 AI 該做什麼?這篇依 OpenAI 官網 2026 年 9 月說明,帶你用 Email 或 Google、Apple、Microsoft 帳號註冊,弄懂 13 歲門檻、免費版每天 3 個檔案的限制、入門方案 ChatGPT Go 的美國定價,認識新對話、模型、附件、語音與暫時對話,並示範一個台灣生活情境的提問與追問,附免費版與 Go 比較表和該關的隱私設定。閱讀全文
ChatGPT Plus、Pro 與其他方案差在哪:2026 年怎麼選ChatGPT Plus、Pro 與其他方案差在哪:2026 年怎麼選決定付費給 ChatGPT,但該付 Go、Plus 還是 Pro?這篇依 OpenAI help center 與官方定價頁 2026 年 9 月的說明,把 Free、Go、Plus、Pro 兩級、Business、Enterprise 與 Edu 的美元價、模型(GPT-5.6 Luna、Sol、GPT-6 Pro)、額度倍數與多出的功能整理成一張表,說明台灣刷卡、App 內購、5% 營業稅與電子發票、升降級與退款規則,並給五種使用者建議。結論:多數人選 Plus,Pro 留給每天撞額度或需要 GPT-6 Pro 的人。閱讀全文
授權允許什麼:Apache 2.0 加一份很短的使用政策
模型庫裡的 LICENSE 檔就是標準的 Apache License 2.0:可以商用、可以修改、可以再散布,條文裡沒有月活躍使用者上限或營收門檻,也沒有 copyleft 的傳染性要求。旁邊另附一份 USAGE_POLICY,全文只有兩句,大意是希望工具被安全、負責任而且民主地使用,並且你同意遵守所有適用法律。
微調也允許:說明中心寫你可以用開源工具與自己的機器微調,但 OpenAI 的 API 不提供這兩個模型的微調服務。官方也公布了自己測的成績,開放模型頁列出 gpt-oss-120b 的 MMLU 是 90.0、gpt-oss-20b 是 85.3,旁邊對照 o3 與 o4-mini。這些是官方自報的數字。
| 版本 | 參數與官方寫的需求 | 授權 | 怎麼跑 |
|---|---|---|---|
| gpt-oss-120b | 117B 總參數、活躍 5.1B;單張 80GB GPU | Apache 2.0 加使用政策 | Ollama、vLLM、Transformers |
| gpt-oss-20b | 21B 總參數、活躍 3.6B;16GB 記憶體 | Apache 2.0 加使用政策 | Ollama、LM Studio |
| gpt-oss-safeguard-120b | 117B 總參數、約 5.1B 活躍;單張 80GB GPU | Apache 2.0 | 與 gpt-oss 同一套模板 |
| gpt-oss-safeguard-20b | 21B 總參數、約 3.6B 活躍;16GB 顯示記憶體 | Apache 2.0 | 同上,用於政策分類 |
同樣能下載的模型,各家授權差很多,選之前先把授權原文和硬體需求放在一起看。
Llama 模型家族:授權與版本Llama 模型家族:授權與版本Meta 的 Llama 是可以下載權重、在自己電腦上執行的模型家族,授權卻不是 OSI 認可的開源。這篇照 2026 年 9 月 14 日的官方頁面整理:官網現在列出的版本與日期、各版本的參數與上下文視窗、Llama 4 社群授權的逐條要點(700 million 月活躍使用者門檻、Built with Llama 標示、命名規定與使用政策),從官網申請、Hugging Face 受管制倉庫到 Ollama 三條下載路線,以及 Llama 和 Meta 目前主力的 Muse 系列是什麼關係。閱讀全文
Gemma:Google 的開源模型怎麼用Gemma:Google 的開源模型怎麼用Gemma 是 Google DeepMind 釋出、權重可以下載回自己電腦跑的模型家族。這篇照 2026 年 9 月 14 日的官方頁面整理 Gemma 4 的五種尺寸與 128K/256K 上下文視窗、Gemma 3 與 3n 的規模,並說明授權為什麼要分版本看:Gemma 4 是 OSI 核可的 Apache 2.0,Gemma 3/3n 仍是 Gemma Terms of Use 加禁止用途政策,並附 Ollama 的拉取指令。閱讀全文
同一家為什麼有好幾個模型:旗艦、中階、輕量怎麼選同一家為什麼有好幾個模型:旗艦、中階、輕量怎麼選打開 ChatGPT、Claude、Gemini 的模型選單,同一家就有三四個名字,差別其實只有兩個軸:旗艦、中階、輕量三階對應能力、速度、價格的取捨,加上「要不要先想一下」的推理開關。這篇依三家官網在 2026 年 10 月 5 日的資料整理家族名單與每百萬 token 的 API 價格,說明免費版拿到哪一階,並用五種日常任務示範怎麼選:多數事情先用中階就夠。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- OpenAI 公告:Introducing gpt-oss(參數、層數、專家數、128k 上下文、三段推理力道、80GB 與 16GB、合作平台名單) · 查證日期:
- OpenAI 開放模型頁 Open models by OpenAI(gpt-oss 與 gpt-oss-safeguard 版本、Apache 2.0、官方自報的 MMLU 等評測表) · 查證日期:
- OpenAI 說明中心:OpenAI open-weight models (gpt-oss)(不在 API 與 ChatGPT、純文字、自助支援、資料處理、微調、費用) · 查證日期:
- Hugging Face 模型卡 openai/gpt-oss-120b(117B 與 5.1B、80GB GPU、MXFP4、推理力道、Ollama 與 LM Studio 指令) · 查證日期:
- Hugging Face 模型卡 openai/gpt-oss-20b(21B 與 3.6B、16GB 記憶體、harmony 格式) · 查證日期:
- Hugging Face 檔案 openai/gpt-oss-120b/LICENSE(Apache License 2.0 原文) · 查證日期:
- Hugging Face 檔案 openai/gpt-oss-120b/USAGE_POLICY(使用政策全文兩句) · 查證日期:
- Hugging Face 檔案 openai/gpt-oss-120b/chat_template.jinja(Knowledge cutoff 2024-06、預設 reasoning_effort 為 medium) · 查證日期:
- Hugging Face API:openai 組織的模型清單(gpt-oss 與 gpt-oss-safeguard 的建立日期與授權標籤) · 查證日期:
- Hugging Face 模型卡 openai/gpt-oss-safeguard-20b(從 gpt-oss 微調、21B 與 3.6B、16GB 顯示記憶體、Apache 2.0) · 查證日期:
- GitHub openai/gpt-oss README(參考實作用途、Ollama 與 LM Studio 指令、harmony 與工具說明) · 查證日期:
- Ollama 模型庫 gpt-oss 頁(14GB 與 65GB 下載大小、128K 上下文、cloud 標籤、MXFP4 每個參數 4.25 bits) · 查證日期:
- Ollama 說明文件:Thinking(gpt-oss 的 think 只接受 low、medium、high,思考軌跡不能完全關掉) · 查證日期:
- OpenAI Cookbook:How to run gpt-oss locally with Ollama(20b 建議 16GB 以上、120b 建議 60GB 以上) · 查證日期:
- OpenAI Cookbook:OpenAI harmony response format(不用 harmony 就不會正常運作、analysis 與 commentary 與 final 三個頻道、推論工具會代為處理) · 查證日期:
- OpenAI 模型卡頁 gpt-oss-120b & gpt-oss-20b Model Card(Apache 2.0 加 gpt-oss 使用政策、純文字、Responses API 相容) · 查證日期: