生活分享

本機跑 Qwen:中文表現與設定

Qwen 開放權重版本可以用 Ollama 或 LM Studio 下載到自己的電腦跑。這篇用 2026 年 9 月 14 日查證的 Ollama 模型庫、Hugging Face 模型卡與官方文件(Ollama 標籤頁的檔案大小 10 月 5 日重新查證),說清楚當代有哪些標籤與檔案大小、拉取與執行的指令、thinking 模式怎麼開關、繁體中文要怎麼用系統提示詞固定下來、上下文視窗預設多少要調,以及哪些版本是 Apache 2.0、哪一個用自訂授權。

更新日期: 閱讀時間約 9 分鐘

插圖:一台電腦連著一排大小不同的模型方塊,右邊是一個標示繁體中文的對話框
圖片:Mokaair (© Mokaair)

Qwen(通義千問)大部分版本的權重是公開下載的,所以它不只是一個網頁服務:把檔案抓回來,用 Ollama 或 LM Studio 就能在自己的電腦上跑,對話不會送到別人的伺服器。但有一件事要先講清楚,官方模型卡沒有任何一句保證輸出會是繁體中文,台灣用語得靠你在裡自己指定。

這篇是實作篇:當天官方模型庫有哪些標籤與檔案大小、拉取與執行要打什麼指令、thinking 模式怎麼開關、繁體中文怎麼固定下來、上下文視窗預設多少要怎麼調、哪些版本可以商用。指令照官方文件原文抄,數字取自 2026 年 9 月 14 日的官方頁面,只有 Ollama 標籤頁的檔案大小是 2026 年 10 月 5 日重新查證的;本文沒有實機測試,圖形介面的步驟以官網當天版本為準。

先查當天的標籤,別照舊文章打指令

Qwen 的版本號換得很快,一年前的教學裡那些指令現在多半指到舊模型。查證當天在 Ollama 模型庫搜尋 qwen,屬於當代的四個檔案庫是 qwen3.5、qwen3.6、qwen3.8 與 qwen3.8-flash-next;舊的 qwen3 與 qwen2.5 還在,但頁面顯示的更新時間分別是十一個月前與一年前。四個裡面尺寸最齊全的是 qwen3.5,家用電腦通常從這一排挑。

  • qwen3.5:0.8b 是 1.2 到 1.3GB、2b 是 2.7 到 3.1GB、4b 是 3.3 到 4.0GB、9b 是 6.6 到 7.6GB、27b 是 17 到 20GB、35b 是 22GB、122b 是 81GB,每個標籤都標 256K 上下文視窗、可輸入文字與圖片;qwen3.5:latest 指向 9b。
  • qwen3.6:27b 是 18 到 19GB、35b 是 23 到 24GB,latest 指向 35b,另外有 27b 與 35b 的 coding 標籤。
  • qwen3.8:只有 27b 一個尺寸、18GB,latest 就是它,庫頁標了 vision、tools、thinking 三種能力。
  • qwen3.8-flash-next:只有 125b-a6b,q4_K_M 是 120GB、q8_0 是 189GB,庫頁寫它是 Qwen4 架構的實驗性預覽。
  • 標籤名稱帶 cloud 的跑在 Ollama 的雲端,不是你的電腦,別誤以為選了就是離線可用。

標籤頁把大小寫成一段範圍,是因為那個標籤分成 mlx 與 llamacpp 兩個版本,範圍兩端就是兩者各自的大小,例如 qwen3.5:9b 的 mlx 版 7.6GB、llamacpp 版 6.6GB。Ollama 0.40.0 預覽版的發行說明寫,在 Apple Silicon 的 Mac 上,MLX 支援的模型架構會自動改用 MLX 執行,qwen3.5、qwen3.6 與 qwen3.8 都在其列,所以同一個標籤在 Mac 和其他電腦上下載的大小可能不同。檔案大小是要下載的量,也是記憶體的下限;但官方沒有給「幾 GB 記憶體配哪個模型」的對照表,跑不跑得動要自己算,以官網為準。標籤尾巴的 q4_K_M、q8_0 是量化格式,同一個模型換一種量化,檔案大小差好幾倍。

拉取與執行:兩個指令就開始對話

Ollama 裝好之後,下載與執行是兩個指令,官方 CLI 文件寫得很短:先用 pull 把檔案抓下來,再用 run 開對話,離開打 /bye。

下載、執行與確認模型載在哪裡(照 Ollama CLI 文件) · bash
# 下載模型
ollama pull qwen3.5:9b

# 開始對話,離開時輸入 /bye
ollama run qwen3.5:9b

# 看模型目前載到哪裡
ollama ps

ollama ps 要看一眼。官方常見問題寫,PROCESSOR 欄位顯示 100% GPU 表示整個模型載進顯示記憶體,100% CPU 表示全部在系統記憶體,48%/52% CPU/GPU 這種寫法表示兩邊各放一部分。回答慢到不能用,多半就是掉到 CPU 了。

不想打指令就用 LM Studio。官方模型目錄當天列得到 Qwen3.8(27B)、Qwen3.6 與 Qwen3.5(2B、4B、9B、27B、35B),在 Discover 分頁搜尋名稱就能下載。載入設定(GPU 卸載、上下文大小、Flash Attention)在 My Models 分頁按齒輪圖示改,官方文件說改完會變成這個模型的預設值,之後從任何地方載入都套用。

thinking 模式怎麼開、怎麼關

Qwen 這幾代預設會先思考再回答。Ollama 文件寫得明白:對支援的模型,thinking 在 CLI 與 API 都預設開啟,思考過程放在 thinking 欄位、最後答案放在 content 欄位。要開、要關、要藏起來,指令都在文件裡。

在 Ollama 切換 thinking(照 docs.ollama.com 的 thinking 頁) · bash
# 這一次要思考
ollama run qwen3.5:9b --think "幫我比較兩種行程安排"

# 這一次不要思考
ollama run qwen3.5:9b --think=false "把這段話縮成一句"

# 照樣思考,但不要把思考過程印出來
ollama run qwen3.5:9b --hidethinking "9.9 和 9.11 哪個大"

# 在互動模式裡隨時切換
/set think
/set nothink

API 那邊是 think 欄位,接受 true 與 false,也接受 low、medium、high、max 幾個等級,max 表示最高的思考等級。模型卡自己用的是另一套名字:Qwen3.8-27B 的模型卡寫 thinking 預設開啟、可以逐次關掉,思考深度用 reasoning_effort 調,等級是 xhigh(預設)、medium、low,另外 preserve_thinking 預設開啟,會把歷史訊息裡的思考脈絡留下來。兩套名稱不同,用 Ollama 就照 Ollama 文件的欄位,用 vLLM、SGLang 這類服務框架才輪到模型卡的。

流程圖:選版本、拉取、設定繁體中文系統提示詞、開始對話四個步驟
從左到右看:先在 Ollama 標籤頁挑尺寸,拉取,用 Modelfile 把繁體中文規則寫死,最後才開始對話與調整思考、上下文。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

一張四步流程圖。第一步選版本:在 Ollama 標籤頁看檔案大小,qwen3.5:9b 是 6.6 到 7.6GB,每個標籤都標 256K 上下文。第二步拉取:ollama pull qwen3.5:9b、ollama run qwen3.5:9b,再用 ollama ps 確認模型載在 GPU 還是 CPU。第三步設定繁體中文:把台灣用語規則寫進 Modelfile 的 SYSTEM,再用 ollama create qwen-zhtw 建成自訂模型。第四步開始對話:用 --think=false 關掉思考,用 /set parameter num_ctx 64000 把上下文視窗開大。圖下方說明為什麼需要第三步:模型卡只寫支援 201 種語言與方言,沒有保證繁體輸出。最下方兩個提醒:授權方面 Qwen3.5、Qwen3.6 與 Qwen3.8-27B 標 Apache 2.0,Qwen3.8-Flash-Next 是 Qwen Community License 1.0;舊寫法方面,把 /nothink 打進提示詞沒有作用,要用 Ollama 的介面指令。

繁體中文輸出:用系統提示詞固定下來

先看模型卡怎麼寫語言支援。Qwen3.5 的模型卡列了「擴充到 201 種語言與方言」,同一張卡的表裡,中文評測 C-Eval 一欄 Qwen3.5-9B 是 88.2、Qwen3.5-4B 是 85.1。但整張卡沒有一句把繁體和簡體分開講,也沒有提到台灣用語;Qwen3.8-27B 的模型卡更直接沒有列語言數量。換句話說,繁體不是一個可以勾的選項,是你要在系統提示詞裡明確要求的事。

要求繁體中文台灣用語的系統提示詞範例 · text
你是一位以台灣繁體中文寫作的助理。

規則:
一、一律使用繁體中文,用台灣的詞彙:軟體、網路、資料、影片、品質、使用者。
二、不要輸出簡體字,也不要中英夾雜,除非是產品名稱或指令的原文。
三、專有名詞第一次出現時,中文後面用括號附上原文。
四、不確定的事情直接說不確定,不要編造來源或數字。

每次開新對話都貼一次很煩,Ollama 的做法是寫成 Modelfile。官方 Modelfile 文件裡,SYSTEM 指令設的就是系統訊息,PARAMETER 設取樣參數。下面這份把繁體規則和 Qwen3.5 模型卡建議的「非思考模式、一般任務」參數寫在一起,num_ctx 用的是 Ollama 文件建議的 64000。

Modelfile:把繁體中文規則與取樣參數寫死 · text
FROM qwen3.5:9b

SYSTEM """你是一位以台灣繁體中文寫作的助理。一律使用繁體中文與台灣詞彙,
不要輸出簡體字;專有名詞第一次出現時中文後面用括號附上原文。"""

PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER min_p 0
PARAMETER num_ctx 64000
建立自訂模型再執行(照 Modelfile 文件的步驟) · bash
ollama create qwen-zhtw -f ./Modelfile
ollama run qwen-zhtw

兩個細節值得記住。第一,模型卡在非思考模式一般任務建議的 presence_penalty 是 1.5,但 Ollama 的 Modelfile 參數表裡沒有這個參數,只有 repeat_penalty,硬寫進去不會生效。第二,同一張模型卡自己警告過:presence_penalty 調高雖然能減少沒完沒了的重複,卻可能造成語言混用——中英夾雜、繁簡混雜多半是從這裡來的。遇到混用先把懲罰值調回去,而不是一直往提示詞裡加字。

LM Studio 的對應做法叫 Presets。官方文件說 Presets 把系統提示詞和進階設定欄位打包成一個具名設定,可以在不同對話之間切換,檔案存在 macOS 與 Linux 的 ~/.lmstudio/config-presets、Windows 的 %USERPROFILE% 底下的 .lmstudio/config-presets。把上面那段繁體規則存成一個 Preset,之後開新對話選它就好。

上下文視窗:預設比你以為的小很多

模型卡的數字很漂亮:Qwen3.5-9B 與 Qwen3.8-27B 都寫原生 262,144 個 token,還可以再延伸,Qwen3.8-27B 寫可延伸到 1,000,000、Qwen3.5-9B 寫 1,010,000。Ollama 庫頁上的 qwen3.5、qwen3.6、qwen3.8 標籤則一律標 256K。

但那是模型的上限,不是你實際拿到的。Ollama 常見問題寫預設上下文視窗是 4096 個 token;另一頁文件說會依顯示記憶體自動給預設值:不到 24 GiB 給 4k、24 到 48 GiB 給 32k、48 GiB 以上給 256k,而且建議需要大量上下文的工作,像網路搜尋、代理(Agent)與程式工具,至少設到 64000 個 token。丟一份長文件進去卻覺得模型「忘記前面」,多半不是模型笨,是視窗只開了 4096。

把上下文視窗調大(照 Ollama 的常見問題與上下文長度文件) · bash
# 啟動服務時改掉預設值
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

# 或在 ollama run 的互動模式裡臨時改
/set parameter num_ctx 64000

官方文件同時提醒,上下文開得越大、要的記憶體越多,調完最好再用 ollama ps 看一次,確認模型沒有因為記憶體不夠被擠去 CPU。

授權:不是每個 Qwen 都是 Apache 2.0

Ollama 的標籤頁不寫授權,要回 Hugging Face 的模型卡看。查證當天用 Hugging Face 的模型 API 逐一核對 license 標籤:Qwen3.5 的 0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B,以及 Qwen3.6-27B、Qwen3.6-35B-A3B、Qwen3.8-27B,全部標 apache-2.0,商用沒有額外門檻。Qwen3.8-Flash-Next 不一樣,license 欄標 other、license_name 標 qwen-community-1.0。

那份 Qwen Community License 1.0 的原文有兩條額外條件。一是拿去做的商業產品或服務,如果每月活躍使用者超過 100,000,000 人、或每月營收超過 20,000,000 美元,就要把模型名稱明顯標在產品介面上。二是你或關係企業如果在做「模型即服務」或「 工作助理」生意,商業使用前要另外向 Qwen 取得授權;純內部使用、而且不把模型、輸出或底層模型能力提供給第三方,不受這一條限制。個人在自己電腦上跑不會碰到這兩條,但公司要上線前該讀原文。

檔案大小取自 Ollama 標籤頁,2026 年 10 月 5 日重新查證,寫成範圍的是 mlx 與 llamacpp 兩個版本的大小;授權取自 Hugging Face 模型卡,查證於 2026 年 9 月。檔案大小不等於執行時的記憶體需求。
Ollama 標籤檔案大小授權官方描述的定位
qwen3.5:4b3.3 到 4.0GBApache 2.0同代常用的小尺寸,文字加圖片輸入
qwen3.5:9b6.6 到 7.6GBApache 2.0qwen3.5:latest 指向這一個
qwen3.5:27b17 到 20GBApache 2.0同代中間尺寸
qwen3.5:35b22GBApache 2.0混合專家,模型卡名稱是 35B-A3B
qwen3.6:27b18 到 19GBApache 2.0官方主打代理程式設計與思考保留
qwen3.8:27b18GBApache 2.0當代最新,27B 密集視覺語言模型
qwen3.8-flash-next:125b-a6b-q4_K_M120GBQwen Community License 1.0Qwen4 架構的實驗性預覽

最後提醒一句:本機跑的開放權重版本和官方代管版本不是同一回事。Qwen3.8-27B 的模型卡自己就寫,之後會有代管版本,預設給更長的上下文與官方內建工具;別把網頁上看到的表現直接套到自己電腦上那一份。要比較家族成員或別家的中文模型,站上另有兩篇可以接著看。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享