生活分享
在自己電腦跑 DeepSeek:Ollama 蒸餾版教學
Ollama 官網目前列出 deepseek-r1 的 1.5b、7b、8b、14b、32b、70b 與 671b 七個標籤,下載大小從 1.1GB 到 404GB。這篇用官方文件帶你在 Windows 或 Mac 裝好 Ollama、拉一個蒸餾版開始對話,再接一次本機 11434 埠的 API 呼叫,並說清楚蒸餾與量化是什麼、蒸餾版和網頁版完整模型差在哪、MIT 授權實際允許什麼。
更新日期: 閱讀時間約 6 分鐘

在 Ollama 上下載得到的 DeepSeek,不是網頁版背後那個 671B 參數的完整模型,而是官方另外釋出的六個蒸餾版本:最小的 1.5B 下載只有 1.1GB,一般筆電就跑得動,品質則明顯低一階。這篇照 Ollama 與 DeepSeek 的官方文件,把這條路走完一次。
你會做到四件事:裝好 Ollama、用一行指令拉下 deepseek-r1 的某個標籤、在終端機裡對話並用 /bye 離開、再從 curl 或 Python 呼叫本機的 11434 埠。中間會解釋決定檔案大小的兩個名詞,以及本機執行在隱私上換到什麼、付出什麼。
DeepSeek 是什麼:免費、開源與資料流向,用之前先知道的事DeepSeek 是什麼:免費、開源與資料流向,用之前先知道的事DeepSeek 是杭州一家公司的對話助理與開源模型:網頁版與 App 免費,V4.1-Flash 的權重以 MIT 授權開放,但隱私政策寫明資料在中華人民共和國收集、處理與儲存並可用於訓練,行政院也在 2025 年 2 月 3 日要求公務機關全面禁用。這篇依官網、Hugging Face、行政院與數位發展部的公告,講清楚它是什麼、免費能做什麼、資料去哪裡、誰不能用、內容審查是什麼現象,並用決策樹與表格比較官方 App、第三方雲端託管、自己電腦跑開源版三種途徑的資料流向與費用。閱讀全文
蒸餾版是什麼:官方釋出的六個小模型
DeepSeek 的 GitHub 說明與 Hugging Face 模型卡寫的是同一件事:除了 671B 參數的 DeepSeek-R1 之外,官方另外用 R1 產生的推理資料,對 Qwen2.5 與 Llama3 系列的開源模型做微調微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文,開源了 1.5B、7B、8B、14B、32B、70B 六個蒸餾版本,用的是 80 萬筆以 R1 整理出來的樣本。
蒸餾就是讓小模型學大模型的輸出:大模型當老師寫出解題過程,小模型照這批資料訓練。官方說大模型的推理模式可以蒸餾進小模型,比讓小模型自己摸索更好。所以你下載的不是「縮小版的 R1」,而是一個被 R1 教過的 Qwen 或 Llama。
知識蒸餾(Knowledge Distillation):讓學生模型學教師知識蒸餾(Knowledge Distillation):讓學生模型學教師知識蒸餾以教師模型的輸出或中間表示訓練學生模型,常用來降低部署成本或移轉特定能力。本文用文件分類說明硬標籤、軟目標與生成示範的差別,解釋教師的錯誤如何被傳遞,以及學生不一定能複製全部能力。讀完能分清蒸餾、一般微調和量化,並知道怎樣用獨立測試、任務範圍與實際硬體驗證蒸餾是否值得。閱讀全文
品質差距官方自己有列。以 AIME 2024 數學測驗的 pass@1 來看,完整的 DeepSeek-R1 是 79.8,32B 蒸餾版 72.6,7B 蒸餾版 55.5,1.5B 蒸餾版 28.9。方向很清楚:檔案小一個數量級,能力就退一階。
小型語言模型(Small Language Model)是什麼小型語言模型(Small Language Model)是什麼小型語言模型以相對較小的模型規模提供語言能力,常用於資源有限或任務範圍明確的環境,但沒有一致的參數分界。本文以離線整理個人維修筆記為例,說明小模型、量化、裝置端部署與任務調適的關係,解釋為何小不等於弱、離線也不自動等於完整隱私保障。讀完能從任務品質、記憶體、速度和資料流評估需求,而不是只看模型大小。閱讀全文
裝 Ollama:三個系統的官方指令與需求
Ollama 的 README 對三個系統各給一行指令:macOS 與 Linux 把官方安裝腳本交給 shell 執行,Windows 在 PowerShell 裡執行官方的 install.ps1;不想跑腳本的人,官網下載頁也提供 Ollama.dmg 與 OllamaSetup.exe。
curl -fsSL https://ollama.com/install.sh | shirm https://ollama.com/install.ps1 | iex- macOS:14 Sonoma 或更新版本;Apple M 系列可用 CPU 與 GPU,Intel 機器只有 CPU。
- Windows:文件寫 10 22H2 或更新版本(Home 或 Pro),下載頁寫的是 Windows 10 或更新版本。
- 顯示卡:NVIDIA 要 compute capability 5.0 以上與 550 以上驅動;AMD 走 ROCm v7 或 Vulkan;Apple 走 Metal。
- 硬碟:Windows 文件寫安裝本身至少 4GB,模型另外算,官方形容是「幾十到幾百 GB」。
- 模型預設存在使用者目錄的 .ollama/models,可用 OLLAMA_MODELS 環境變數改到別的磁碟。
三個指令:拉模型、對話、離開
裝好以後終端機就有 ollama 指令(Windows 用 cmd 或 PowerShell 都可以)。下載模型用 ollama pull,開始對話用 ollama run,離開輸入 /bye,這三個都在官方的 CLI 參考與快速入門頁裡。
ollama pull deepseek-r1:8b
ollama run deepseek-r1:8b要注意預設標籤指到哪裡。官網標籤頁顯示 deepseek-r1:latest 與 deepseek-r1:8b 是同一個檔案(同一組 ID、同樣 5.2GB),內容是 DeepSeek-R1-0528-Qwen3-8B。直接打 ollama run deepseek-r1 拉到的就是這個 8B 版本,不是 671B 那一個。
/bye # 離開對話
ollama ps # 看載入的模型跑在 GPU 還是 CPU
ollama ls # 列出已下載的模型
ollama rm deepseek-r1:8b # 刪掉不用的模型,把硬碟空間拿回來閱讀完整文字說明
上排四個步驟:裝 Ollama(macOS 14 以上、Windows 10 22H2 以上)、選一個標籤(例如 deepseek-r1:8b,下載 5.2GB)、用 ollama pull 拉下模型、用 ollama run 開始對話並以 /bye 離開。中間一排列出六個標籤的下載大小:1.5b 是 1.1GB、7b 是 4.7GB、8b 是 5.2GB、32b 是 20GB、70b 是 43GB、671b 是 404GB 的完整版。下排左邊是本機 API,位址在 localhost 的 11434 埠,curl 或 Python 都可以呼叫;右邊是用 ollama ps 檢查模型跑在哪裡,100% GPU 代表整個模型進了顯示記憶體,100% CPU 代表全靠系統記憶體。最底下提醒公務機關全面禁用,包含地端下載。
硬體怎麼對應大小:量化、記憶體與上下文視窗
同一個 7B 蒸餾版,官網上其實有三個檔案:q4_K_M 是 4.7GB、q8_0 是 8.1GB、fp16 是 15GB。差別在量化——參數改用較少位元存放,檔案小、吃的記憶體少,代價是精度。短標籤預設指向 q4_K_M,所以 deepseek-r1:7b 拿到的是 4.7GB 的四位元版本。
量化(Quantization):用較少位元執行模型的取捨量化(Quantization):用較少位元執行模型的取捨模型量化用較低精度表示權重或其他數值,目的是減少記憶體與運算負擔,同時盡量保留任務品質。本文用本機文件分類示範載入、校準與比較流程,區分訓練後量化、量化感知訓練、LoRA 和蒸餾,也解釋為什麼檔案變小不保證回答更快。讀完能核對硬體支援、記憶體組成及實際錯誤,避免只靠位元數挑模型。閱讀全文
官方沒有給「幾 B 要幾 GB 記憶體」的對照表,所以這裡不編一個,建議記憶體以官網為準。能引用的有兩條:下載大小就是記憶體需求的下限;Ollama 依顯示記憶體決定預設上下文視窗,不到 24 GiB 給 4K、24 到 48 GiB 給 32K、48 GiB 以上給 256K。
跑不跑得動,用 ollama ps 看 PROCESSOR 那一欄最準:100% GPU 是整個模型進了顯示記憶體,100% CPU 是全靠系統記憶體,出現 48%/52% CPU/GPU 就是被拆成兩邊、速度會掉。官方建議盡量別落到 CPU。
| 標籤 | 參數與基底模型 | 下載大小/上下文 | 指令 |
|---|---|---|---|
| 1.5b | 1.5B,Qwen2.5-Math | 1.1GB/128K | ollama run deepseek-r1:1.5b |
| 7b | 7B,Qwen2.5-Math | 4.7GB/128K | ollama run deepseek-r1:7b |
| 8b | 8B,Qwen3(等於 latest) | 5.2GB/128K | ollama run deepseek-r1:8b |
| 14b | 14B,Qwen2.5 | 9.0GB/128K | ollama run deepseek-r1:14b |
| 32b | 32B,Qwen2.5 | 20GB/128K | ollama run deepseek-r1:32b |
| 70b | 70B,Llama-3.3-Instruct | 43GB/128K | ollama run deepseek-r1:70b |
| 671b | 671B 完整版,非蒸餾 | 404GB/160K | ollama run deepseek-r1:671b |
模型參數(Model Parameters)是什麼模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文
接一個本機的 API 呼叫
Ollama 裝好就會在本機開一個 REST API,預設綁在 127.0.0.1 的 11434 埠,官方文件寫的基底網址是 localhost:11434 底下的 /api。模型頁的範例可以整段複製,把模型名稱換成你的標籤。
curl http://localhost:11434/api/chat -d '{
"model": "deepseek-r1",
"messages": [{"role": "user", "content": "Hello!"}],
"stream": false
}'Python 也有官方套件,先安裝再幾行就能對話:
from ollama import chat
response = chat(
model='deepseek-r1',
messages=[{'role': 'user', 'content': 'Hello!'}],
)
print(response.message.content)這個端點預設只在自己的電腦上聽。官方文件說要讓區網其他裝置連得到得改 OLLAMA_HOST——沒有需要就不要改,那等於把一個不用密碼的模型端點開給整個網路。
隱私換到什麼、付出什麼、授權能做什麼
Ollama 的常見問答對「會不會把提示詞送回 ollama.com」寫得很直接:本機執行時他們看不到你的提示詞與資料。這就是本機跑最大的好處——貼進去的合約、客戶名單不會離開這台電腦,也不套用 DeepSeek 網頁版的資料政策。
DeepSeek 資料去哪裡:隱私、審查與台灣使用者的取捨DeepSeek 資料去哪裡:隱私、審查與台灣使用者的取捨DeepSeek 的隱私政策寫明個人資料在中華人民共和國境內蒐集、處理與儲存,輸入與輸出可能用於模型訓練,退出的開關英文版叫 Improve the model for everyone;服務條款則寫明有權以技術手段審查使用行為、建立風險過濾機制。台灣這邊,數位發展部與資通安全署的公告禁的是公務機關,未限制一般民間使用。這篇只引官方文件與政府公告原文,整理資料流向、你按得到的四個動作,以及三種用法的風險差別。閱讀全文
有一個例外要認出來:ollama.com 也上架雲端模型,標籤結尾是 :cloud,例如官網標示 304B 參數、1M 上下文視窗、按 token 計價的 deepseek-v4-flash:cloud。這種是送到 Ollama 雲端跑、要先登入,官方說提示詞與回應會被處理但不儲存、不記錄、不拿去訓練。要整個關掉可以設定 OLLAMA_NO_CLOUD 環境變數。
代價有三個,兩個官方文件寫得出來:硬碟(1.1GB 到 404GB,加上安裝本身的 4GB),以及模型放不進顯示記憶體時會落到 CPU、速度變慢。第三個是耗電與發熱,官方沒給數字,以實際使用為準。本機模型也不會自己上網查資料——Ollama 的網路搜尋是另一個雲端 API,要免費帳號與金鑰。
DeepSeek 對話與深度思考:哪些題目該開推理模式DeepSeek 對話與深度思考:哪些題目該開推理模式DeepSeek 網頁版與 App 的操作篇:一般對話與「深度思考」差在哪、哪些題目值得多等那段推理、聯網搜尋與檔案上傳官方寫了什麼限制、官網現在列的模型版本與 1M 上下文視窗,以及 API 的最小呼叫範例與峰谷、快取命中的計價方式。數字全部在 2026 年 9 月 14 日查自官網。閱讀全文
授權方面,模型卡與 Ollama 的說明頁一致:權重採 MIT 授權,DeepSeek-R1 系列支援商業使用,也允許修改與衍生作品,包含拿輸出去蒸餾別的模型。但基底模型的授權要一起看——Qwen 系列蒸餾版來自 Qwen-2.5 的 Apache 2.0;Llama 蒸餾版分別適用 llama3.1 與 llama3.3 授權。
開放權重(Open Weights):能下載模型,還要確認什麼開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文
中國系 AI 模型比較:DeepSeek、Qwen、Kimi、豆包、MiniMax中國系 AI 模型比較:DeepSeek、Qwen、Kimi、豆包、MiniMax中國 AI 模型怎麼比?把 DeepSeek、阿里 Qwen、月之暗面 Kimi、字節跳動豆包與 MiniMax 放進同一套欄位:旗艦模型、開放權重與授權、上下文視窗、API 每百萬 token 價格、台灣區 App Store 查詢結果,以及隱私政策寫的資料存放地與訓練用途。數字全部在 2026 年 9 月 14 日查自官網,只比官方頁寫的內容,不排名也不引跑分。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Ollama GitHub README(三個系統的安裝指令、REST API 與 Python 範例) · 查證日期:
- Ollama 官網下載頁(macOS 14 Sonoma 或更新版本、Windows 10 或更新版本) · 查證日期:
- Ollama 說明文件:macOS(系統需求與模型存放位置) · 查證日期:
- Ollama 說明文件:Windows(Windows 10 22H2、安裝空間 4GB、模型幾十到幾百 GB) · 查證日期:
- Ollama 說明文件:硬體支援(NVIDIA compute capability 與驅動版本、AMD ROCm 與 Vulkan、Apple Metal) · 查證日期:
- Ollama 說明文件:快速入門(ollama run 與 /bye) · 查證日期:
- Ollama 說明文件:CLI 參考(pull、run、ps、ls、rm 等指令) · 查證日期:
- Ollama 說明文件:上下文長度(依顯示記憶體決定的 4K/32K/256K 預設值) · 查證日期:
- Ollama 說明文件:常見問答(不會看到本機提示詞、關閉雲端功能、模型存放位置、ollama ps 的 PROCESSOR 欄) · 查證日期:
- Ollama 說明文件:API 介紹(本機基底網址 localhost:11434) · 查證日期:
- Ollama 說明文件:雲端模型(需登入帳號、自動轉到 Ollama 雲端執行) · 查證日期:
- Ollama 說明文件:網路搜尋(需免費帳號與 API 金鑰的雲端 API) · 查證日期:
- Ollama 模型庫:deepseek-r1(各標籤、下載大小、上下文視窗與授權說明) · 查證日期:
- Ollama 模型庫:deepseek-r1 標籤頁(q4_K_M、q8_0、fp16 三種量化的檔案大小) · 查證日期:
- Ollama 模型庫:deepseek-v4-flash(標示 cloud、304B 參數、1M 上下文與計價) · 查證日期:
- GitHub deepseek-ai/DeepSeek-R1 說明(六個蒸餾版、基底模型、AIME 2024 評測與授權) · 查證日期:
- Hugging Face:deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 模型卡(MIT 授權與基底模型授權) · 查證日期:
- Hugging Face:deepseek-ai/DeepSeek-R1-0528-Qwen3-8B 模型卡(8B 蒸餾版的來源與授權) · 查證日期:
- DeepSeek 官網(深度思考與智能搜索兩個網頁版功能名稱、營運公司) · 查證日期:
- 數位發展部資通安全署新聞稿:公務機關全面禁用 DeepSeek AI 服務,未限制一般民間使用 · 查證日期: