生活分享

在自己電腦跑 DeepSeek:Ollama 蒸餾版教學

Ollama 官網目前列出 deepseek-r1 的 1.5b、7b、8b、14b、32b、70b 與 671b 七個標籤,下載大小從 1.1GB 到 404GB。這篇用官方文件帶你在 Windows 或 Mac 裝好 Ollama、拉一個蒸餾版開始對話,再接一次本機 11434 埠的 API 呼叫,並說清楚蒸餾與量化是什麼、蒸餾版和網頁版完整模型差在哪、MIT 授權實際允許什麼。

更新日期: 閱讀時間約 6 分鐘

插圖:一台筆電裡有一個對話框與一個模型方塊,外圍一圈虛線把它和上方的雲朵隔開
圖片:Mokaair (© Mokaair)

在 Ollama 上下載得到的 DeepSeek,不是網頁版背後那個 671B 參數的完整模型,而是官方另外釋出的六個蒸餾版本:最小的 1.5B 下載只有 1.1GB,一般筆電就跑得動,品質則明顯低一階。這篇照 Ollama 與 DeepSeek 的官方文件,把這條路走完一次。

你會做到四件事:裝好 Ollama、用一行指令拉下 deepseek-r1 的某個標籤、在終端機裡對話並用 /bye 離開、再從 curl 或 Python 呼叫本機的 11434 埠。中間會解釋決定檔案大小的兩個名詞,以及本機執行在隱私上換到什麼、付出什麼。

蒸餾版是什麼:官方釋出的六個小模型

DeepSeek 的 GitHub 說明與 Hugging Face 模型卡寫的是同一件事:除了 671B 參數的 DeepSeek-R1 之外,官方另外用 R1 產生的推理資料,對 Qwen2.5 與 Llama3 系列的開源模型做,開源了 1.5B、7B、8B、14B、32B、70B 六個蒸餾版本,用的是 80 萬筆以 R1 整理出來的樣本。

蒸餾就是讓小模型學大模型的輸出:大模型當老師寫出解題過程,小模型照這批資料訓練。官方說大模型的推理模式可以蒸餾進小模型,比讓小模型自己摸索更好。所以你下載的不是「縮小版的 R1」,而是一個被 R1 教過的 Qwen 或 Llama。

品質差距官方自己有列。以 AIME 2024 數學測驗的 pass@1 來看,完整的 DeepSeek-R1 是 79.8,32B 蒸餾版 72.6,7B 蒸餾版 55.5,1.5B 蒸餾版 28.9。方向很清楚:檔案小一個數量級,能力就退一階。

裝 Ollama:三個系統的官方指令與需求

Ollama 的 README 對三個系統各給一行指令:macOS 與 Linux 把官方安裝腳本交給 shell 執行,Windows 在 PowerShell 裡執行官方的 install.ps1;不想跑腳本的人,官網下載頁也提供 Ollama.dmg 與 OllamaSetup.exe。

安裝 Ollama(macOS 與 Linux 終端機) · bash
curl -fsSL https://ollama.com/install.sh | sh
安裝 Ollama(Windows PowerShell) · powershell
irm https://ollama.com/install.ps1 | iex
  • macOS:14 Sonoma 或更新版本;Apple M 系列可用 CPU 與 GPU,Intel 機器只有 CPU。
  • Windows:文件寫 10 22H2 或更新版本(Home 或 Pro),下載頁寫的是 Windows 10 或更新版本。
  • 顯示卡:NVIDIA 要 compute capability 5.0 以上與 550 以上驅動;AMD 走 ROCm v7 或 Vulkan;Apple 走 Metal。
  • 硬碟:Windows 文件寫安裝本身至少 4GB,模型另外算,官方形容是「幾十到幾百 GB」。
  • 模型預設存在使用者目錄的 .ollama/models,可用 OLLAMA_MODELS 環境變數改到別的磁碟。

三個指令:拉模型、對話、離開

裝好以後終端機就有 ollama 指令(Windows 用 cmd 或 PowerShell 都可以)。下載模型用 ollama pull,開始對話用 ollama run,離開輸入 /bye,這三個都在官方的 CLI 參考與快速入門頁裡。

拉一個蒸餾版並開始對話 · bash
ollama pull deepseek-r1:8b
ollama run deepseek-r1:8b

要注意預設標籤指到哪裡。官網標籤頁顯示 deepseek-r1:latest 與 deepseek-r1:8b 是同一個檔案(同一組 ID、同樣 5.2GB),內容是 DeepSeek-R1-0528-Qwen3-8B。直接打 ollama run deepseek-r1 拉到的就是這個 8B 版本,不是 671B 那一個。

對話中與對話後會用到的指令 · bash
/bye                      # 離開對話
ollama ps                 # 看載入的模型跑在 GPU 還是 CPU
ollama ls                 # 列出已下載的模型
ollama rm deepseek-r1:8b  # 刪掉不用的模型,把硬碟空間拿回來
流程圖:從安裝 Ollama、選模型標籤、下載、對話到離開,下方附本機 API 與硬體提醒
上排是從安裝到第一次對話的四個步驟,中間那排是選標籤時要看的下載大小,最下面一條是對話之外的兩件事。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

上排四個步驟:裝 Ollama(macOS 14 以上、Windows 10 22H2 以上)、選一個標籤(例如 deepseek-r1:8b,下載 5.2GB)、用 ollama pull 拉下模型、用 ollama run 開始對話並以 /bye 離開。中間一排列出六個標籤的下載大小:1.5b 是 1.1GB、7b 是 4.7GB、8b 是 5.2GB、32b 是 20GB、70b 是 43GB、671b 是 404GB 的完整版。下排左邊是本機 API,位址在 localhost 的 11434 埠,curl 或 Python 都可以呼叫;右邊是用 ollama ps 檢查模型跑在哪裡,100% GPU 代表整個模型進了顯示記憶體,100% CPU 代表全靠系統記憶體。最底下提醒公務機關全面禁用,包含地端下載。

硬體怎麼對應大小:量化、記憶體與上下文視窗

同一個 7B 蒸餾版,官網上其實有三個檔案:q4_K_M 是 4.7GB、q8_0 是 8.1GB、fp16 是 15GB。差別在量化——參數改用較少位元存放,檔案小、吃的記憶體少,代價是精度。短標籤預設指向 q4_K_M,所以 deepseek-r1:7b 拿到的是 4.7GB 的四位元版本。

官方沒有給「幾 B 要幾 GB 記憶體」的對照表,所以這裡不編一個,建議記憶體以官網為準。能引用的有兩條:下載大小就是記憶體需求的下限;Ollama 依顯示記憶體決定預設上下文視窗,不到 24 GiB 給 4K、24 到 48 GiB 給 32K、48 GiB 以上給 256K。

跑不跑得動,用 ollama ps 看 PROCESSOR 那一欄最準:100% GPU 是整個模型進了顯示記憶體,100% CPU 是全靠系統記憶體,出現 48%/52% CPU/GPU 就是被拆成兩邊、速度會掉。官方建議盡量別落到 CPU。

整理自 ollama.com 的 deepseek-r1 標籤頁,查證日 2026 年 9 月 14 日;建議記憶體官網未列,以官網為準。
標籤參數與基底模型下載大小/上下文指令
1.5b1.5B,Qwen2.5-Math1.1GB/128Kollama run deepseek-r1:1.5b
7b7B,Qwen2.5-Math4.7GB/128Kollama run deepseek-r1:7b
8b8B,Qwen3(等於 latest)5.2GB/128Kollama run deepseek-r1:8b
14b14B,Qwen2.59.0GB/128Kollama run deepseek-r1:14b
32b32B,Qwen2.520GB/128Kollama run deepseek-r1:32b
70b70B,Llama-3.3-Instruct43GB/128Kollama run deepseek-r1:70b
671b671B 完整版,非蒸餾404GB/160Kollama run deepseek-r1:671b

接一個本機的 API 呼叫

Ollama 裝好就會在本機開一個 REST API,預設綁在 127.0.0.1 的 11434 埠,官方文件寫的基底網址是 localhost:11434 底下的 /api。模型頁的範例可以整段複製,把模型名稱換成你的標籤。

用 curl 呼叫本機的 deepseek-r1 · bash
curl http://localhost:11434/api/chat -d '{
  "model": "deepseek-r1",
  "messages": [{"role": "user", "content": "Hello!"}],
  "stream": false
}'

Python 也有官方套件,先安裝再幾行就能對話:

用 Python 呼叫本機的 deepseek-r1 · python
from ollama import chat

response = chat(
    model='deepseek-r1',
    messages=[{'role': 'user', 'content': 'Hello!'}],
)
print(response.message.content)

這個端點預設只在自己的電腦上聽。官方文件說要讓區網其他裝置連得到得改 OLLAMA_HOST——沒有需要就不要改,那等於把一個不用密碼的模型端點開給整個網路。

隱私換到什麼、付出什麼、授權能做什麼

Ollama 的常見問答對「會不會把提示詞送回 ollama.com」寫得很直接:本機執行時他們看不到你的提示詞與資料。這就是本機跑最大的好處——貼進去的合約、客戶名單不會離開這台電腦,也不套用 DeepSeek 網頁版的資料政策。

有一個例外要認出來:ollama.com 也上架雲端模型,標籤結尾是 :cloud,例如官網標示 304B 參數、1M 上下文視窗、按 token 計價的 deepseek-v4-flash:cloud。這種是送到 Ollama 雲端跑、要先登入,官方說提示詞與回應會被處理但不儲存、不記錄、不拿去訓練。要整個關掉可以設定 OLLAMA_NO_CLOUD 環境變數。

代價有三個,兩個官方文件寫得出來:硬碟(1.1GB 到 404GB,加上安裝本身的 4GB),以及模型放不進顯示記憶體時會落到 CPU、速度變慢。第三個是耗電與發熱,官方沒給數字,以實際使用為準。本機模型也不會自己上網查資料——Ollama 的網路搜尋是另一個雲端 API,要免費帳號與金鑰。

授權方面,模型卡與 Ollama 的說明頁一致:權重採 MIT 授權,DeepSeek-R1 系列支援商業使用,也允許修改與衍生作品,包含拿輸出去蒸餾別的模型。但基底模型的授權要一起看——Qwen 系列蒸餾版來自 Qwen-2.5 的 Apache 2.0;Llama 蒸餾版分別適用 llama3.1 與 llama3.3 授權。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享