生活分享

Ollama 入門:Windows、Mac 安裝與第一個模型

Ollama 是在自己電腦跑本機 AI 的入門工具,官網下載頁寫 macOS 要 14 Sonoma 或更新版本、Windows 要 10 或更新版本。這篇照官方文件走完安裝、第一次對話、看懂模型庫的標籤與大小、用 ollama ps 確認模型跑在顯示卡還是 CPU,再從 curl 與 Python 呼叫本機 11434 埠的 API,最後說清楚結尾帶 cloud 的標籤是雲端模型、怎麼關掉。

更新日期: 閱讀時間約 7 分鐘

插圖:一台筆電螢幕上的對話框,旁邊有下載箭頭、硬碟與晶片,一條線連到程式端點。
圖片:Mokaair (© Mokaair)

Ollama 把開放權重模型下載到自己的電腦上執行,官方對三個作業系統各給一行安裝指令,裝完在終端機打一個字就能開始對話,本機執行不需要帳號,打進去的字不會送出去。搜「本機 」找到 Ollama 的人,裝完先跑這一步。

這篇帶你做四件事:照官方需求裝好、拉一個模型開始聊、看懂模型庫頁的標籤與檔案大小、從 curl 或 Python 呼叫本機端點。模型存在哪裡、有沒有用到顯示卡、哪些標籤其實是雲端模型也會一起講。

安裝:三個系統各一行指令

官網下載頁對 macOS 與 Linux 給同一行:把安裝腳本交給 shell 執行;Windows 則是在 PowerShell 裡執行 install.ps1。不想跑腳本,下載頁也各有安裝檔,macOS 是 Ollama.dmg、Windows 是 OllamaSetup.exe。

安裝 Ollama(macOS 與 Linux 終端機) · bash
curl -fsSL https://ollama.com/install.sh | sh
安裝 Ollama(Windows PowerShell) · powershell
irm https://ollama.com/install.ps1 | iex

系統需求分散在官方的 macOS、Windows 與硬體支援三頁:

  • macOS:Sonoma(14)或更新版本;Apple M 系列可用 CPU 與 GPU,x86 只有 CPU。
  • Windows:10 22H2 或更新版本,Home 或 Pro 都可以。
  • 顯示卡:NVIDIA 要 compute capability 5.0 以上與 550 以上驅動,5.0 到 6.2 的卡要 570 以上;Windows 那頁寫 551.61 以上。AMD 走 ROCm v7 或 Vulkan。
  • 硬碟:Windows 文件寫安裝本身至少 4GB,模型另外算,官方形容是「幾十到幾百 GB」。

macOS 建議掛載 dmg、把 Ollama 拖進「應用程式」;Windows 的安裝程式不需要管理員權限,裝在使用者目錄,裝完在背景執行,cmd 與 PowerShell 都有 ollama 指令。兩邊另有桌面程式,官方文件提到設定頁可以登入帳號、拉滑桿改上下文長度,介面以官網當天版本為準。

第一次對話:ollama、ollama run、/bye

官方快速入門拆成兩步:終端機輸入 ollama 會開一個互動選單,可以選跑模型或把 Ollama 接到 Claude Code、VS Code 這類工具;想直接開始就用 ollama run 加模型名稱。官方示範的是 Gemma 4,指令寫成 gemma4,離開對話輸入 /bye。

從安裝到第一次對話 · bash
ollama                 # 打開互動選單
ollama pull gemma4     # 先把模型下載下來
ollama run gemma4      # 進入對話
/bye                   # 離開對話

常用指令:一張表看完

要記的指令不多,下面是官方 CLI 參考頁列出的常用項目,模型名稱換成你拉的那個即可。

來源:Ollama 官方 CLI 參考頁,2026 年 9 月查證。
指令做什麼
ollama打開互動選單,選模型或整合
ollama run gemma4執行模型並進入對話
ollama pull gemma4只下載模型,不對話
ollama ls列出已下載的模型
ollama ps列出記憶體裡的模型,看它跑在哪
ollama stop gemma4把模型從記憶體卸載
ollama rm gemma4刪掉模型,把空間拿回來
ollama launch claude設定外部程式用 Ollama 模型
ollama serve --help列出所有可以設定的環境變數

四格流程圖:安裝、拉模型、對話、接 API,下方一排是模型位置、GPU 確認與雲端標籤三個檢查點。
上排是從安裝到接 API 的四個步驟與每一步的指令,下排是這四步中間會用到的三個設定。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

上排四個方框是順序步驟:一、安裝,官網下載頁一行指令,macOS 需要 14 Sonoma 以上、Windows 需要 10 22H2 以上,也可以下載 dmg 或 exe 安裝檔;二、拉模型,指令是 ollama pull gemma4,在模型庫頁看標籤、大小與上下文,例如 9.6GB 與 128K,大小欄是下載大小;三、對話,指令是 ollama run gemma4,離開輸入斜線 bye,用 ollama ps 看 PROCESSOR 欄是 100% GPU 還是 100% CPU;四、接 API,本機位址是 localhost 冒號 11434,路徑有 /api/chat 與 /v1/chat/completions,curl 或 Python 都可以呼叫。下排三個方框是這四步之間會用到的設定:模型放在哪,預設在 .ollama/models,三個系統路徑不同,換磁碟要設 OLLAMA_MODELS;跑在 GPU 還是 CPU,用 ollama ps 看 PROCESSOR 欄,100% GPU 代表全在顯示記憶體,48%/52% CPU/GPU 代表被拆成兩邊;本機還是雲端,標籤結尾帶 cloud 就是雲端,大小欄顯示一個橫線,要全部關掉就設 OLLAMA_NO_CLOUD 等於 1。最下面一條是預設上下文視窗:常見問答寫預設 4096 個 token,可用 OLLAMA_CONTEXT_LENGTH 覆寫,另外依顯示記憶體分級,小於 24 GiB 給 4K,24 到 48 GiB 給 32K,48 GiB 以上給 256K。

看懂模型庫頁:標籤、大小與上下文

模型清單在官網的 library 頁,預設照 Popular 排序,也能切成 Newest;卡片上寫有哪些標籤與 tools、thinking、vision、cloud 這類能力。點進去的清單分四欄:名稱、大小與用量、上下文、輸入型態。以 gemma4 為例,當天標示共 50 個標籤:

  • gemma4:e2b:7.2GB、128K 上下文視窗;官網說 E 代表有效參數,給邊緣裝置。
  • gemma4:e4b:9.6GB、128K,官網標示 latest 指向它,所以跟 gemma4:latest 同一個。
  • gemma4:12b:7.6GB、256K。
  • gemma4:26b:19GB、256K,官網註明是 4B 活躍參數的混合專家模型。
  • gemma4:31b:20GB、256K,是密集模型。
  • gemma4:cloud 與 gemma4:31b-cloud:大小欄是「-」,不用下載。

兩件事先弄清楚:大小欄是下載大小不是參數量,同一個參數規模常有好幾個大小不同的標籤,差在用幾位元存放參數;上下文欄是模型支援的上限,不等於你實際拿到多少。標籤旁的 MLX 之類標記是另一種建置版本,用途以官網為準。

模型放在哪、有沒有跑在 GPU 上

官方常見問答列出預設位置:macOS 在使用者目錄底下的 .ollama/models,Linux 在 /usr/share/ollama/.ollama/models,Windows 在使用者資料夾底下的 .ollama\models。系統碟撐不住幾十 GB,就設 OLLAMA_MODELS 環境變數指到別的磁碟;Windows 在「編輯這個帳戶的環境變數」裡新增,存檔後結束 Ollama 重開。

有沒有用到顯示卡,用 ollama ps 看得到,官方給的輸出長這樣:

ollama ps 的輸出(官方文件範例) · text
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now

PROCESSOR 那欄有三種讀法:100% GPU 是整個模型進了顯示記憶體,100% CPU 是全靠系統記憶體,48%/52% CPU/GPU 是被拆成兩邊、速度會掉,官方建議別落到 CPU。模型載入後預設留在記憶體 5 分鐘才卸載。

上下文長度有兩個官方說法:常見問答寫預設 4096 個 token,可用 OLLAMA_CONTEXT_LENGTH 覆寫;上下文長度那頁寫 Ollama 依顯示記憶體給預設值,小於 24 GiB 給 4K、24 到 48 GiB 給 32K、48 GiB 以上給 256K,並建議代理與寫程式至少設到 64000 個 token。

接上本機 API:REST 與 OpenAI 相容端點

裝好之後 API 就自己跑起來,官方寫的本機基底網址是 localhost:11434 底下的 /api。下面兩個 curl 是最短的呼叫:前一個是 Ollama 的 REST API,後一個是 OpenAI 相容端點,路徑換成 /v1。

用 curl 呼叫本機的兩個端點 · bash
# Ollama 自己的 REST API
curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "Why is the sky blue?"}],
  "stream": false
}'

# OpenAI 相容端點
curl -X POST http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gpt-oss:20b",
  "messages": [{ "role": "user", "content": "Say this is a test" }]
}'

Python 兩種寫法都照官方文件原文。官方套件最短;已經用 OpenAI 函式庫寫好的程式,只要把 base_url 指到本機的 /v1,金鑰隨便填,官方註解寫這欄必填但會被忽略。

Python:官方套件與 OpenAI 相容寫法 · python
# 官方 ollama 套件(先 pip install ollama)
from ollama import chat

response = chat(
    model='gemma4',
    messages=[{'role': 'user', 'content': 'Why is the sky blue?'}],
)
print(response.message.content)

# OpenAI 函式庫改個網址就能用
from openai import OpenAI

client = OpenAI(
    base_url='http://localhost:11434/v1/',
    api_key='ollama',  # required but ignored
)

chat_completion = client.chat.completions.create(
    messages=[{'role': 'user', 'content': 'Say this is a test'}],
    model='gpt-oss:20b',
)
print(chat_completion.choices[0].message.content)

相容到什麼程度官方逐項列了:聊天端點支援串流、JSON 模式、看圖與工具呼叫,不支援 tool_choice;另外還有模型清單、嵌入與 0.13.3 版加入的 responses 端點。

這個端點預設只綁 127.0.0.1 的 11434 埠。要讓區網其他裝置連得到得改 OLLAMA_HOST,官方例子是 0.0.0.0:11434。沒需要就不要改:那等於把不用密碼的模型端點開給整個網路。

哪些標籤其實是雲端:cloud 與 OLLAMA_NO_CLOUD

官網上架的模型不是全部都在你的電腦上跑。雲端模型那頁寫得很清楚:這種模型會自動轉到 Ollama 的雲端服務執行,不用強力顯示卡也能跑裝不下的大模型,用法跟本機一樣,但要先 ollama signin 登入。

隱私問題官方常見問答的原文是:「Ollama runs locally. We don't see your prompts or data when you run locally.」用雲端模型時官方寫會處理提示詞與回應以提供服務,但不儲存、不記錄,也不拿去訓練。

費用只有雲端才有。官網 Pricing 頁列 Free 每月 0 美元、Pro 每月 20 美元、Max 每月 100 美元,雲端模型按每百萬 token 計價,單價以該頁為準。在自己電腦上跑不用付錢,也不用帳號。

不想碰終端機,圖形介面的工具是另一條路;想拿一個具體模型從頭走一次,站上有一篇專講在 Ollama 上跑 DeepSeek 蒸餾版。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享