生活分享
Ollama 入門:Windows、Mac 安裝與第一個模型
Ollama 是在自己電腦跑本機 AI 的入門工具,官網下載頁寫 macOS 要 14 Sonoma 或更新版本、Windows 要 10 或更新版本。這篇照官方文件走完安裝、第一次對話、看懂模型庫的標籤與大小、用 ollama ps 確認模型跑在顯示卡還是 CPU,再從 curl 與 Python 呼叫本機 11434 埠的 API,最後說清楚結尾帶 cloud 的標籤是雲端模型、怎麼關掉。
更新日期: 閱讀時間約 7 分鐘

Ollama 把開放權重模型下載到自己的電腦上執行,官方對三個作業系統各給一行安裝指令,裝完在終端機打一個字就能開始對話,本機執行不需要帳號,打進去的字不會送出去。搜「本機 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文」找到 Ollama 的人,裝完先跑這一步。
這篇帶你做四件事:照官方需求裝好、拉一個模型開始聊、看懂模型庫頁的標籤與檔案大小、從 curl 或 Python 呼叫本機端點。模型存在哪裡、有沒有用到顯示卡、哪些標籤其實是雲端模型也會一起講。
安裝:三個系統各一行指令
官網下載頁對 macOS 與 Linux 給同一行:把安裝腳本交給 shell 執行;Windows 則是在 PowerShell 裡執行 install.ps1。不想跑腳本,下載頁也各有安裝檔,macOS 是 Ollama.dmg、Windows 是 OllamaSetup.exe。
curl -fsSL https://ollama.com/install.sh | shirm https://ollama.com/install.ps1 | iex系統需求分散在官方的 macOS、Windows 與硬體支援三頁:
- macOS:Sonoma(14)或更新版本;Apple M 系列可用 CPU 與 GPU,x86 只有 CPU。
- Windows:10 22H2 或更新版本,Home 或 Pro 都可以。
- 顯示卡:NVIDIA 要 compute capability 5.0 以上與 550 以上驅動,5.0 到 6.2 的卡要 570 以上;Windows 那頁寫 551.61 以上。AMD 走 ROCm v7 或 Vulkan。
- 硬碟:Windows 文件寫安裝本身至少 4GB,模型另外算,官方形容是「幾十到幾百 GB」。
macOS 建議掛載 dmg、把 Ollama 拖進「應用程式」;Windows 的安裝程式不需要管理員權限,裝在使用者目錄,裝完在背景執行,cmd 與 PowerShell 都有 ollama 指令。兩邊另有桌面程式,官方文件提到設定頁可以登入帳號、拉滑桿改上下文長度,介面以官網當天版本為準。
為什麼要在自己電腦跑 AI:隱私、離線與成本為什麼要在自己電腦跑 AI:隱私、離線與成本本機 AI 換到三件事:資料不出電腦、模型下載後可離線使用、沒有月費;代價是硬體、速度與品質落差,還要自己維護。這篇整理 Ollama、LM Studio、Open WebUI 官方文件對「資料不會離開你的電腦」與離線條件的原文,用官方模型卡的評測數字說明小模型與旗艦的差距,並列出敏感文件摘要、離線翻譯、程式補全、批量處理適合本機,以及哪三種情況該留在雲端。閱讀全文
第一次對話:ollama、ollama run、/bye
官方快速入門拆成兩步:終端機輸入 ollama 會開一個互動選單,可以選跑模型或把 Ollama 接到 Claude Code、VS Code 這類工具;想直接開始就用 ollama run 加模型名稱。官方示範的是 Gemma 4,指令寫成 gemma4,離開對話輸入 /bye。
ollama # 打開互動選單
ollama pull gemma4 # 先把模型下載下來
ollama run gemma4 # 進入對話
/bye # 離開對話常用指令:一張表看完
要記的指令不多,下面是官方 CLI 參考頁列出的常用項目,模型名稱換成你拉的那個即可。
| 指令 | 做什麼 |
|---|---|
| ollama | 打開互動選單,選模型或整合 |
| ollama run gemma4 | 執行模型並進入對話 |
| ollama pull gemma4 | 只下載模型,不對話 |
| ollama ls | 列出已下載的模型 |
| ollama ps | 列出記憶體裡的模型,看它跑在哪 |
| ollama stop gemma4 | 把模型從記憶體卸載 |
| ollama rm gemma4 | 刪掉模型,把空間拿回來 |
| ollama launch claude | 設定外部程式用 Ollama 模型 |
| ollama serve --help | 列出所有可以設定的環境變數 |
把本機模型接到編輯器:Continue、Cursor 與 Ollama把本機模型接到編輯器:Continue、Cursor 與 OllamaContinue 的官方文件有完整的 Ollama 設定,改一個 config.yaml 就能讓本機模型負責聊天、補全與嵌入三個角色;Cursor 的說明頁只列五家雲端金鑰、沒有自訂端點,而且自備金鑰只對聊天模型有效,Tab 補全仍走內建模型。這篇照官方文件寫設定檔、Ollama 端的 11434 埠與上下文長度、程式模型怎麼挑,以及代理模式的限制。閱讀全文
閱讀完整文字說明
上排四個方框是順序步驟:一、安裝,官網下載頁一行指令,macOS 需要 14 Sonoma 以上、Windows 需要 10 22H2 以上,也可以下載 dmg 或 exe 安裝檔;二、拉模型,指令是 ollama pull gemma4,在模型庫頁看標籤、大小與上下文,例如 9.6GB 與 128K,大小欄是下載大小;三、對話,指令是 ollama run gemma4,離開輸入斜線 bye,用 ollama ps 看 PROCESSOR 欄是 100% GPU 還是 100% CPU;四、接 API,本機位址是 localhost 冒號 11434,路徑有 /api/chat 與 /v1/chat/completions,curl 或 Python 都可以呼叫。下排三個方框是這四步之間會用到的設定:模型放在哪,預設在 .ollama/models,三個系統路徑不同,換磁碟要設 OLLAMA_MODELS;跑在 GPU 還是 CPU,用 ollama ps 看 PROCESSOR 欄,100% GPU 代表全在顯示記憶體,48%/52% CPU/GPU 代表被拆成兩邊;本機還是雲端,標籤結尾帶 cloud 就是雲端,大小欄顯示一個橫線,要全部關掉就設 OLLAMA_NO_CLOUD 等於 1。最下面一條是預設上下文視窗:常見問答寫預設 4096 個 token,可用 OLLAMA_CONTEXT_LENGTH 覆寫,另外依顯示記憶體分級,小於 24 GiB 給 4K,24 到 48 GiB 給 32K,48 GiB 以上給 256K。
看懂模型庫頁:標籤、大小與上下文
模型清單在官網的 library 頁,預設照 Popular 排序,也能切成 Newest;卡片上寫有哪些標籤與 tools、thinking、vision、cloud 這類能力標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文。點進去的清單分四欄:名稱、大小與用量、上下文、輸入型態。以 gemma4 為例,當天標示共 50 個標籤:
- gemma4:e2b:7.2GB、128K 上下文視窗;官網說 E 代表有效參數,給邊緣裝置。
- gemma4:e4b:9.6GB、128K,官網標示 latest 指向它,所以跟 gemma4:latest 同一個。
- gemma4:12b:7.6GB、256K。
- gemma4:26b:19GB、256K,官網註明是 4B 活躍參數的混合專家模型。
- gemma4:31b:20GB、256K,是密集模型。
- gemma4:cloud 與 gemma4:31b-cloud:大小欄是「-」,不用下載。
兩件事先弄清楚:大小欄是下載大小不是參數量,同一個參數規模常有好幾個大小不同的標籤,差在用幾位元存放參數;上下文欄是模型支援的上限,不等於你實際拿到多少。標籤旁的 MLX 之類標記是另一種建置版本,用途以官網為準。
模型參數(Model Parameters)是什麼模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文
GGUF 量化怎麼選:Q4_K_M、Q8_0、F16 的檔名、檔案大小與記憶體GGUF 量化怎麼選:Q4_K_M、Q8_0、F16 的檔名、檔案大小與記憶體GGUF 檔名裡的 Q4_K_M、Q8_0、F16 是量化類型,決定檔案多大、要多少記憶體。這篇照 llama.cpp 與 ggml 官方文件講 GGUF 格式與命名規則、各類型的每權重位元數,用官方對照表(Llama 3.1 8B 從 14.96 GiB 到 4.58 GiB)與 Ollama、Hugging Face 上同一個模型的不同量化大小說明怎麼選,並附官方的轉檔與量化指令。閱讀全文
上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文
模型放在哪、有沒有跑在 GPU 上
官方常見問答列出預設位置:macOS 在使用者目錄底下的 .ollama/models,Linux 在 /usr/share/ollama/.ollama/models,Windows 在使用者資料夾底下的 .ollama\models。系統碟撐不住幾十 GB,就設 OLLAMA_MODELS 環境變數指到別的磁碟;Windows 在「編輯這個帳戶的環境變數」裡新增,存檔後結束 Ollama 重開。
有沒有用到顯示卡,用 ollama ps 看得到,官方給的輸出長這樣:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from nowPROCESSOR 那欄有三種讀法:100% GPU 是整個模型進了顯示記憶體,100% CPU 是全靠系統記憶體,48%/52% CPU/GPU 是被拆成兩邊、速度會掉,官方建議別落到 CPU。模型載入後預設留在記憶體 5 分鐘才卸載。
上下文長度有兩個官方說法:常見問答寫預設 4096 個 token,可用 OLLAMA_CONTEXT_LENGTH 覆寫;上下文長度那頁寫 Ollama 依顯示記憶體給預設值,小於 24 GiB 給 4K、24 到 48 GiB 給 32K、48 GiB 以上給 256K,並建議代理與寫程式至少設到 64000 個 token。
跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文
接上本機 API:REST 與 OpenAI 相容端點
裝好之後 API 就自己跑起來,官方寫的本機基底網址是 localhost:11434 底下的 /api。下面兩個 curl 是最短的呼叫:前一個是 Ollama 的 REST API,後一個是 OpenAI 相容端點,路徑換成 /v1。
# Ollama 自己的 REST API
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "Why is the sky blue?"}],
"stream": false
}'
# OpenAI 相容端點
curl -X POST http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss:20b",
"messages": [{ "role": "user", "content": "Say this is a test" }]
}'Python 兩種寫法都照官方文件原文。官方套件最短;已經用 OpenAI 函式庫寫好的程式,只要把 base_url 指到本機的 /v1,金鑰隨便填,官方註解寫這欄必填但會被忽略。
# 官方 ollama 套件(先 pip install ollama)
from ollama import chat
response = chat(
model='gemma4',
messages=[{'role': 'user', 'content': 'Why is the sky blue?'}],
)
print(response.message.content)
# OpenAI 函式庫改個網址就能用
from openai import OpenAI
client = OpenAI(
base_url='http://localhost:11434/v1/',
api_key='ollama', # required but ignored
)
chat_completion = client.chat.completions.create(
messages=[{'role': 'user', 'content': 'Say this is a test'}],
model='gpt-oss:20b',
)
print(chat_completion.choices[0].message.content)相容到什麼程度官方逐項列了:聊天端點支援串流、JSON 模式、看圖與工具呼叫,不支援 tool_choice;另外還有模型清單、嵌入與 0.13.3 版加入的 responses 端點。
這個端點預設只綁 127.0.0.1 的 11434 埠。要讓區網其他裝置連得到得改 OLLAMA_HOST,官方例子是 0.0.0.0:11434。沒需要就不要改:那等於把不用密碼的模型端點開給整個網路。
Open WebUI:給本機模型一個像 ChatGPT 的介面Open WebUI:給本機模型一個像 ChatGPT 的介面Ollama 裝好之後,對話只留在終端機裡。Open WebUI 官方文件給一行 Docker 指令,把介面開在埠 3000:聊天記錄、多模型並排、上傳文件做 RAG、多人帳號都在裡面。這篇照官方文件走完 Docker 與 pip 兩種安裝、用 OLLAMA_BASE_URL 接上 11434 埠、建立第一個管理員帳號、做知識庫與提示詞範本、備份 volume,最後把 LICENSE 裡那條不能拿掉 Open WebUI 標示的條款照原文說清楚。閱讀全文
哪些標籤其實是雲端:cloud 與 OLLAMA_NO_CLOUD
官網上架的模型不是全部都在你的電腦上跑。雲端模型那頁寫得很清楚:這種模型會自動轉到 Ollama 的雲端服務執行,不用強力顯示卡也能跑裝不下的大模型,用法跟本機一樣,但要先 ollama signin 登入。
隱私問題官方常見問答的原文是:「Ollama runs locally. We don't see your prompts or data when you run locally.」用雲端模型時官方寫會處理提示詞與回應以提供服務,但不儲存、不記錄,也不拿去訓練。
費用只有雲端才有。官網 Pricing 頁列 Free 每月 0 美元、Pro 每月 20 美元、Max 每月 100 美元,雲端模型按每百萬 token 計價,單價以該頁為準。在自己電腦上跑不用付錢,也不用帳號。
開放權重(Open Weights):能下載模型,還要確認什麼開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文
不想碰終端機,圖形介面的工具是另一條路;想拿一個具體模型從頭走一次,站上有一篇專講在 Ollama 上跑 DeepSeek 蒸餾版。
LM Studio 入門:圖形介面跑本機模型LM Studio 入門:圖形介面跑本機模型LM Studio 是一套桌面軟體,不用打指令就能在自己的電腦下載並執行開放權重模型。本文照官方文件整理系統需求、在 Discover 分頁搜尋與下載 GGUF 或 MLX 模型、對話時的上下文視窗與 GPU offload 設定、把本機伺服器開在埠 1234 的 OpenAI 相容端點,以及使用條款對個人與內部商業用途的說法。閱讀全文
在自己電腦跑 DeepSeek:Ollama 蒸餾版教學在自己電腦跑 DeepSeek:Ollama 蒸餾版教學Ollama 官網目前列出 deepseek-r1 的 1.5b、7b、8b、14b、32b、70b 與 671b 七個標籤,下載大小從 1.1GB 到 404GB。這篇用官方文件帶你在 Windows 或 Mac 裝好 Ollama、拉一個蒸餾版開始對話,再接一次本機 11434 埠的 API 呼叫,並說清楚蒸餾與量化是什麼、蒸餾版和網頁版完整模型差在哪、MIT 授權實際允許什麼。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Ollama 官網下載頁(安裝指令、Ollama.dmg 與 OllamaSetup.exe、macOS 14 Sonoma 與 Windows 10 的需求) · 查證日期:
- Ollama GitHub README(三個系統的安裝方式、REST API 與 Python 範例、ollama launch) · 查證日期:
- Ollama 說明文件:快速入門(ollama 選單、ollama run gemma4、/bye) · 查證日期:
- Ollama 說明文件:CLI 參考(run、launch、pull、rm、ls、ps、stop、signin、serve 等指令) · 查證日期:
- Ollama 說明文件:macOS(系統需求、dmg 安裝方式、檔案與日誌位置) · 查證日期:
- Ollama 說明文件:Windows(Windows 10 22H2、4GB 安裝空間、OLLAMA_MODELS 設定步驟、11434 埠) · 查證日期:
- Ollama 說明文件:Linux(安裝腳本與手動安裝) · 查證日期:
- Ollama 說明文件:硬體支援(NVIDIA compute capability 與驅動版本、AMD ROCm 與 Vulkan) · 查證日期:
- Ollama 說明文件:上下文長度(依顯示記憶體的 4K/32K/256K 預設值、64000 token 建議、App 滑桿) · 查證日期:
- Ollama 說明文件:常見問答(4096 預設上下文、ollama ps 的 PROCESSOR 欄、模型存放位置、環境變數、隱私、關閉雲端) · 查證日期:
- Ollama 說明文件:API 介紹(本機基底網址 localhost:11434) · 查證日期:
- Ollama 說明文件:OpenAI 相容性(/v1 端點、支援欄位、responses 端點與 0.13.3 版) · 查證日期:
- Ollama 說明文件:雲端模型(需要登入、自動轉到 Ollama 雲端執行) · 查證日期:
- Ollama 模型庫首頁(Popular 與 Newest 排序、能力標記) · 查證日期:
- Ollama 模型庫:gemma4(各標籤的下載大小、上下文視窗、輸入型態與 cloud 標籤) · 查證日期:
- Ollama 官網 Pricing 頁(Free、Pro、Max、Team 月費與雲端模型計價) · 查證日期: