生活分享

為什麼要在自己電腦跑 AI:隱私、離線與成本

本機 AI 換到三件事:資料不出電腦、模型下載後可離線使用、沒有月費;代價是硬體、速度與品質落差,還要自己維護。這篇整理 Ollama、LM Studio、Open WebUI 官方文件對「資料不會離開你的電腦」與離線條件的原文,用官方模型卡的評測數字說明小模型與旗艦的差距,並列出敏感文件摘要、離線翻譯、程式補全、批量處理適合本機,以及哪三種情況該留在雲端。

更新日期: 閱讀時間約 9 分鐘

插圖:一台螢幕造型的電腦被虛線圓圈包住,螢幕裡有一個對話框;右上角一朵雲和圓圈之間的點狀線在中途斷開,右下角一疊圓形代表一次性的硬體支出。
圖片:Mokaair (© Mokaair)

在自己電腦跑 ,換到的是三件具體的事:提示詞與檔案不離開這台機器、模型下載完成後可以離線使用、不必每個月付訂閱費。付出的則是硬體門檻、等待時間、品質落差,以及自己維護模型與軟體的工夫。這是一筆交易,不是升級,值不值得完全看你平常拿 AI 做什麼。搜「本機 AI」或「離線 AI」的人,先算這筆交易。

這篇把這筆交易攤開來算:官方文件到底怎麼寫「資料不會離開你的電腦」、離線可用的前提是什麼、費用結構跟雲端差在哪裡,再用官方模型卡上的數字說明小模型與旗艦的差距。最後會有一張用途對照表,還有指令列、圖形介面、網頁介面三條入門路線,你挑一條照著走就好。

本機跑 AI 是什麼意思

本機跑 AI 指的是把模型的權重檔案下載到自己的電腦,由這台電腦的處理器、顯示卡與記憶體負責運算,過程不經過任何公司的伺服器。這件事做得到,是因為有一批模型把權重公開釋出讓人下載;Hugging Face 的模型庫是這些檔案最主要的發布地點,官方文件示範的下載方式就是一行 hf download 加上模型倉庫名稱。

跟雲端服務的差別只在「運算發生在哪裡」。你在瀏覽器用雲端助理時,提示詞會送到對方的機房、由對方的硬體運算、再把答案送回來;本機模型則是提示詞從你的鍵盤進到同一台電腦的記憶體,答案也從那裡出來。這個位置差異同時決定了隱私、離線能力與費用三件事,下面三節分別談。

換到的第一件事:資料不出這台電腦

這件事不用靠推論,官方文件寫得很直接。Ollama 的說明文件 FAQ 有一題就叫「Does Ollama send my prompts and answers back to ollama.com?」,答覆是「Ollama runs locally. We don't see your prompts or data when you run locally.」;同一份 FAQ 也說他們收集的是基本帳號資訊與有限的使用中繼資料,「does not include prompt or response content」。官網首頁的說法更短:「Nothing you run locally ever leaves your machine.」

LM Studio 的隱私說明同樣具體:「If you download and run models locally, none of your messages, chat histories, and documents are ever transmitted from your system - everything is saved locally on your device.」官方文件另外寫明,把檔案拖進去做問答時「that document stays on your machine」。Open WebUI 則在官方文件首頁把自己描述成一個「built to run entirely offline」的自架 AI 平台。

要注意的是同一套軟體常常同時有本機與雲端兩種模式,上面的保證只涵蓋本機那一半。Ollama 的 FAQ 就把另一半分開寫:使用雲端託管的模型時「we process your prompts and responses to provide the service but do not store or log that content and never train on it」。想把雲端功能整個關掉,官方 FAQ 給的做法是設環境變數 OLLAMA_NO_CLOUD=1,或改設定檔。

關閉 Ollama 雲端功能:官方 FAQ 的設定檔寫法(~/.ollama/server.json) · json
{
  "disable_ollama_cloud": true
}

換到的第二件事:離線可用,但有前提

離線可用的前提只有一個:模型檔案要先在有網路的時候下載好。LM Studio 的官方離線說明寫的是「LM Studio does not require the internet in order to work」,聊天、跟文件問答、開本機伺服器這三件事都不需要網路。但同一頁也誠實列出仍然需要連線的部分:在 Discover 分頁搜尋模型、下載新模型、下載執行環境,以及 App 內建的更新檢查。模型本身則是從 Hugging Face 下載。

Ollama 是一樣的邏輯:先用 pull 把模型抓下來,之後 run 就是在本機載入這份檔案。官方文件也寫了模型放在哪裡,macOS 在 ~/.ollama/models,Windows 在 C:\Users\%username%\.ollama\models,Linux 在 /usr/share/ollama/.ollama/models,要換位置就設 OLLAMA_MODELS 環境變數。出國前把要用的模型先抓好,飛機上、山上、收訊差的會議室都還能用。

先下載、再執行:Ollama 官方文件的指令 · bash
ollama pull gemma4
ollama run gemma4
ollama ls
左右對照圖:左邊雲端 AI 的提示詞送到外部機房並按月與按用量付費,右邊本機模型的提示詞留在同一台電腦、只在下載模型時連網。
左右各看一次:上半是提示詞走到哪裡,下半是錢從哪裡出去。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

左右對照圖,分成上下兩段。上段是資料流向:左邊雲端 AI,提示詞與檔案從你的電腦送到服務商機房運算後再把答案送回,因此提示詞離開這台電腦,隱私要看對方的隱私政策,沒有網路就完全不能用;右邊本機模型,提示詞、檔案與模型都在同一台電腦上,官方文件寫明本機執行時不會送出提示詞,只有下載模型與更新軟體時需要連網。下段是費用結構:雲端是訂閱按月或按年扣款,加上 API 按用量計費,屬於持續支出,停用才停止付費;本機是硬體一次性支出加上跑的時候才花的電費,模型多半免費下載,屬於一次投入、之後主要是電費。

換到的第三件事:費用從月費變成一次性投資

雲端 AI 的費用是持續性的:訂閱按月或按年扣款,API 按用量計費,用多少算多少,停用才停止付費。本機模型的費用結構不一樣,主要是一次性的硬體支出加上跑起來的電費,模型本身多半免費下載。Ollama 官網把這件事直接寫成賣點:「Ollama lets you use open models with your coding agents so you can spend less while keeping your data private.」

兩種結構沒辦法用一個數字比高下,因為答案取決於用量:偶爾用幾次,雲端便宜得多;每天長時間重複同一種工作,一次性硬體才有機會攤平。這篇不列任何金額,各家的訂閱價、API 單價與硬體售價一律以官網當天的頁面為準,實際怎麼算同系列有一篇專門在算。

付出什麼:硬體、品質落差、速度與維護

硬體是第一道門檻,而且官方模型卡寫得很清楚。OpenAI 在 Hugging Face 上以 Apache 2.0 授權釋出的 gpt-oss 是個好例子:小的 gpt-oss-20b 是「21B with 3.6B active parameters」,模型卡說它可以「run within 16GB of memory」,定位是「for lower latency, and local or specialized use cases」;大的 gpt-oss-120b 是「117B parameters with 5.1B active parameters」,要「fit into a single 80GB GPU」。一般家用電腦能碰的是前者那一類。

品質落差也可以只看官方數字。Google 的 Gemma 4 模型卡把同一代不同尺寸放進同一張表:MMLU Pro 這一項,最小的 E2B 是 60.0%、最大的 31B 是 85.2%;GPQA Diamond 差距更大,E2B 是 43.4%、31B 是 84.3%。官方對尺寸的定位也不同,E2B 與 E4B 寫的是給手機、邊緣裝置與瀏覽器用,31B 才是「bridges the gap between server-grade performance and local execution」。你在自己電腦上跑的,通常是這張表裡尺寸較小的那幾顆。

速度與維護是另外兩筆帳。同一顆模型放在自己的顯示卡上跑,吐字速度取決於你的硬體,跟機房的規格不是同一個等級;模型更新、量化版本怎麼挑、軟體升級、出問題自己查,也全都變成你的工作,沒有客服可以問。願意花這些時間的人,才適合把主力搬到本機。

哪些用途適合本機,哪些不適合

把上面三筆帳合起來,適合本機的工作有共同特徵:資料敏感、重複性高、對「最新」沒有要求,而且用小模型就做得完。不適合的也有共同特徵:要最新資訊、要最強推理,或者手上的硬體根本不夠。程式補全是個典型的適合案例,Continue 的官方指南把搭配 Ollama 的做法描述成「privacy-focused offline coding assistance」,建議拿來跑補全的也是小尺寸的程式模型。批量處理則是靠本機 API:Ollama 的本機服務開在 localhost 的 11434 埠,寫腳本重複呼叫不會按 token 計費。

用途與本機模型的適配度,依各官方文件與模型卡整理,2026 年 9 月查證。
用途本機適合嗎為什麼
敏感文件摘要適合官方隱私說明寫明本機執行時訊息、對話紀錄與文件都不會離開裝置,拖進去的檔案留在你的機器上
離線翻譯適合模型下載後聊天不需要網路,官方離線說明列出的連線需求只剩搜尋、下載與更新
程式補全適合官方整合指南把本機模型定位成兼顧隱私與離線的寫程式協助,補全用的小模型硬體門檻低
批量處理適合本機 API 開在 localhost 的 11434 埠,腳本重複呼叫不按 token 計費,只花電費
查最新資訊不適合模型只知道訓練時的資料;Ollama 自己的網頁搜尋 API 要建立 API 金鑰並需要一個免費帳號,等於又回到網路
需要最強推理不適合官方評測表上尺寸差距明確,GPQA Diamond 從 E2B 的 43.4% 到 31B 的 84.3%
硬體不夠不適合模型卡寫的記憶體需求擺在那裡,硬塞只會慢到不能用,不如把錢留給雲端訂閱

三條入門路線,挑一條開始

三條路線的差別只在你怎麼跟模型說話,底下跑的都是同一批開放權重模型,而且可以同時裝、之後再換。不確定要哪一條,就從圖形介面那條開始,習慣之後再往下走。下面的功能描述依各家官方文件整理,實際介面以官網當天版本為準。

  1. Ollama:指令列。一行 pull 抓模型、一行 run 開始對話,另外提供本機 API 讓其他程式接進來,適合想寫腳本或接編輯器的人。
  2. LM Studio:圖形介面。在 App 裡搜尋並下載模型、直接聊天、需要時再開本機伺服器,不必碰終端機。
  3. Open WebUI:網頁介面。自架一個像聊天網站的介面接到本機模型,官方文件說它支援 Ollama 與 OpenAI 相容的 API,適合多人或多裝置共用一台主機。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享