生活分享
本機推論(Local Inference)是什麼:在自己的裝置上跑模型
本機推論是把模型權重下載到自己的電腦或手機,由這台裝置完成計算,提示詞不必送進雲端。內容說明哪些東西真的留在本機、哪些仍可能連網,記憶體需求如何由權重、量化與 KV 快取決定,作業系統內建的裝置端模型怎麼運作,並比較本機與雲端推論在隱私、成本、速度與維護上的取捨。
閱讀時間約 7 分鐘

本機推論(local inference)是把模型權重放在自己的電腦或手機上,由這台裝置完成推論(inference)推論(Inference)是什麼:模型訓練完之後,每次回答都在做的計算推論是用已訓練好的模型處理新輸入、產生輸出的過程,權重在這個階段固定不變。內容拆開語言模型推論的兩段:讀入提示(prefill)與逐個產生(decode),說明首個 token 時間、完整回答時間與吞吐量的差別,分清推論(inference)與推理(reasoning)、雲端與本機,並看懂批次、量化與快取各自省在哪裡。閱讀全文的計算,提示詞不必送到服務商的伺服器。本站用「本機推論」,Google 的 Android 開發者文件繁中版(頁面註明由 AI 翻譯)也寫「在本機執行」;作業系統內建的模型,同一份文件稱「裝置端」AI,指的是同一件事。安裝與選購硬體見為什麼要在自己電腦跑 AI為什麼要在自己電腦跑 AI:隱私、離線與成本本機 AI 換到三件事:資料不出電腦、模型下載後可離線使用、沒有月費;代價是硬體、速度與品質落差,還要自己維護。這篇整理 Ollama、LM Studio、Open WebUI 官方文件對「資料不會離開你的電腦」與離線條件的原文,用官方模型卡的評測數字說明小模型與旗艦的差距,並列出敏感文件摘要、離線翻譯、程式補全、批量處理適合本機,以及哪三種情況該留在雲端。閱讀全文與跑本機模型要什麼電腦跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文,以下只談概念。
權重與計算在本機,不代表整個應用程式都不連網,以下逐項拆開,最後附一個示例。資料截至 2026 年 10 月。
權重與計算在本機,其他不一定
留在裝置上的是權重檔,以及把提示詞變成回答的計算。llama.cpp 的專案說明把目標寫成在各種硬體上做推論,「本機與雲端」都包括;同一套軟體裝在筆電上是本機推論,裝在租來的伺服器上就是雲端。能下載的模型多半公開釋出權重,授權見開放權重(Open Weights)開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文。
外圍的連線另當別論。Ollama 的常見問題寫明,本機執行時他們看不到你的提示詞;改用雲端託管的模型,內容就由他們的服務處理。Microsoft 的 Foundry Local 文件說提示詞與輸出在本機處理,但仍會連網下載模型與元件,回報問題時也可選擇分享紀錄檔。常見的四種連線:
- 下載與更新:模型、軟體與模型目錄。
- 診斷資料:依條款與設定,有些要使用者同意才送出。
- 雲端模型與工具:同一個介面可能混用本機與雲端模型,或呼叫網路搜尋。
- 紀錄同步與分享:存進會同步的資料夾或用了分享功能,就會離開裝置。
記憶體要裝得下兩樣東西
第一道門檻是記憶體。Hugging Face 的效能指南給了估算法:以 16 位元的 bfloat16 或 float16 載入時,每十億個參數約需 2 GB 顯示記憶體。示例換算:80 億參數約需 16 GB,量化成 4 位元約剩四分之一,4 GB 左右。這只是下限,執行時還有其他開銷。
量化(Quantization)量化(Quantization):用較少位元執行模型的取捨模型量化用較低精度表示權重或其他數值,目的是減少記憶體與運算負擔,同時盡量保留任務品質。本文用本機文件分類示範載入、校準與比較流程,區分訓練後量化、量化感知訓練、LoRA 和蒸餾,也解釋為什麼檔案變小不保證回答更快。讀完能核對硬體支援、記憶體組成及實際錯誤,避免只靠位元數挑模型。閱讀全文就是降低每個權重的位元數。llama.cpp 支援 1.5 到 8 位元的整數量化,用來加快推論、降低記憶體用量,代價是精度可能下降。
第二樣是KV 快取(KV Cache)KV 快取(KV Cache)是什麼:為什麼對話越長越吃記憶體KV 快取是語言模型逐個產生 token 時,把前面每個位置在各層算好的 key 與 value 存起來、下一步只補算新 token 的做法。內容用四步示例說明它省下哪些重算,記憶體為何隨上下文長度、層數與注意力頭數成長,PagedAttention、MQA/GQA 與量化各省在哪,以及它和提示詞快取的分工。閱讀全文:逐個產生 token 時,把前面每個位置算好的 key 與 value 存起來,省去重算。依 Hugging Face 的指南,它要存的數值個數是 2 乘以序列長度、注意力頭數、每個頭的維度與層數,所以會隨上下文長度線性增加;同一份指南也指出,讓多個頭共用 key 與 value 的設計(MQA、GQA)能大幅縮小它。Ollama 的文件也提醒,2K 的上下文配 4 個並行請求,等於 8K 的上下文。
記憶體放在哪裡也有差。模型整份放進顯示卡的顯示記憶體通常最快;放不下時,llama.cpp 能讓 CPU 與 GPU 混合推論,Ollama 的 ps 指令會顯示各佔多少比例。另一種加速硬體是 NPU,專做神經網路運算的處理器。
作業系統內建的裝置端模型
Apple 的 Foundation Models framework 讓 App 呼叫 Apple Intelligence 的裝置端模型。開發者文件寫明,可用與否取決於裝置與地區,開啟功能後模型要先下載,之後隨作業系統更新。同一個框架改一行程式,就能把請求送到私密雲端運算(Private Cloud Compute)的伺服器端模型,換得較長的上下文與較強的推理(reasoning),但需要網路。支援文件也說,系統會先分析請求能否在裝置上處理,較複雜的可能交給私密雲端運算。所以「裝置有內建模型」不等於「這個功能用內建模型」,要看個別功能的說明。
Android 的 Gemini Nano 在系統服務 AICore 裡執行。開發者文件寫明,AICore 沒有直接的網際網路存取,連模型下載都經由開放原始碼的 Private Compute Services 轉送;請求彼此隔離,處理完不保留輸入與輸出。
Windows AI APIs 需要配備 NPU 的 Copilot+ PC,Microsoft 寫明資料在裝置上處理,輸入不會送到它的伺服器。Foundry Local 則不是系統內建,而是隨 App 安裝,模型第一次使用時下載並快取,之後可以離線推論。
本機與雲端推論的取捨
雲端推論能用更大的模型與更長的上下文,但每次請求都經過網路,費用多半依用量或方案計算。本機推論省掉網路來回,Foundry Local 的文件也強調沒有每個 token 的費用,代價是硬體、速度與維護都落在你身上。
| 面向 | 本機推論 | 雲端推論 |
|---|---|---|
| 隱私 | 內容在本機計算;下載、診斷與雲端功能仍可能連網 | 內容送到服務商處理,保存與使用看服務條款 |
| 成本結構 | 一次性的硬體加上電費,沒有每個 token 的費用 | 依用量或方案計費,不必自備硬體 |
| 速度 | 沒有網路來回,產生速度看自己的硬體 | 多了網路往返,伺服器硬體通常較強 |
| 維護 | 自己挑模型、更新軟體;系統內建模型隨作業系統更新 | 服務商負責模型與硬體,版本隨服務調整 |
資料有沒有離開裝置:看文件、設定與網路
先讀文件。清楚的說明會分開寫哪些在本機處理、什麼情況會連網、連網時送出什麼。找不到這種說明,就別假設全部在本機。
再看設定。Ollama 可在設定檔加上 disable_ollama_cloud 或設環境變數 OLLAMA_NO_CLOUD=1 關掉雲端功能,重新啟動後生效,之後不能用雲端模型與網路搜尋;服務預設只監聽 127.0.0.1 的 11434 埠,只接受同一台電腦連線。iPhone 可到「設定」→「隱私權與安全性」→「Apple Intelligence 報告」,選過去 15 分鐘或 7 天,匯出送往私密雲端運算的要求紀錄。
最後實際測。斷網仍能用,表示這次計算不需要網路;網路監看工具可以看出哪些程式何時連線。斷網能用不代表恢復連線後不會送出更新檢查或診斷資料,兩種檢查要一起做。
示例:用筆電上的小模型整理會議筆記
以下是示例,未實測。任務是把內部會議的逐字稿整理成決議與待辦,內容不想送到雲端。
- 有網路時下載一個量化過的小模型,用權重大小加上預計的上下文估算記憶體。
- 關閉工具的雲端功能,確認服務只監聽本機位址。
- 斷網,貼入逐字稿,要求只根據內容列出決議、待辦與負責人,找不到負責人就寫「未指定」。
- 逐條對回逐字稿,刪掉原文沒有的項目。
- 恢復連線後,看工具紀錄與網路監看有沒有預期外的連線。
預期得到一份短清單,每項都能在逐字稿找到出處。漏掉後半段,可能是超出上下文視窗,Apple 的開發者文件建議分段處理再合併;電腦突然變慢,可能是記憶體不夠、部分模型退到 CPU,可縮短上下文或換更小的版本;寫出原文沒有的待辦,是模型品質問題,雲端一樣會發生。
其他與推論資源相關的名詞,見AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- llama.cpp:專案說明(README,本機與雲端推論、整數量化、CPU+GPU 混合推論) · 查證日期:
- Ollama:FAQ(本機執行與雲端模型、停用雲端功能、監聽位址、上下文與並行請求的記憶體) · 查證日期:
- Hugging Face Transformers:Optimizing LLMs for Speed and Memory(權重記憶體估算、key-value cache 大小) · 查證日期:
- Apple Developer:Foundation Models(框架總覽) · 查證日期:
- Apple Developer:Generating content and performing tasks with Foundation Models(可用性、模型下載、分段處理) · 查證日期:
- Apple Developer:SystemLanguageModel(裝置端模型隨作業系統更新) · 查證日期:
- Apple Developer:Adding server-side intelligence with Private Cloud Compute · 查證日期:
- Apple 支援:iPhone 上的 Apple Intelligence 與隱私權(私密雲端運算、Apple Intelligence 報告) · 查證日期:
- Android Developers:Gemini Nano(AICore 架構與隱私說明) · 查證日期:
- Android Developers:Gemini Nano 繁體中文版(Google 以 AI 翻譯;「裝置端」「在本機執行」用語) · 查證日期:
- Microsoft Learn:What is Foundry Local?(本機處理與仍會連網的情況) · 查證日期:
- Microsoft Learn:FAQs about using AI in Windows apps(Windows AI APIs 與 Foundry Local 的資料處理) · 查證日期: