生活分享
LM Studio 入門:圖形介面跑本機模型
LM Studio 是一套桌面軟體,不用打指令就能在自己的電腦下載並執行開放權重模型。本文照官方文件整理系統需求、在 Discover 分頁搜尋與下載 GGUF 或 MLX 模型、對話時的上下文視窗與 GPU offload 設定、把本機伺服器開在埠 1234 的 OpenAI 相容端點,以及使用條款對個人與內部商業用途的說法。
更新日期: 閱讀時間約 7 分鐘

想在自己的電腦跑 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 模型,又不想碰終端機,LM Studio 是最接近「裝好就能用」的一條路:一套桌面軟體,在同一個視窗裡搜尋、下載模型、對話,也能把模型開成本機 API 伺服器。
這篇照官方文件走完一輪:對照系統需求、下載第一個模型、調整上下文視窗與 GPU offload,最後把本機伺服器打開讓別的程式呼叫。介面位置以官網當天版本為準。
LM Studio 是什麼:App、llmster 與 lms 三件套
官方文件的說法是讓你「在本機執行 Llama、DeepSeek、Qwen、Phi 等大型語言模型大型語言模型(Large Language Model)是什麼大型語言模型從大量資料學習語言與其他模式,依上下文處理文字、生成回答或提出工具請求。本文以失物招領紀錄為例,說明 token、參數、預訓練、提示詞與上下文如何配合,區分模型、聊天產品、搜尋與外部工具,並解釋為何流暢答案仍需查證。讀完能更精確描述任務,知道何時該補檔案、要求工具計算或保留無法確認的答案。閱讀全文」,支援 macOS、Windows 與 Linux。官方把自家工具拆成三個,名字很像但角色不同:
- LM Studio(桌面 App):圖形介面,能搜尋下載模型、對話、上傳文件對話、設定參數、跑本機伺服器、接 MCP 伺服器,文件說這是最容易的起點。
- llmster(無介面的背景服務):不必裝桌面 App,文件舉的場景是 Linux 伺服器、沒有螢幕的 GPU 機器、CI 流程。
- lms(命令列工具):兩者都能指揮,隨 App 或 llmster 一起裝好;文件寫下指令時 LM Studio 沒開著會自動啟動。
先對照官方系統需求
這份需求講的是軟體跑不跑得動,不是模型跑不跑得動。官方文件目前列的是:
- macOS:晶片需 Apple Silicon(文件寫 M1/M2/M3/M4),系統需 macOS 14.0 或更新,建議 16GB 以上記憶體(RAM);8GB 的 Mac 文件寫仍有機會使用,但要挑小模型,且不支援 Intel 版 Mac。
- Windows:x64 與 ARM(文件點名 Snapdragon X Elite)都支援;x64 需 CPU 支援 AVX2,建議至少 16GB 記憶體、4GB 專用顯示記憶體(VRAM)。
- Linux:x64 與 ARM64 都支援,以 AppImage 發布,需要 Ubuntu 20.04 或更新,比 22 更新的版本文件說測試不足。
官方沒有給「幾 B 的模型對應幾 GB 記憶體」的對照表,模型要多少記憶體得看檔案大小與上下文視窗。
跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文
下載與安裝:下載頁有兩個東西
查證當天的下載頁放了兩個入口:LM Studio Bionic(描述是「為開放模型打造的代理(Agent)」),以及 LM Studio 本身(「含對話介面與可程式化的 API」)。這篇談後者,下載頁當天對 Windows 顯示的版本是 0.4.24。沒有螢幕的機器改裝 llmster。
curl -fsSL https://lmstudio.ai/install.sh | bashirm https://lmstudio.ai/install.ps1 | iex找模型並下載:Discover 分頁接 Hugging Face
App 內建模型下載器,官方文件寫它「讓你從 Hugging Face 下載任何支援的模型」。到 Discover 分頁可以用關鍵字搜尋(文件舉例 llama、gemma),也可以貼上 user/model 字串或完整網址。
同一個模型底下常會冒出 Q3_K_S、Q_8 之類好幾個選項。官方文件說這些是同一個模型的複本,只是保真度不同,Q 代表「量化」,把檔案壓小、換取一部分品質。文件的建議只有一句:機器夠力就選 4-bit 或以上。
GGUF 量化怎麼選:Q4_K_M、Q8_0、F16 的檔名、檔案大小與記憶體GGUF 量化怎麼選:Q4_K_M、Q8_0、F16 的檔名、檔案大小與記憶體GGUF 檔名裡的 Q4_K_M、Q8_0、F16 是量化類型,決定檔案多大、要多少記憶體。這篇照 llama.cpp 與 ggml 官方文件講 GGUF 格式與命名規則、各類型的每權重位元數,用官方對照表(Llama 3.1 8B 從 14.96 GiB 到 4.58 GiB)與 Ollama、Hugging Face 上同一個模型的不同量化大小說明怎麼選,並附官方的轉檔與量化指令。閱讀全文
量化(Quantization):用較少位元執行模型的取捨量化(Quantization):用較少位元執行模型的取捨模型量化用較低精度表示權重或其他數值,目的是減少記憶體與運算負擔,同時盡量保留任務品質。本文用本機文件分類示範載入、校準與比較流程,區分訓練後量化、量化感知訓練、LoRA 和蒸餾,也解釋為什麼檔案變小不保證回答更快。讀完能核對硬體支援、記憶體組成及實際錯誤,避免只靠位元數挑模型。閱讀全文
格式上,官網的模型目錄頁把模型分成 GGUF 與 MLX 兩種篩選,首頁則寫執行環境底層是 MLX 與 llama.cpp。別處抓好的 GGUF 檔可用 lms import 匯入(文件標示為實驗性),模型預設放在 ~/.lmstudio/models 底下。
Hugging Face 入門:找模型、看授權、下載Hugging Face 入門:找模型、看授權、下載Hugging Face 是開放模型最集中的地方。這篇從註冊與建立存取權杖開始,帶你讀懂模型頁的模型卡、Files and versions 與授權標籤,用篩選欄找到 GGUF 或特定授權的檔案,處理需要先同意條款的 gated 模型,再用 hf 指令與三行 Python 把權重下載到自己的電腦,並說明快取位置、Spaces 與官網當天的方案月費。閱讀全文
對話與參數:上下文視窗、GPU offload
模型抓好後到 Chat 分頁,打開模型載入器選一個模型,載入前可先改參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文。官方文件對「載入模型」的定義是:配置記憶體來放模型權重與其他參數。
想固定某個模型的設定,文件說到 My Models 分頁按齒輪圖示編輯預設參數,列的三個理由是:設定 GPU offload 比例、設定上下文視窗大小、要不要用 Flash Attention。
找不到這些選項通常是模式問題。文件說介面分成 User 與 Developer:User 只顯示對話介面、其他自動設定;Developer 開放可調的載入與推論參數,在 Settings 開啟。
對話裡也能附檔案。官方文件寫可以附 .docx、.pdf、.txt:內容塞得進上下文視窗時整份放進對話,太長時改用檢索增強生成檢索增強生成(RAG)是什麼:讓回答附上可查的依據檢索增強生成會先從外部資料找出相關內容,再交給語言模型組織回答。本文以活動報名規章的問答為例,拆解建索引、檢索、生成與來源核對,說明它和搜尋、微調的差別,也解釋為什麼有引用仍可能答錯。讀完能判斷問題出在資料未更新、文件沒找齊,還是模型把證據解讀過頭,並知道什麼情況應保留不知道的答案。閱讀全文(RAG)。官方提醒這招時好時壞,查詢時把預期會出現在原文的名詞寫進去比較準。
上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文
本機伺服器:埠 1234 與 OpenAI 相容端點
官方文件說可以從 Developer 分頁把本機模型開成 API 伺服器,只開在 localhost 或開放給區域網路都行,做法是打開 Start server 開關。也可以走終端機:
lms get openai/gpt-oss-20b
lms load openai/gpt-oss-20b
lms server start文件寫伺服器啟動後監聽在 localhost 的埠 1234。OpenAI 相容端點在 v1 底下,文件列了 /v1/models、/v1/responses、/v1/chat/completions、/v1/embeddings嵌入向量(Embedding)是什麼:把內容放進可比較的空間嵌入向量是模型把文字等內容轉成一組數值的表示方式,常用於語意搜尋、分類與分群。本文用「下雨可以去哪裡」的查詢拆解編碼、相似度與候選結果,說明向量距離不等於真假、每一維也未必能直接命名,並介紹模型版本、語言能力與長文截斷的影響。讀完能分清嵌入向量、向量資料庫與生成答案各自負責什麼。閱讀全文 與 /v1/completions。現有的 OpenAI 客戶端程式可以沿用,只要把 base URL 換掉。
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "use the model identifier from LM Studio here",
"messages": [{"role": "user", "content": "Say this is a test"}],
"temperature": 0.7
}'from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1234/v1"
)
# ... the rest of your code ...埠與範圍都能改。文件寫 lms server start 可以帶 --port 指定埠(範例是 --port 3000)、--cors 開啟跨來源支援、--bind 指定綁定位址,預設 127.0.0.1 只聽 localhost,改成 0.0.0.0 會聽所有介面,官方在後兩個旗標旁都放了警告。
驗證預設是關的。官方文件寫 LM Studio 預設不要求 API 請求附帶驗證;要改成只接受有效權杖,得在 Server Settings 打開開關,需要 LM Studio 0.4.0 或更新版本。
閱讀完整文字說明
三個並排的抽象方塊代表 LM Studio 的三個使用階段。第一個是 Discover 分頁:搜尋關鍵字或貼上 Hugging Face 網址、挑選 GGUF 或 MLX 格式與量化版本、把檔案存到 ~/.lmstudio/models,這一段需要網路。第二個是 Chat 分頁:把模型載入到記憶體、設定上下文視窗與 GPU offload、開始對話並可附加文件檔案。第三個是 Developer 分頁:打開 Start server 開關或執行 lms server start、伺服器監聽在 localhost 的埠 1234、其他程式用 OpenAI 相容端點呼叫。第二與第三個階段被一個虛線框圈起來,標示為在你的電腦裡執行、可以離線。底部說明資料流:只有第一步需要網路,模型下載完成後,第二步與第三步的對話與 API 請求都留在本機。
| 功能 | 在哪裡 | 備註 |
|---|---|---|
| 搜尋與下載模型 | Discover 分頁 | 來源是 Hugging Face |
| 匯入已下載的 GGUF | 終端機的 lms import | 文件標示為實驗性功能 |
| GPU offload 與上下文視窗 | My Models 分頁的齒輪圖示 | 同處可設 Flash Attention |
| 開本機伺服器 | Developer 分頁的 Start server | 或用 lms server start |
| 切換執行環境版本 | 終端機的 lms runtime | 可列出、下載與更新 |
隱私與離線:官方文件怎麼寫
官方的「離線運作」頁講得很直接:一般情況下 LM Studio 不需要網路就能運作,包含與模型對話、與文件對話、跑本機伺服器。文件逐項寫:用已下載的模型時,你輸入的東西不會離開裝置;做 RAG 時文件留在你的機器上;伺服器的請求也留在本機。
要連網的操作文件也列了:搜尋模型、下載新模型、內建目錄顯示統計、下載執行環境、檢查更新。想完全離線,就先把模型抓好。
隱私權政策則寫 LM Studio「處理盡可能少的資訊,而且可以完全在裝置上離線運作」,除了雲端服務外不處理 App 裡的對話或文件內容。
為什麼要在自己電腦跑 AI:隱私、離線與成本為什麼要在自己電腦跑 AI:隱私、離線與成本本機 AI 換到三件事:資料不出電腦、模型下載後可離線使用、沒有月費;代價是硬體、速度與品質落差,還要自己維護。這篇整理 Ollama、LM Studio、Open WebUI 官方文件對「資料不會離開你的電腦」與離線條件的原文,用官方模型卡的評測數字說明小模型與旗艦的差距,並列出敏感文件摘要、離線翻譯、程式補全、批量處理適合本機,以及哪三種情況該留在雲端。閱讀全文
授權與和 Ollama 的差別
LM Studio 桌面版走的是自家使用條款,不是開源授權;查證當天條款頁的版本日期是 2026 年 8 月 23 日,立約公司是 Element Labs, Inc.。條文給的是「非專屬、不可轉讓」的授權,供你「個人與/或內部商業用途」使用,並禁止再授權、散布、當成軟體即服務對外提供與還原工程。
所以「能不能商用」沒有一句話的答案:授權範圍是個人與內部商業用途,外部散布與軟體即服務在限制項目裡,放進公司流程前請讀條款原文與官網企業方案頁,以官網為準。命令列工具 lms 則單純,文件寫它採 MIT 授權。
和 Ollama 相比,官方文件撐得住的差別有三點:介面上 LM Studio 本身就是圖形介面;格式上官網目錄用 GGUF 與 MLX 兩種篩選;授權上 Ollama 的 LICENSE 是 MIT,LM Studio 則是自家條款。速度與相容性官方沒有比較,這篇不猜。
Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 是在自己電腦跑本機 AI 的入門工具,官網下載頁寫 macOS 要 14 Sonoma 或更新版本、Windows 要 10 或更新版本。這篇照官方文件走完安裝、第一次對話、看懂模型庫的標籤與大小、用 ollama ps 確認模型跑在顯示卡還是 CPU,再從 curl 與 Python 呼叫本機 11434 埠的 API,最後說清楚結尾帶 cloud 的標籤是雲端模型、怎麼關掉。閱讀全文
在自己電腦跑 DeepSeek:Ollama 蒸餾版教學在自己電腦跑 DeepSeek:Ollama 蒸餾版教學Ollama 官網目前列出 deepseek-r1 的 1.5b、7b、8b、14b、32b、70b 與 671b 七個標籤,下載大小從 1.1GB 到 404GB。這篇用官方文件帶你在 Windows 或 Mac 裝好 Ollama、拉一個蒸餾版開始對話,再接一次本機 11434 埠的 API 呼叫,並說清楚蒸餾與量化是什麼、蒸餾版和網頁版完整模型差在哪、MIT 授權實際允許什麼。閱讀全文
開放權重(Open Weights):能下載模型,還要確認什麼開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- LM Studio 官方首頁(產品說明與底層執行環境) · 查證日期:
- LM Studio 下載頁(版本、AppImage 與 llmster 安裝指令) · 查證日期:
- LM Studio 說明文件:系統需求 · 查證日期:
- LM Studio 說明文件:開始使用 · 查證日期:
- LM Studio 說明文件:下載模型 · 查證日期:
- LM Studio 說明文件:App、llmster 與 lms 的差別 · 查證日期:
- LM Studio 說明文件:與文件對話(RAG) · 查證日期:
- LM Studio 說明文件:離線運作 · 查證日期:
- LM Studio 說明文件:每個模型的預設載入參數 · 查證日期:
- LM Studio 說明文件:匯入模型 · 查證日期:
- LM Studio 說明文件:User 與 Developer 模式 · 查證日期:
- LM Studio 說明文件:lms 命令列工具 · 查證日期:
- LM Studio 說明文件:lms server start 的旗標 · 查證日期:
- LM Studio 說明文件:本機 LLM API 伺服器 · 查證日期:
- LM Studio 說明文件:API 權杖與驗證 · 查證日期:
- LM Studio 說明文件:OpenAI 相容端點 · 查證日期:
- LM Studio 模型目錄(GGUF 與 MLX 格式篩選) · 查證日期:
- LM Studio 桌面版使用條款(2026 年 8 月 23 日版) · 查證日期:
- LM Studio 隱私權政策 · 查證日期:
- Ollama 的 LICENSE 檔(GitHub,MIT 授權) · 查證日期: