生活分享

LM Studio 入門:圖形介面跑本機模型

LM Studio 是一套桌面軟體,不用打指令就能在自己的電腦下載並執行開放權重模型。本文照官方文件整理系統需求、在 Discover 分頁搜尋與下載 GGUF 或 MLX 模型、對話時的上下文視窗與 GPU offload 設定、把本機伺服器開在埠 1234 的 OpenAI 相容端點,以及使用條款對個人與內部商業用途的說法。

更新日期: 閱讀時間約 7 分鐘

自繪插圖:一個圓角視窗分成三欄,左欄是下載中的檔案、中間是對話框、右欄是一個接出線路的埠,底下有一條把三者串起來的線。
圖片:Mokaair (© Mokaair)

想在自己的電腦跑 模型,又不想碰終端機,LM Studio 是最接近「裝好就能用」的一條路:一套桌面軟體,在同一個視窗裡搜尋、下載模型、對話,也能把模型開成本機 API 伺服器。

這篇照官方文件走完一輪:對照系統需求、下載第一個模型、調整上下文視窗與 GPU offload,最後把本機伺服器打開讓別的程式呼叫。介面位置以官網當天版本為準。

LM Studio 是什麼:App、llmster 與 lms 三件套

官方文件的說法是讓你「在本機執行 Llama、DeepSeek、Qwen、Phi 等」,支援 macOS、Windows 與 Linux。官方把自家工具拆成三個,名字很像但角色不同:

  • LM Studio(桌面 App):圖形介面,能搜尋下載模型、對話、上傳文件對話、設定參數、跑本機伺服器、接 MCP 伺服器,文件說這是最容易的起點。
  • llmster(無介面的背景服務):不必裝桌面 App,文件舉的場景是 Linux 伺服器、沒有螢幕的 GPU 機器、CI 流程。
  • lms(命令列工具):兩者都能指揮,隨 App 或 llmster 一起裝好;文件寫下指令時 LM Studio 沒開著會自動啟動。

先對照官方系統需求

這份需求講的是軟體跑不跑得動,不是模型跑不跑得動。官方文件目前列的是:

  • macOS:晶片需 Apple Silicon(文件寫 M1/M2/M3/M4),系統需 macOS 14.0 或更新,建議 16GB 以上記憶體(RAM);8GB 的 Mac 文件寫仍有機會使用,但要挑小模型,且不支援 Intel 版 Mac。
  • Windows:x64 與 ARM(文件點名 Snapdragon X Elite)都支援;x64 需 CPU 支援 AVX2,建議至少 16GB 記憶體、4GB 專用顯示記憶體(VRAM)。
  • Linux:x64 與 ARM64 都支援,以 AppImage 發布,需要 Ubuntu 20.04 或更新,比 22 更新的版本文件說測試不足。

官方沒有給「幾 B 的模型對應幾 GB 記憶體」的對照表,模型要多少記憶體得看檔案大小與上下文視窗。

下載與安裝:下載頁有兩個東西

查證當天的下載頁放了兩個入口:LM Studio Bionic(描述是「為開放模型打造的代理(Agent)」),以及 LM Studio 本身(「含對話介面與可程式化的 API」)。這篇談後者,下載頁當天對 Windows 顯示的版本是 0.4.24。沒有螢幕的機器改裝 llmster。

安裝 llmster(官網下載頁的 Mac 與 Linux 指令) · bash
curl -fsSL https://lmstudio.ai/install.sh | bash
安裝 llmster(官網下載頁的 Windows 指令) · powershell
irm https://lmstudio.ai/install.ps1 | iex

找模型並下載:Discover 分頁接 Hugging Face

App 內建模型下載器,官方文件寫它「讓你從 Hugging Face 下載任何支援的模型」。到 Discover 分頁可以用關鍵字搜尋(文件舉例 llama、gemma),也可以貼上 user/model 字串或完整網址。

同一個模型底下常會冒出 Q3_K_S、Q_8 之類好幾個選項。官方文件說這些是同一個模型的複本,只是保真度不同,Q 代表「量化」,把檔案壓小、換取一部分品質。文件的建議只有一句:機器夠力就選 4-bit 或以上。

格式上,官網的模型目錄頁把模型分成 GGUF 與 MLX 兩種篩選,首頁則寫執行環境底層是 MLX 與 llama.cpp。別處抓好的 GGUF 檔可用 lms import 匯入(文件標示為實驗性),模型預設放在 ~/.lmstudio/models 底下。

對話與參數:上下文視窗、GPU offload

模型抓好後到 Chat 分頁,打開模型載入器選一個模型,載入前可先改。官方文件對「載入模型」的定義是:配置記憶體來放模型權重與其他參數。

想固定某個模型的設定,文件說到 My Models 分頁按齒輪圖示編輯預設參數,列的三個理由是:設定 GPU offload 比例、設定上下文視窗大小、要不要用 Flash Attention。

找不到這些選項通常是模式問題。文件說介面分成 User 與 Developer:User 只顯示對話介面、其他自動設定;Developer 開放可調的載入與推論參數,在 Settings 開啟。

對話裡也能附檔案。官方文件寫可以附 .docx、.pdf、.txt:內容塞得進上下文視窗時整份放進對話,太長時改用(RAG)。官方提醒這招時好時壞,查詢時把預期會出現在原文的名詞寫進去比較準。

本機伺服器:埠 1234 與 OpenAI 相容端點

官方文件說可以從 Developer 分頁把本機模型開成 API 伺服器,只開在 localhost 或開放給區域網路都行,做法是打開 Start server 開關。也可以走終端機:

用 lms 下載模型、載入並啟動本機伺服器(官方文件範例) · bash
lms get openai/gpt-oss-20b
lms load openai/gpt-oss-20b
lms server start

文件寫伺服器啟動後監聽在 localhost 的埠 1234。OpenAI 相容端點在 v1 底下,文件列了 /v1/models、/v1/responses、/v1/chat/completions、/v1/ 與 /v1/completions。現有的 OpenAI 客戶端程式可以沿用,只要把 base URL 換掉。

用 curl 呼叫本機的 OpenAI 相容端點(官方文件範例) · bash
curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "use the model identifier from LM Studio here",
    "messages": [{"role": "user", "content": "Say this is a test"}],
    "temperature": 0.7
  }'
把 OpenAI 的 Python 客戶端指向本機(官方文件範例) · python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1"
)
# ... the rest of your code ...

埠與範圍都能改。文件寫 lms server start 可以帶 --port 指定埠(範例是 --port 3000)、--cors 開啟跨來源支援、--bind 指定綁定位址,預設 127.0.0.1 只聽 localhost,改成 0.0.0.0 會聽所有介面,官方在後兩個旗標旁都放了警告。

驗證預設是關的。官方文件寫 LM Studio 預設不要求 API 請求附帶驗證;要改成只接受有效權杖,得在 Server Settings 打開開關,需要 LM Studio 0.4.0 或更新版本。

三個抽象方塊分別代表 LM Studio 的下載模型、對話與本機伺服器畫面,箭頭標出哪一段需要網路、哪一段留在本機。
從左到右看:只有搜尋與下載模型那一段需要網路,載入模型之後的對話與本機伺服器都在你的電腦裡跑,伺服器監聽在埠 1234。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

三個並排的抽象方塊代表 LM Studio 的三個使用階段。第一個是 Discover 分頁:搜尋關鍵字或貼上 Hugging Face 網址、挑選 GGUF 或 MLX 格式與量化版本、把檔案存到 ~/.lmstudio/models,這一段需要網路。第二個是 Chat 分頁:把模型載入到記憶體、設定上下文視窗與 GPU offload、開始對話並可附加文件檔案。第三個是 Developer 分頁:打開 Start server 開關或執行 lms server start、伺服器監聽在 localhost 的埠 1234、其他程式用 OpenAI 相容端點呼叫。第二與第三個階段被一個虛線框圈起來,標示為在你的電腦裡執行、可以離線。底部說明資料流:只有第一步需要網路,模型下載完成後,第二步與第三步的對話與 API 請求都留在本機。

介面位置照 lmstudio.ai 官方文件,2026 年 9 月查證;版本更新後位置可能改變,以官網為準。
功能在哪裡備註
搜尋與下載模型Discover 分頁來源是 Hugging Face
匯入已下載的 GGUF終端機的 lms import文件標示為實驗性功能
GPU offload 與上下文視窗My Models 分頁的齒輪圖示同處可設 Flash Attention
開本機伺服器Developer 分頁的 Start server或用 lms server start
切換執行環境版本終端機的 lms runtime可列出、下載與更新

隱私與離線:官方文件怎麼寫

官方的「離線運作」頁講得很直接:一般情況下 LM Studio 不需要網路就能運作,包含與模型對話、與文件對話、跑本機伺服器。文件逐項寫:用已下載的模型時,你輸入的東西不會離開裝置;做 RAG 時文件留在你的機器上;伺服器的請求也留在本機。

要連網的操作文件也列了:搜尋模型、下載新模型、內建目錄顯示統計、下載執行環境、檢查更新。想完全離線,就先把模型抓好。

隱私權政策則寫 LM Studio「處理盡可能少的資訊,而且可以完全在裝置上離線運作」,除了雲端服務外不處理 App 裡的對話或文件內容。

授權與和 Ollama 的差別

LM Studio 桌面版走的是自家使用條款,不是開源授權;查證當天條款頁的版本日期是 2026 年 8 月 23 日,立約公司是 Element Labs, Inc.。條文給的是「非專屬、不可轉讓」的授權,供你「個人與/或內部商業用途」使用,並禁止再授權、散布、當成軟體即服務對外提供與還原工程。

所以「能不能商用」沒有一句話的答案:授權範圍是個人與內部商業用途,外部散布與軟體即服務在限制項目裡,放進公司流程前請讀條款原文與官網企業方案頁,以官網為準。命令列工具 lms 則單純,文件寫它採 MIT 授權。

和 Ollama 相比,官方文件撐得住的差別有三點:介面上 LM Studio 本身就是圖形介面;格式上官網目錄用 GGUF 與 MLX 兩種篩選;授權上 Ollama 的 LICENSE 是 MIT,LM Studio 則是自家條款。速度與相容性官方沒有比較,這篇不猜。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享