生活分享

為 AI 選顯示卡:顯示記憶體優先與預算配置

為 AI 選顯卡(顯卡 AI 怎麼挑)的判斷順序:顯示記憶體容量第一、再看官方支援清單、最後才是頻寬與世代。用 Ollama 硬體支援頁與上下文分級、llama.cpp 的後端清單,加上 NVIDIA、AMD 與 Apple 官方規格頁的容量與頻寬,說明桌機、筆電與 Apple Silicon 的取捨,以及電源、機殼與二手卡要先確認什麼。不寫通路價格。

更新日期: 閱讀時間約 7 分鐘

抽象插圖:模型檔案方塊落進一個顯示記憶體容器,右邊較小的容器裝不下而溢出
圖片:Mokaair (© Mokaair)

為本機模型挑顯示卡,判斷順序跟打遊戲不一樣:先看顯示記憶體(VRAM)容量能不能把模型整個裝進去,再看官方支援清單有沒有這張卡,最後才輪到記憶體頻寬與世代。模型放不進顯示記憶體就會有一部分落到系統記憶體,換更快的世代也救不回來。搜「顯卡 」比規格表之前,先把這個順序記住。

這篇用 2026 年 9 月 14 日的官方頁面,帶你做三件事:對照 Ollama 與 llama.cpp 的硬體支援清單、用模型檔案大小加上下文估出需要的顯示記憶體級距、再用 NVIDIA 與 AMD 規格頁比較桌機、筆電與 Apple Silicon。全文不寫通路價格。

為什麼顯示記憶體排在第一順位

Ollama 的常見問題頁說明,載入模型時它會先評估需要多少顯示記憶體:放得進某一張 GPU 就整個載上去,可以少掉資料在 PCI 匯流排上搬動;放不進單卡才拆開分散到多張 GPU。要看實際跑在哪裡就用 ollama ps,PROCESSOR 欄會寫 100% GPU、100% CPU,或像 48%/52% CPU/GPU 這種被拆成兩半的比例。

確認模型載入到哪裡(docs.ollama.com 的指令) · bash
ollama ps

支援清單:官方文件說哪些卡跑得動

顯示記憶體再大,軟體不支援也是白搭。Ollama 的硬體支援頁把條件寫成一張表:NVIDIA 要 compute capability 5.0 以上、驅動程式 550 版以上,其中 5.0 到 6.2 的卡另外要求 570 版以上;表上 GeForce RTX 50 系列是 12.0。同頁也附了 NVIDIA 官方的 CUDA GPU 查詢網址,可以自己對型號。

AMD 有兩條路。ROCm 這條在 Linux 需要 ROCm v7 驅動,名單裡有 Radeon RX 9070 XT、9060 XT、7900 XTX,Windows 名單短一截。另外 Ollama 在 Windows 與 Linux 用 Vulkan 提供支援,文件說後端裝好就預設開啟,並附了 Intel 與 AMD 的 Linux 驅動說明。Apple 則是一句話:透過 Metal API 支援 GPU 加速。

llama.cpp 的 README 列出後端與目標裝置:CUDA 對 NVIDIA GPU、HIP 對 AMD GPU、Metal 對 Apple Silicon、SYCL 對 Intel GPU、Vulkan 對 GPU 通用。建置文件補充,SYCL 支援的 Intel GPU 含 Arc 系列與 iGPU,執行時可以用 --list-devices 看有哪些裝置。

  • NVIDIA:Ollama 要 compute capability 5.0 以上、驅動 550 版以上;llama.cpp 走 CUDA。
  • AMD:Linux 要 ROCm v7,另有 Vulkan;llama.cpp 走 HIP。
  • Apple:兩邊都走 Metal,macOS 上預設開啟。
  • Intel:Ollama 歸在 Vulkan,llama.cpp 用 SYCL。
llama.cpp 官方建置文件:列出可用的後端裝置 · bash
./build/bin/llama-cli --list-devices

顯示記憶體要抓多少:檔案大小加上下文

起點是模型檔案大小,ollama.com/library 的標籤頁直接標出來。查證當天:gemma3:12b 是 8.1GB、gemma3:27b 是 17GB、qwen3:32b 是 20GB、gpt-oss:20b 是 14GB、gpt-oss:120b 是 65GB。換量化標籤差很多:gemma3:27b 的 q4_K_M 是 17GB,q8_0 是 30GB。

檔案大小只是下限,還要留空間給上下文視窗。Ollama 的文件寫明它依顯示記憶體給預設值:小於 24 GiB 給 4k、24 到 48 GiB 給 32k、48 GiB 以上給 256k。文件也提醒,網頁搜尋、代理(Agent)與寫程式這類任務至少要設到 64000 個 token,調大就會吃掉更多記憶體。

把預設上下文長度調高(docs.ollama.com/context-length 的寫法) · bash
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

官方沒有給「幾 GB 可以跑幾 B」的公式,能引的是兩個省記憶體的開關:Flash Attention 會隨上下文變大明顯降低記憶體用量,支援時自動啟用;K/V 快取的量化型別預設是 f16,改成 q8_0 大約只用一半、品質影響通常不明顯,改成 q4_0 大約用四分之一。文件沒寫的數字就以官網為準。

量化標籤決定模型塞不塞得進你的卡,想弄懂 q4_K_M 與 q8_0 的差別可以先看 與 ;名稱後面的 4b、27b 是什麼,在 。

選顯示卡的決策順序圖:從模型檔案大小、顯示記憶體、官方支援清單、頻寬到電源機殼,共五個步驟
由上往下走:先決定要跑的模型與檔案大小,再把顯示記憶體、官方支援清單、頻寬與電源逐一過一次,任何一關不過就往回換選擇。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

由上往下五個步驟。第一步先決定要跑哪個模型,ollama.com/library 的標籤頁直接寫檔案大小,例如 gemma3:12b 是 8.1GB、gpt-oss:20b 是 14GB。第二步確認顯示記憶體裝得下檔案加上下文,Ollama 依顯示記憶體給預設上下文,小於 24 GiB 給 4k;裝不下時 ollama ps 的 PROCESSOR 欄不會是 100% GPU。第三步查官方支援清單,NVIDIA 要 compute capability 5.0 以上與驅動 550 版以上,AMD 在 Linux 要 ROCm v7 或改走 Vulkan,Apple 走 Metal,Intel 在 llama.cpp 走 SYCL。第四步同容量才比記憶體頻寬與世代,RTX 5090 是 32 GB 搭 1792 GB/sec,RX 9070 XT 是 16 GB 搭 640 GB/s。第五步確認電源與機殼,官方規格頁寫 RTX 5090 建議系統電源 1000 W,RX 9070 XT 最低電源供應器建議 750W。任何一關不過就回到上一步換選擇。

桌機、筆電與 Apple Silicon 的取捨

桌機卡看官網比較頁就好。NVIDIA GeForce 規格比較頁上,RTX 5090 是 32 GB GDDR7、記憶體頻寬 1792 GB/sec;RTX 5080 是 16 GB、960 GB/sec;RTX 5070 是 12 GB、672 GB/sec;RTX 5060 Ti 官網寫成 16 GB / 8 GB,頻寬 448 GB/sec。

AMD 官方規格頁上,Radeon RX 9070 XT 與 RX 9070 都是 16 GB GDDR6、記憶體頻寬最高 640 GB/s;RX 9070 GRE 是 12 GB、432 GB/s;RX 9060 XT 同時列出 16 GB 與 8 GB 兩個版本,頻寬都是 320 GB/s。

筆電的同名卡是另一張卡。NVIDIA 筆電 50 系列規格頁寫著,RTX 5090 Laptop GPU 是 24 GB GDDR7、頻寬 896 GB/s,桌機版則是 32 GB、1792 GB/sec。挑筆電等於一開始就接受容量與頻寬同時打折。

Apple Silicon 換一種算法:GPU 與 CPU 共用統一記憶體。apple.com/tw 的規格頁上,Mac mini 的 M5 Pro 機型最高 64GB 統一記憶體、頻寬 307GB/s;Mac Studio 的 M5 Ultra 最高 512GB、1.2TB/s。容量遠超過任何一張消費級顯示卡。

顯示記憶體級距對照 docs.ollama.com 的預設上下文分級與 ollama.com/library 標籤頁的檔案大小,查證於 2026 年 9 月;跑不跑得動還要看上下文設定與 K/V 快取型別,以官網為準。
顯示記憶體Ollama 預設上下文檔案大小相符的模型標籤提醒
8 GB小於 24 GiB:4kgemma3:4b 3.3GB要再留上下文空間
12 GB小於 24 GiB:4kgemma3:12b 8.1GB上下文設 64000 要重估
16 GB小於 24 GiB:4kgpt-oss:20b 14GB同名有 8 GB 版,別買錯
24 到 32 GB24 到 48 GiB:32kgemma3:27b 17GB、qwen3:32b 20GB消費級單卡到 32 GB
48 GB 以上48 GiB 以上:256kgpt-oss:120b 65GB靠多卡或統一記憶體

電源、機殼與二手卡要先確認什麼

電源與機殼是最容易漏算的兩筆。NVIDIA 規格比較頁直接列出「建議系統電源」:RTX 5090 是 1000 W、RTX 5080 是 850 W、RTX 5070 是 650 W,註解說明這是以搭配 Intel Core i9-10900K 的電腦為基準,配置不同時較低瓦數也可能足夠;AMD 規格頁的「最低電源供應器建議」則是 Radeon RX 9070 XT 750W、RX 9060 XT 450W。

機殼看長度與槽位。NVIDIA 規格頁只有創始版(Founders Edition)列得出尺寸,RTX 5090 是長 304 mm、寬 137 mm、佔 2 個擴充槽;同頁明講規格代表創始版或參考設計,板卡廠出貨的實際規格可能不同。先量機殼,再去板卡廠頁面確認。

二手卡只看官方文件驗得到的三件事:型號在不在官方支援清單上、那個型號的顯示記憶體容量以官網規格頁為準、電源接頭與建議瓦數對不對得上現有的電源供應器。賣家說法與網路上的對照表都不算數。

顯示卡只是本機方案的一段成本,還有電費與你的時間。拿不定主意就把同樣的工作量放到雲端算一次再決定;要跑圖片生成,另外確認那套工具的官方需求。

  • 生活分享

    Claude Code、Codex 搭本機模型:兩種接法怎麼選

    Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。

  • 生活分享

    把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器

    用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。

  • 生活分享

    把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原

    Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。

  • 生活分享

    Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單

    Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。

最新旅遊情報攻略

資料來源

生活分享