生活分享
為 AI 選顯示卡:顯示記憶體優先與預算配置
為 AI 選顯卡(顯卡 AI 怎麼挑)的判斷順序:顯示記憶體容量第一、再看官方支援清單、最後才是頻寬與世代。用 Ollama 硬體支援頁與上下文分級、llama.cpp 的後端清單,加上 NVIDIA、AMD 與 Apple 官方規格頁的容量與頻寬,說明桌機、筆電與 Apple Silicon 的取捨,以及電源、機殼與二手卡要先確認什麼。不寫通路價格。
更新日期: 閱讀時間約 7 分鐘

為本機模型挑顯示卡,判斷順序跟打遊戲不一樣:先看顯示記憶體(VRAM)容量能不能把模型整個裝進去,再看官方支援清單有沒有這張卡,最後才輪到記憶體頻寬與世代。模型放不進顯示記憶體就會有一部分落到系統記憶體,換更快的世代也救不回來。搜「顯卡 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文」比規格表之前,先把這個順序記住。
這篇用 2026 年 9 月 14 日的官方頁面,帶你做三件事:對照 Ollama 與 llama.cpp 的硬體支援清單、用模型檔案大小加上下文估出需要的顯示記憶體級距、再用 NVIDIA 與 AMD 規格頁比較桌機、筆電與 Apple Silicon。全文不寫通路價格。
為什麼顯示記憶體排在第一順位
Ollama 的常見問題頁說明,載入模型時它會先評估需要多少顯示記憶體:放得進某一張 GPU 就整個載上去,可以少掉資料在 PCI 匯流排上搬動;放不進單卡才拆開分散到多張 GPU。要看實際跑在哪裡就用 ollama ps,PROCESSOR 欄會寫 100% GPU、100% CPU,或像 48%/52% CPU/GPU 這種被拆成兩半的比例。
ollama ps支援清單:官方文件說哪些卡跑得動
顯示記憶體再大,軟體不支援也是白搭。Ollama 的硬體支援頁把條件寫成一張表:NVIDIA 要 compute capability 5.0 以上、驅動程式 550 版以上,其中 5.0 到 6.2 的卡另外要求 570 版以上;表上 GeForce RTX 50 系列是 12.0。同頁也附了 NVIDIA 官方的 CUDA GPU 查詢網址,可以自己對型號。
AMD 有兩條路。ROCm 這條在 Linux 需要 ROCm v7 驅動,名單裡有 Radeon RX 9070 XT、9060 XT、7900 XTX,Windows 名單短一截。另外 Ollama 在 Windows 與 Linux 用 Vulkan 提供支援,文件說後端裝好就預設開啟,並附了 Intel 與 AMD 的 Linux 驅動說明。Apple 則是一句話:透過 Metal API 支援 GPU 加速。
llama.cpp 的 README 列出後端與目標裝置:CUDA 對 NVIDIA GPU、HIP 對 AMD GPU、Metal 對 Apple Silicon、SYCL 對 Intel GPU、Vulkan 對 GPU 通用。建置文件補充,SYCL 支援的 Intel GPU 含 Arc 系列與 iGPU,執行時可以用 --list-devices 看有哪些裝置。
- NVIDIA:Ollama 要 compute capability 5.0 以上、驅動 550 版以上;llama.cpp 走 CUDA。
- AMD:Linux 要 ROCm v7,另有 Vulkan;llama.cpp 走 HIP。
- Apple:兩邊都走 Metal,macOS 上預設開啟。
- Intel:Ollama 歸在 Vulkan,llama.cpp 用 SYCL。
./build/bin/llama-cli --list-devices買新 3C 前先寫需求:從真實問題、相容性到維修與退場成本買新 3C 前先寫需求:從真實問題、相容性到維修與退場成本規格表可以比較產品,卻不能替你決定需不需要。用已遇到的問題建立選購條件,再核對相容性與後續使用成本,避免買回另一個閒置工具。閱讀全文
顯示記憶體要抓多少:檔案大小加上下文
起點是模型檔案大小,ollama.com/library 的標籤頁直接標出來。查證當天:gemma3:12b 是 8.1GB、gemma3:27b 是 17GB、qwen3:32b 是 20GB、gpt-oss:20b 是 14GB、gpt-oss:120b 是 65GB。換量化標籤差很多:gemma3:27b 的 q4_K_M 是 17GB,q8_0 是 30GB。
檔案大小只是下限,還要留空間給上下文視窗。Ollama 的上下文長度上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文文件寫明它依顯示記憶體給預設值:小於 24 GiB 給 4k、24 到 48 GiB 給 32k、48 GiB 以上給 256k。文件也提醒,網頁搜尋、代理(Agent)與寫程式這類任務至少要設到 64000 個 token,調大就會吃掉更多記憶體。
OLLAMA_CONTEXT_LENGTH=64000 ollama serve官方沒有給「幾 GB 可以跑幾 B」的公式,能引的是兩個省記憶體的開關:Flash Attention 會隨上下文變大明顯降低記憶體用量,支援時自動啟用;K/V 快取的量化型別預設是 f16,改成 q8_0 大約只用一半、品質影響通常不明顯,改成 q4_0 大約用四分之一。文件沒寫的數字就以官網為準。
量化標籤決定模型塞不塞得進你的卡,想弄懂 q4_K_M 與 q8_0 的差別可以先看 量化(Quantization):用較少位元執行模型的取捨量化(Quantization):用較少位元執行模型的取捨模型量化用較低精度表示權重或其他數值,目的是減少記憶體與運算負擔,同時盡量保留任務品質。本文用本機文件分類示範載入、校準與比較流程,區分訓練後量化、量化感知訓練、LoRA 和蒸餾,也解釋為什麼檔案變小不保證回答更快。讀完能核對硬體支援、記憶體組成及實際錯誤,避免只靠位元數挑模型。閱讀全文 與 GGUF 量化怎麼選GGUF 量化怎麼選:Q4_K_M、Q8_0、F16 的檔名、檔案大小與記憶體GGUF 檔名裡的 Q4_K_M、Q8_0、F16 是量化類型,決定檔案多大、要多少記憶體。這篇照 llama.cpp 與 ggml 官方文件講 GGUF 格式與命名規則、各類型的每權重位元數,用官方對照表(Llama 3.1 8B 從 14.96 GiB 到 4.58 GiB)與 Ollama、Hugging Face 上同一個模型的不同量化大小說明怎麼選,並附官方的轉檔與量化指令。閱讀全文;名稱後面的 4b、27b 是什麼,在 模型參數(Model Parameters)是什麼模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文。
閱讀完整文字說明
由上往下五個步驟。第一步先決定要跑哪個模型,ollama.com/library 的標籤頁直接寫檔案大小,例如 gemma3:12b 是 8.1GB、gpt-oss:20b 是 14GB。第二步確認顯示記憶體裝得下檔案加上下文,Ollama 依顯示記憶體給預設上下文,小於 24 GiB 給 4k;裝不下時 ollama ps 的 PROCESSOR 欄不會是 100% GPU。第三步查官方支援清單,NVIDIA 要 compute capability 5.0 以上與驅動 550 版以上,AMD 在 Linux 要 ROCm v7 或改走 Vulkan,Apple 走 Metal,Intel 在 llama.cpp 走 SYCL。第四步同容量才比記憶體頻寬與世代,RTX 5090 是 32 GB 搭 1792 GB/sec,RX 9070 XT 是 16 GB 搭 640 GB/s。第五步確認電源與機殼,官方規格頁寫 RTX 5090 建議系統電源 1000 W,RX 9070 XT 最低電源供應器建議 750W。任何一關不過就回到上一步換選擇。
在自己電腦跑 DeepSeek:Ollama 蒸餾版教學在自己電腦跑 DeepSeek:Ollama 蒸餾版教學Ollama 官網目前列出 deepseek-r1 的 1.5b、7b、8b、14b、32b、70b 與 671b 七個標籤,下載大小從 1.1GB 到 404GB。這篇用官方文件帶你在 Windows 或 Mac 裝好 Ollama、拉一個蒸餾版開始對話,再接一次本機 11434 埠的 API 呼叫,並說清楚蒸餾與量化是什麼、蒸餾版和網頁版完整模型差在哪、MIT 授權實際允許什麼。閱讀全文
桌機、筆電與 Apple Silicon 的取捨
桌機卡看官網比較頁就好。NVIDIA GeForce 規格比較頁上,RTX 5090 是 32 GB GDDR7、記憶體頻寬 1792 GB/sec;RTX 5080 是 16 GB、960 GB/sec;RTX 5070 是 12 GB、672 GB/sec;RTX 5060 Ti 官網寫成 16 GB / 8 GB,頻寬 448 GB/sec。
AMD 官方規格頁上,Radeon RX 9070 XT 與 RX 9070 都是 16 GB GDDR6、記憶體頻寬最高 640 GB/s;RX 9070 GRE 是 12 GB、432 GB/s;RX 9060 XT 同時列出 16 GB 與 8 GB 兩個版本,頻寬都是 320 GB/s。
筆電的同名卡是另一張卡。NVIDIA 筆電 50 系列規格頁寫著,RTX 5090 Laptop GPU 是 24 GB GDDR7、頻寬 896 GB/s,桌機版則是 32 GB、1792 GB/sec。挑筆電等於一開始就接受容量與頻寬同時打折。
Apple Silicon 換一種算法:GPU 與 CPU 共用統一記憶體。apple.com/tw 的規格頁上,Mac mini 的 M5 Pro 機型最高 64GB 統一記憶體、頻寬 307GB/s;Mac Studio 的 M5 Ultra 最高 512GB、1.2TB/s。容量遠超過任何一張消費級顯示卡。
| 顯示記憶體 | Ollama 預設上下文 | 檔案大小相符的模型標籤 | 提醒 |
|---|---|---|---|
| 8 GB | 小於 24 GiB:4k | gemma3:4b 3.3GB | 要再留上下文空間 |
| 12 GB | 小於 24 GiB:4k | gemma3:12b 8.1GB | 上下文設 64000 要重估 |
| 16 GB | 小於 24 GiB:4k | gpt-oss:20b 14GB | 同名有 8 GB 版,別買錯 |
| 24 到 32 GB | 24 到 48 GiB:32k | gemma3:27b 17GB、qwen3:32b 20GB | 消費級單卡到 32 GB |
| 48 GB 以上 | 48 GiB 以上:256k | gpt-oss:120b 65GB | 靠多卡或統一記憶體 |
跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文
Mac mini 當家用 AI 伺服器:統一記憶體、售價與區網設定Mac mini 當家用 AI 伺服器:統一記憶體、售價與區網設定把 Mac mini 放在家裡當常開的 AI 伺服器,手機和筆電連區網就能用本機模型。本文整理 2026 年 9 月 14 日 apple.com/tw 上 Mac mini 的晶片、統一記憶體選項與新台幣售價,說明統一記憶體為什麼適合跑本機模型,並照 Ollama 與 Open WebUI 官方文件寫出 macOS 安裝、常駐與開放到區網的做法與風險,以及 Apple 官網有的耗電數字。閱讀全文
電源、機殼與二手卡要先確認什麼
電源與機殼是最容易漏算的兩筆。NVIDIA 規格比較頁直接列出「建議系統電源」:RTX 5090 是 1000 W、RTX 5080 是 850 W、RTX 5070 是 650 W,註解說明這是以搭配 Intel Core i9-10900K 的電腦為基準,配置不同時較低瓦數也可能足夠;AMD 規格頁的「最低電源供應器建議」則是 Radeon RX 9070 XT 750W、RX 9060 XT 450W。
機殼看長度與槽位。NVIDIA 規格頁只有創始版(Founders Edition)列得出尺寸,RTX 5090 是長 304 mm、寬 137 mm、佔 2 個擴充槽;同頁明講規格代表創始版或參考設計,板卡廠出貨的實際規格可能不同。先量機殼,再去板卡廠頁面確認。
二手卡只看官方文件驗得到的三件事:型號在不在官方支援清單上、那個型號的顯示記憶體容量以官網規格頁為準、電源接頭與建議瓦數對不對得上現有的電源供應器。賣家說法與網路上的對照表都不算數。
顯示卡只是本機方案的一段成本,還有電費與你的時間。拿不定主意就把同樣的工作量放到雲端算一次再決定;要跑圖片生成,另外確認那套工具的官方需求。
本機跑 Stable Diffusion 與 Flux:ComfyUI 入門本機跑 Stable Diffusion 與 Flux:ComfyUI 入門ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。閱讀全文
本機 vs 雲端 AI 成本試算:訂閱、API 與電費怎麼算本機 vs 雲端 AI 成本試算:訂閱、API 與電費怎麼算把雲端訂閱、API 按量與本機三種付法放進同一條算式:訂閱月費照官網,API 取 Sonnet 5、gpt-5.6-terra、Gemini 3.1 Pro 的每百萬 token 價格,本機用 apple.com/tw 的 Mac mini 售價攤提,加 Apple 官方耗電量與台電住宅電價級距。輕度聊天、每天處理文件、開發者大量呼叫三個情境各算一次,結論是什麼情況本機才划算。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Ollama 文件:硬體支援(NVIDIA compute capability 與驅動版本、AMD ROCm 與 Vulkan、Metal) · 查證日期:
- Ollama 文件:上下文長度(依顯示記憶體的預設分級) · 查證日期:
- Ollama 文件:常見問題(ollama ps、Flash Attention、K/V 快取量化、多 GPU 載入) · 查證日期:
- llama.cpp README:支援的後端與目標裝置 · 查證日期:
- llama.cpp 建置文件:CUDA、HIP、Metal、Vulkan、SYCL 與 --list-devices · 查證日期:
- NVIDIA GeForce 顯示卡規格比較頁(RTX 50 系列顯示記憶體、頻寬、建議系統電源、尺寸) · 查證日期:
- NVIDIA GeForce RTX 50 系列筆電頁(Laptop GPU 顯示記憶體與頻寬) · 查證日期:
- AMD 繪圖產品規格頁(Radeon RX 9000 系列顯示記憶體、頻寬、最低電源供應器建議) · 查證日期:
- Ollama 模型庫 gemma3 標籤頁(檔案大小) · 查證日期:
- Ollama 模型庫 qwen3 標籤頁(檔案大小) · 查證日期:
- Ollama 模型庫 gpt-oss 標籤頁(檔案大小) · 查證日期:
- Apple:Mac mini 技術規格(統一記憶體容量與記憶體頻寬) · 查證日期:
- Apple:Mac Studio 技術規格(統一記憶體容量與記憶體頻寬) · 查證日期: