生活分享

本機跑 Stable Diffusion 與 Flux:ComfyUI 入門

ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。

更新日期: 閱讀時間約 12 分鐘

插圖:畫布上幾個圓角方塊用線接成一條流程,右端輸出一張圖片的框
圖片:Mokaair (© Mokaair)

想在自己的電腦上跑 Stable Diffusion 或 Flux,ComfyUI 是官方文件最完整的一條路。它是一套以 GPL-3.0 釋出的開源節點式引擎,把載入模型、寫提示詞、取樣、解碼、存檔拆成一個個節點,接起來就是一份可以存成 JSON、也能從生成的圖片還原的工作流。

這篇照官方文件帶你走完安裝、放模型、載入官方範本跑出第一張圖,再說明每個節點在做什麼。後半段處理三件最容易踩的事:各版本模型的授權差很多(同樣叫 Flux,有的是 Apache 2.0、有的完全不能商用)、官方寫過的顯示記憶體(VRAM)需求,以及輸出要不要標示。介面位置以官網當天版本為準。

ComfyUI 是什麼:一張圖就是一條流程

一般生圖工具給你一個輸入框,ComfyUI 給你一張畫布:每個方塊是一個節點,輸出接到下一個節點的輸入。官方把它定位成內容創作的模組化 引擎,可在 Windows、Linux 與 macOS 本機執行,也有官方付費雲端版。官網寫得很直接:免費、開源、採 GPL-3.0,沒有功能鎖也沒有試用期,並有超過 5,000 個社群擴充、合計超過 60,000 個節點。

官方另外提到兩個省時間的設計:只有「有輸出而且輸入齊全」的部分會被執行,同一份圖送第二次時只重跑有變動的部分。README 也寫明核心除非你要求否則不下載任何東西,並可用 --disable-api-nodes 關掉需付費的 API 節點,讓功能全部留在離線狀態。

安裝:桌面版、Windows 可攜版、手動安裝

官方提供三條本機路線。Comfy Desktop 是官方說「最容易上手」的一條,它幫你裝好 ComfyUI、Python 環境與相依套件,還能同時管理多個獨立實例。官方寫的需求是 Windows 10 或以上(x64 或 ARM64)、macOS 13 Ventura 以上且必須是 Apple Silicon(M1 以上)、Linux 有 .deb 與 AppImage;每個獨立安裝至少 4.85 GB 磁碟與 8 GB 記憶體,官方建議 16 GB。

Windows 可攜版是內含獨立 Python 環境的壓縮檔,解開就能跑、永遠跟著最新提交,但官方明講「不建議一般使用者」用。目前的可攜包內建 Python 3.13 與 PyTorch CUDA 13.0,NVIDIA 版支援 20 系列以上;10 系列與更舊的卡要下載另一包 cu126 加 Python 3.12 的版本,官方註明新卡不要用那一包。

手動安裝支援所有系統與顯示卡類型。官方的版本說法是:Python 3.13 支援最好,3.14 可跑但部分自訂節點有問題,3.12 是備案;PyTorch 最低支援 2.7,NVIDIA 20 系列以上需要 cu130 或更新版本,官方並說如果你的 PyTorch 超過半年沒更新就該更新。

手動安裝 ComfyUI(NVIDIA 顯示卡,照官方文件的順序) · bash
# 1. 開一個獨立的 Python 環境,避免汙染系統的 Python
conda create -n comfyenv
conda activate comfyenv

# 2. 取得程式碼
git clone https://github.com/Comfy-Org/ComfyUI.git

# 3. 先裝 PyTorch(NVIDIA 穩定版)
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130

# 4. 再裝其餘相依套件並啟動
cd ComfyUI
pip install -r requirements.txt
python main.py

Apple Silicon 的 Mac(M 系列)走同一套流程,只是 PyTorch 要改裝 nightly 版,官方要你照 Apple 的 Metal 說明安裝。更新則是進安裝目錄 git pull 之後,再跑一次安裝相依套件的指令。

模型檔要放哪一個資料夾

ComfyUI 本體很小,佔空間的是模型。官方文件寫得很清楚:模型不隨程式附上,要自己下載,放到 ComfyUI/models/ 底下對應類型的子資料夾,再用對應的載入節點(名稱多半以 Load 開頭)選檔案。常見子資料夾有 checkpoints、vae、loras、controlnet、,以及新一代模型用到的 diffusion_models 與 text_encoders。

舊的 Stable Diffusion 1.5 是整包的 checkpoint,丟進 checkpoints 就好;新模型多半拆成三個檔案要分開放。以官方範本為例,擴散模型放 diffusion_models、文字編碼器放 text_encoders、VAE 放 vae,放錯就找不到。

模型檔的資料夾結構(照官方文件的路徑) · text
ComfyUI/
└── models/
    ├── checkpoints/          # 整包的 checkpoint,例如 SD1.5、SDXL
    ├── diffusion_models/     # 拆開放的擴散模型,新一代模型多半放這裡
    ├── text_encoders/        # 文字編碼器
    ├── vae/                  # VAE
    ├── loras/                # LoRA
    └── controlnet/           # ControlNet

已經用別的介面(例如 WebUI)存了模型的話不必複製第二份。可攜版與手動安裝在根目錄有一個 extra_model_paths.yaml.example,複製並改名成 extra_model_paths.yaml 就生效;桌面版則點視窗上方的膠囊選單,開 Storage 分頁加資料夾。官方警告桌面版要補上設定而不是覆蓋安裝時產生的路徑,改前先備份,存檔後要重開才會讀到。

extra_model_paths.yaml:把既有的 WebUI 模型資料夾接進來 · yaml
a111:
    base_path: D:\stable-diffusion-webui\
    checkpoints: models/Stable-diffusion
    configs: models/Stable-diffusion
    vae: models/VAE
    loras: |
         models/Lora
         models/LyCORIS
    embeddings: embeddings
    controlnet: models/ControlNet

手動複製進去的檔案 ComfyUI 不會自己發現,官方的做法是按鍵盤 R 重新整理節點定義,或直接重開。另有一個常被忽略的限制:ComfyUI 原生不支援 GGUF 格式,要用得另外安裝社群自訂節點。

第一個工作流:載入官方範本,跑出第一張圖

不要從空白畫布開始。ComfyUI 內建工作流範本瀏覽器,裡面是官方原生支援的模型工作流。官方文件寫明:載入範本時會自動檢查需要的模型檔在不在,缺了就跳出下載提示。

  1. 點側邊欄的 Templates 圖示,或用選單 Workflow → Browse Workflow Templates 打開範本瀏覽器。
  2. 點一個範本載入。若跳出缺少模型的警告,點開來看是缺哪個檔、下載連結在哪。
  3. 桌面版按 Download 會自動存到 ComfyUI/models/checkpoints;可攜版交給瀏覽器下載,要自己把檔案存進那個資料夾。
  4. 下載完按鍵盤 R 重新整理,確認 Load Checkpoint 節點已選到模型檔,而不是顯示 null。
  5. 按 Run 或 Ctrl + Enter(macOS 用 Cmd)開始生成;結果出現在 Save Image 節點,也會存進 ComfyUI/output。

官方入門教學用的模型是 v1-5-pruned-emaonly-fp16.safetensors,也就是 Stable Diffusion 1.5。ComfyUI 產生的每一張圖,中繼資料都帶著完整工作流與當時的種子,把圖拖進畫面就會還原整份流程。另外要注意缺檔偵測只看對應的最上層資料夾,模型放在子資料夾時提示照樣會跳,忽略它、直接在載入節點選對檔案就好。

文字生圖工作流的節點流程圖:載入模型分出三條線,提示詞與空白潛在影像進入取樣器,再經解碼節點存檔
最基本的文字生圖工作流:Load Checkpoint 分出模型、文字編碼器與 VAE 三條線,會合在 KSampler,解碼後存檔。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

由左到右的五格流程圖。第一格 Load Checkpoint 載入模型,分出 MODEL、CLIP、VAE 三條線,整包的 checkpoint 放在 models 底下的 checkpoints 資料夾,拆開的擴散模型放在 diffusion_models。第二格 CLIP Text Encode 寫提示詞,上面那個接 Positive 放你要的東西,下面那個接 Negative 放你不要的東西。第三格 KSampler 在潛在空間逐步去雜訊,主要參數是 seed 控制隨機性、steps 決定去雜訊次數、cfg 決定提示詞約束力、denoise 決定去雜訊強度。第四格 VAE Decode 把潛在空間換回像素空間,VAE 必須跟 checkpoint 同一個家族,混用會出現通道數對不上的張量錯誤。第五格 Save Image 把圖存進 ComfyUI 的 output 資料夾,圖的中繼資料帶著整份工作流與種子,拖回畫面即可還原。下方另外註明兩條線:Empty Latent Image 決定畫布尺寸並接到 KSampler 的 latent_image 輸入;Load Checkpoint 分出來的 VAE 要一路接到最後的 VAE Decode。

每個節點在做什麼:從載入模型到存檔

看懂那張圖,之後換模型、換流程就有底。Load Checkpoint 負責載入生成模型,官方說明一個 checkpoint 通常包含三個部分,所以它分出三條線:MODEL 是負責預測雜訊的 UNet,CLIP 是把提示詞轉成向量的文字編碼器,VAE 負責在像素空間與潛在空間之間換算。

接著是兩個 CLIP Text Encode 節點,一個接到取樣器的 Positive、一個接到 Negative,分別是你要的與你不要的東西;Empty Latent Image 則建構出一塊純雜訊的潛在空間,尺寸決定最終圖片的長寬。

KSampler 是核心,去雜訊就發生在這裡。官方列出的裡,seed 控制隨機性,steps 是去雜訊的迭代次數,cfg 是無分類器引導強度(太高會過擬合),sampler_name 與 scheduler 決定演算法與雜訊衰減節奏,denoise 官方寫 0.0 保留原輸入特徵、1.0 是完全的雜訊。最後 VAE Decode 換回像素空間,Save Image 預覽並存檔。

提示詞有兩個 ComfyUI 特有的語法:用小括號調整權重,例如 (golden hour:1.2),只寫括號的預設權重是 1.1;用大括號做動態提示詞,{day|night} 每次排入佇列時會隨機換一個。

授權:同樣叫 Flux 或 Stable Diffusion,條款差很多

這是本機生圖最容易出事的一段:能不能商用要一個版本一個版本看。先看 Black Forest Labs 的 Flux。FLUX.1 [schnell] 的授權標籤是 apache-2.0,可以商用,ComfyUI 文件說它只要 4 步就能出圖、適合低階硬體;FLUX.1 [dev] 則掛 FLUX.1 [dev] Non-Commercial License v1.1.1,只能非商用。

那份授權對非商用的定義寫得很細:只要你因此獲得任何直接或間接的報酬就不算,並明列三種不算非商用的情況——產生收入的活動、與終端使用者直接互動或會影響終端使用者的場合、以及拿來訓練或蒸餾其他要商用的模型。要商用必須另外向 Black Forest Labs 申請,公司可自行決定是否同意。

FLUX.2 維持同樣分法但換了授權檔。官方 GitHub 的模型表列得很清楚:FLUX.2 [dev](320 億參數)與 FLUX.2 [klein] 9B 系列走 FLUX Non-Commercial License v2.1;FLUX.2 [klein] 4B 系列則是 Apache 2.0,官方模型卡直接寫可依 Apache 2.0 授權作商業使用。同一個 klein 家族,4B 能商用、9B 不能。

Stability AI 這邊分兩段。ComfyUI 入門教學用的 Stable Diffusion 1.5 封存倉庫掛 CreativeML OpenRAIL-M,授權本身允許商業使用但附帶一份使用行為限制清單。Stable Diffusion 3.5 全系列與 SDXL Turbo 的 LICENSE 檔則是 Stability AI Community License Agreement(版本日期 2024 年 7 月 5 日):研究與非商用免費,商用也免費但必須先向 Stability AI 註冊;一旦你或關係企業的年營收合計超過 100 萬美元,授權即於該日終止,要改談企業授權。

2026 年 9 月 14 日查自各官方模型卡、授權原文與官方文件;顯示記憶體只抄官方寫過的數字,條款以官網原文為準。
模型授權商用條件官方寫的顯示記憶體建議
Stable Diffusion 1.5(封存倉庫)CreativeML OpenRAIL-M授權允許商用,要遵守使用限制清單ComfyUI 文件:約 4GB 大小,可在 6GB 顯示記憶體的消費級顯示卡順跑
SDXL TurboStability AI Community License年營收未達 100 萬美元免費,商用要先註冊官方頁面未列,以官網為準
Stable Diffusion 3.5 Medium(25 億參數)Stability AI Community License同上;超過門檻改談企業授權官方新聞稿:9.9GB(不含文字編碼器)
Stable Diffusion 3.5 Large(81 億參數)Stability AI Community License同上;超過門檻改談企業授權官方頁面未列,以官網為準
FLUX.1 [schnell]Apache 2.0可商用ComfyUI 文件:4 步出圖,適合低階硬體
FLUX.1 [dev]FLUX.1 [dev] Non-Commercial License v1.1.1僅限非商用;商用要另外申請ComfyUI 文件:文字編碼器用 fp16 版建議顯示記憶體大於 32GB
FLUX.2 [dev](320 億參數)FLUX Non-Commercial License v2.1僅限非商用;商用要另外申請官方 GitHub:原生需 H100 等級;量化版可在 RTX 4090 搭配遠端文字編碼器
FLUX.2 [klein] 9BFLUX Non-Commercial License v2.1僅限非商用;商用要另外申請官方頁面未單獨列出,以官網為準
FLUX.2 [klein] 4BApache 2.0可商用官方模型卡:約 13GB,RTX 3090/4070 以上

跑不動或跑錯:官方列出的常見錯誤

最常見的是顯示記憶體不夠,訊息是 CUDA out of memory。官方問題排除頁給的是一組階梯式參數:先試 --lowvram,不夠再 --novram,最後才是 --cpu,另有強制降精度與換注意力實作兩個參數。模型載入很慢則多半卡在硬碟,官方建議把模型移到 SSD。

官方列的記憶體與效能參數(依序往下試) · bash
# 顯示記憶體不足時,由輕到重
python main.py --lowvram
python main.py --novram
python main.py --cpu

# 強制降精度、換一種注意力實作以省記憶體
python main.py --force-fp16
python main.py --use-pytorch-cross-attention

# 懷疑是自訂節點造成的問題時,先全部停用再逐一找
python main.py --disable-all-custom-nodes

第二類是把不同家族的模型混著用。官方把差異寫得很明白:Flux 用 16 通道潛在空間加雙文字編碼器,SD1.5 是 4 通道加單一個文字編碼器,SDXL 是 4 通道加雙編碼器,SD3 是 16 通道加三個編碼器。混用會在 VAE 解碼階段看到通道數對不上的張量錯誤。ControlNet 也必須和底層 checkpoint 同家族。

第三類是檔案問題。載入節點的下拉選單空空如也、跳出 Value not in list,代表 ComfyUI 沒看到那個檔案,回頭檢查資料夾、按 R、重開。若是 Error while deserializing header,官方的判斷是檔案下載壞了或磁碟空間不足。載入範本顯示缺節點時,官方給的兩個可能原因是版本太舊,或有節點在啟動時匯入失敗。

至於買什麼硬體才跑得動,這篇只抄官方寫過的數字。官網下載頁的說法是:強烈建議配一張獨立顯示卡,顯示記憶體越大,能跑的模型與批次就越大;沒有顯示卡的人可以改用官方雲端。

輸出怎麼標示:授權原文怎麼寫,圖又算誰的

模型跑在自己電腦上也有義務。Flux 的兩份非商用授權都有同一段:使用者要嘛實作並維持內容過濾機制,要嘛在散布、展示、傳輸之前先審查輸出有沒有違法或侵權內容;而且在適用法律要求的範圍內,輸出要附上「由人工智慧技術生成或修改」這類揭露。FLUX.2 [klein] 的官方推論程式碼另附像素層浮水印範例,倉庫也連到 C2PA 標準。

圖算誰的?兩家原文都把輸出歸屬留給使用者。Black Forest Labs 寫「我們不主張輸出的任何所有權」,輸出可用於任何用途(包含商業用途),但不得拿輸出訓練與 Flux 競爭的模型;這條講的是輸出,模型本身的非商用限制沒有放寬。Stability 的社群授權則寫你擁有輸出,但散布模型或衍生作品時,要附上指定的 Notice 檔文字,並顯著標示 Powered by Stability AI。

台灣目前沒有針對 AI 生成影像的統一標示法規,但只要輸出會流到別人面前,主動標示最省事。另一個界線要先畫好:兩家的條款都禁止用模型產生冒用他人身分、未經同意的親密影像或其他違法內容,本機執行不會讓這些行為變成合法。

  • 生活分享

    MiniMax 語音合成:中文配音、有聲書與影片旁白

    把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。

  • 生活分享

    MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌

    MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。

  • 生活分享

    MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片

    海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。

  • 生活分享

    Figma AI 功能怎麼評估:設計生成、資料與交接

    Figma AI 已包含對話式設計代理、獨立 AI 工具及與外部工具連接的工作方式,不能只沿用早期 First Draft 教學。本文以原創共享廚房預約頁為例,整理功能與席位、設計系統、內容訓練、聊天可見性及 MCP 寫入的檢查方式,並說明 beta 與 AI 點數的現況。附步驟、比較表及原創圖解,協助評估可編輯成果與交接責任,不把生成畫面當成已完成的服務。

最新旅遊情報攻略

資料來源

生活分享