生活分享

擴散模型(Diffusion Model)是什麼:從雜訊逐步生成影像

擴散模型先學習不同雜訊程度下的去噪關係,再透過反覆更新產生新內容。本文用植物展覽海報的示意案例,說明訓練與生成為何方向不同、文字條件如何參與,以及步數、種子和潛在空間各自控制什麼,幫你分清影像逐漸清晰、畫面符合要求與內容真實可信之間的差別,也釐清擴散模型和文字生圖的關係。

更新日期: 閱讀時間約 7 分鐘

顆粒由左側不規則散點逐漸組成右側植物花盆的原創插畫
圖片:Mokaair (© Mokaair)

看見生圖工具把一團顆粒慢慢變成完整畫面,很容易以為它正在找出藏在雜訊底下的原始照片。擴散模型的重點其實是學會資料中的規律,再從隨機起點逐步建立新的內容。那張圖不必曾經存在,畫面越清楚,也不代表它越接近某個真實事件。

Diffusion Model 是一類生成模型方法,影像是常見用途,也能延伸至其他資料。這裡採用去噪擴散模型的入門說明:訓練時讓模型接觸不同程度的雜訊,生成時利用學到的關係反覆更新。本例是一張植物展覽海報的構圖草案,屬於教學示意,沒有宣稱實際測得哪組設定最好。

先學去噪,再學會從隨機起點往前走

在典型的影像訓練流程裡,系統從訓練圖片製作帶有不同程度雜訊的版本,要求模型學習與去噪有關的預測,並用誤差更新。清楚與模糊的圖片都會出現,目的在於讓模型面對各種中間狀態,而不是只會處理接近完成的圖。

生成階段不需要拿同一張訓練圖片來還原。系統可以從隨機雜訊開始,讓模型做預測,再由取樣程序更新狀態,重複到形成輸出。把它想成逐步調整構圖,比想成把照片上的灰塵擦掉更準確:畫中花盆的位置與形狀,是生成過程形成的。

訓練與生成因此要分開看。使用者按下產生圖片,通常是在使用已訓練好的模型,不表示模型當場重新學習整個世界。修改提示詞改變這一次的生成條件,也不等於替模型完成了一次新的訓練。

擴散模型將訓練加噪與生成去噪分成上下兩條方向不同的流程
上方是訓練用資料的加噪示意;下方是已訓練模型參與的生成流程,並非復原同一張原圖。 · 圖片:Mokaair (© Mokaair)

海報案例:把條件放進去噪流程

假設展覽需要一張留有標題空間的植物插畫,輸入可以寫成「米色背景、右下方一盆蕨類、左上留白、平面插畫」。支援文字條件的系統會把文字轉成模型可使用的表示,在生成過程中提供方向。這與完全不給文字、只依模型學到的資料分佈生成不同。

示意流程是先確認畫面比例與使用目的,再給條件、產生候選圖,最後逐項檢查。期待的結果是右下有植物且左上能放字;如果植物很漂亮卻填滿畫面,失敗點在空間配置。不能只因為畫面清晰,就判定要求全部完成。

下一次可以把「左上沒有物件」寫得更明確,或使用工具支援的構圖控制,再比較結果。若反覆修改文字仍無法得到精確版位,改由排版工具把植物與標題分層處理可能更直接。生成模型提供候選素材,不需要承擔每一項版面控制工作。

步數、種子與引導是不同的旋鈕

取樣步數描述生成時更新的次數,但各種取樣方法的每一步不一定可直接相比。增加步數通常會增加運算工作,也不保證某張圖持續變好;設定是否適合,要配合模型、取樣器與實際用途判斷,不能把數字大當作品質高的同義詞。

隨機種子用來設定隨機程序的起點。在相同模型與相關設定下,固定種子有助於比較改動的影響;不同軟體版本、硬體或其他計算設定,仍可能讓結果不同。因此記下種子很有用,但僅憑一個種子值無法完整交代生成條件。

文字引導則涉及輸出受到條件影響的方式與程度。不同實作提供的旋鈕並不相同,不存在所有模型通用的最佳值。對海報而言,最有效的比較是一次改動一類條件,查看留白與植物形狀各自怎麼變,避免把多項修改混在一起卻無法解釋改善原因。

潛在空間不是另一個圖片資料庫

有些擴散系統直接處理影像表示,有些先用編碼器把影像壓縮到潛在表示,在較緊湊的空間做生成,再解碼成可看的圖片。Latent Diffusion 原始研究說明瞭後者的設計,用意包含降低直接在高解析度像素上運算的負擔。

這裡的「潛在」不是隱藏著一張張完整圖片的搜尋目錄,而是模型學得的表示空間。生成中的中間狀態未必能直接當成普通照片觀看;畫面預覽可能還需要解碼。不能只憑介面上的模糊預覽,就推論內部每一步都在操作相同的可視圖層。

也因此,擴散模型和文字生圖不是同一層次的名稱。前者描述生成方法家族,後者描述文字輸入到影像輸出的任務。擴散模型可以接受其他條件,文字生圖也不必永遠使用完全相同的擴散架構;先看輸入輸出,再看方法,較不會混淆。

看起來合理,仍要逐項檢查

模型學到的是資料中的規律,未必符合植物學、幾何或排版規則。海報裡的葉片可以很自然,卻出現不合理的連接;如果要表達真實品種,仍需用可靠參考資料檢查。要求它重生成幾次,也不能取代對內容本身的確認。

實務驗收可以先看主體、位置、背景與留白,再放大檢查邊緣、重複紋理和不該出現的文字。若只需抽象裝飾,某些細節不重要;若要做教材,物種特徵就成為必要條件。把用途寫清楚,才能知道哪一種失敗值得重新生成。

最後保留使用的模型、提示詞、相關設定與人工修改紀錄,讓下一次調整有依據。擴散的逐步生成提供了創作彈性,卻不附帶真實性保證;對使用者最有用的理解,是知道哪些條件可以施加、哪些結果需要挑選,以及哪一部分應交回可精確控制的工具。

例如把標題放上候選圖後才發現葉片擋住字,這是版面需求沒有滿足,並非去噪失敗;若花盆邊緣破碎,則是素材本身需要修正。把這兩種問題分開記錄,可以避免為了修正小瑕疵而反覆更改已經合適的構圖。

概念與使用情境比較;查證於 2026 年 9 月。
概念主要作用不代表什麼
去噪訓練學習不同雜訊狀態的預測每次生圖都重新訓練
取樣步數安排生成中的更新次數越多必然越好
隨機種子設定隨機程序起點單獨保證跨環境完全重現
文字條件提供內容與風格方向所有細節都會被遵守

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享