生活分享
擴散模型(Diffusion Model)是什麼:從雜訊逐步生成影像
擴散模型先學習不同雜訊程度下的去噪關係,再透過反覆更新產生新內容。本文用植物展覽海報的示意案例,說明訓練與生成為何方向不同、文字條件如何參與,以及步數、種子和潛在空間各自控制什麼,幫你分清影像逐漸清晰、畫面符合要求與內容真實可信之間的差別,也釐清擴散模型和文字生圖的關係。
更新日期: 閱讀時間約 7 分鐘

看見生圖工具把一團顆粒慢慢變成完整畫面,很容易以為它正在找出藏在雜訊底下的原始照片。擴散模型的重點其實是學會資料中的規律,再從隨機起點逐步建立新的內容。那張圖不必曾經存在,畫面越清楚,也不代表它越接近某個真實事件。
Diffusion Model 是一類生成模型方法,影像是常見用途,也能延伸至其他資料。這裡採用去噪擴散模型的入門說明:訓練時讓模型接觸不同程度的雜訊,生成時利用學到的關係反覆更新。本例是一張植物展覽海報的構圖草案,屬於教學示意,沒有宣稱實際測得哪組設定最好。
先學去噪,再學會從隨機起點往前走
在典型的影像訓練流程裡,系統從訓練圖片製作帶有不同程度雜訊的版本,要求模型學習與去噪有關的預測,並用誤差更新參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文。清楚與模糊的圖片都會出現,目的在於讓模型面對各種中間狀態,而不是只會處理接近完成的圖。
生成階段不需要拿同一張訓練圖片來還原。系統可以從隨機雜訊開始,讓模型做預測,再由取樣程序更新狀態,重複到形成輸出。把它想成逐步調整構圖,比想成把照片上的灰塵擦掉更準確:畫中花盆的位置與形狀,是生成過程形成的。
訓練與生成因此要分開看。使用者按下產生圖片,通常是在使用已訓練好的模型,不表示模型當場重新學習整個世界。修改提示詞改變這一次的生成條件,也不等於替模型完成了一次新的訓練。
海報案例:把條件放進去噪流程
假設展覽需要一張留有標題空間的植物插畫,輸入可以寫成「米色背景、右下方一盆蕨類、左上留白、平面插畫」。支援文字條件的系統會把文字轉成模型可使用的表示,在生成過程中提供方向。這與完全不給文字、只依模型學到的資料分佈生成不同。
示意流程是先確認畫面比例與使用目的,再給條件、產生候選圖,最後逐項檢查。期待的結果是右下有植物且左上能放字;如果植物很漂亮卻填滿畫面,失敗點在空間配置。不能只因為畫面清晰,就判定要求全部完成。
下一次可以把「左上沒有物件」寫得更明確,或使用工具支援的構圖控制,再比較結果。若反覆修改文字仍無法得到精確版位,改由排版工具把植物與標題分層處理可能更直接。生成模型提供候選素材,不需要承擔每一項版面控制工作。
步數、種子與引導是不同的旋鈕
取樣步數描述生成時更新的次數,但各種取樣方法的每一步不一定可直接相比。增加步數通常會增加運算工作,也不保證某張圖持續變好;設定是否適合,要配合模型、取樣器與實際用途判斷,不能把數字大當作品質高的同義詞。
隨機種子用來設定隨機程序的起點。在相同模型與相關設定下,固定種子有助於比較改動的影響;不同軟體版本、硬體或其他計算設定,仍可能讓結果不同。因此記下種子很有用,但僅憑一個種子值無法完整交代生成條件。
文字引導則涉及輸出受到條件影響的方式與程度。不同實作提供的旋鈕並不相同,不存在所有模型通用的最佳值。對海報而言,最有效的比較是一次改動一類條件,查看留白與植物形狀各自怎麼變,避免把多項修改混在一起卻無法解釋改善原因。
潛在空間不是另一個圖片資料庫
有些擴散系統直接處理影像表示,有些先用編碼器把影像壓縮到潛在表示,在較緊湊的空間做生成,再解碼成可看的圖片。Latent Diffusion 原始研究說明瞭後者的設計,用意包含降低直接在高解析度像素上運算的負擔。
這裡的「潛在」不是隱藏著一張張完整圖片的搜尋目錄,而是模型學得的表示空間。生成中的中間狀態未必能直接當成普通照片觀看;畫面預覽可能還需要解碼。不能只憑介面上的模糊預覽,就推論內部每一步都在操作相同的可視圖層。
也因此,擴散模型和文字生圖不是同一層次的名稱。前者描述生成方法家族,後者描述文字輸入到影像輸出的任務。擴散模型可以接受其他條件,文字生圖也不必永遠使用完全相同的擴散架構;先看輸入輸出,再看方法,較不會混淆。
看起來合理,仍要逐項檢查
模型學到的是資料中的規律,未必符合植物學、幾何或排版規則。海報裡的葉片可以很自然,卻出現不合理的連接;如果要表達真實品種,仍需用可靠參考資料檢查。要求它重生成幾次,也不能取代對內容本身的確認。
實務驗收可以先看主體、位置、背景與留白,再放大檢查邊緣、重複紋理和不該出現的文字。若只需抽象裝飾,某些細節不重要;若要做教材,物種特徵就成為必要條件。把用途寫清楚,才能知道哪一種失敗值得重新生成。
最後保留使用的模型、提示詞、相關設定與人工修改紀錄,讓下一次調整有依據。擴散的逐步生成提供了創作彈性,卻不附帶真實性保證;對使用者最有用的理解,是知道哪些條件可以施加、哪些結果需要挑選,以及哪一部分應交回可精確控制的工具。
例如把標題放上候選圖後才發現葉片擋住字,這是版面需求沒有滿足,並非去噪失敗;若花盆邊緣破碎,則是素材本身需要修正。把這兩種問題分開記錄,可以避免為了修正小瑕疵而反覆更改已經合適的構圖。
| 概念 | 主要作用 | 不代表什麼 |
|---|---|---|
| 去噪訓練 | 學習不同雜訊狀態的預測 | 每次生圖都重新訓練 |
| 取樣步數 | 安排生成中的更新次數 | 越多必然越好 |
| 隨機種子 | 設定隨機程序起點 | 單獨保證跨環境完全重現 |
| 文字條件 | 提供內容與風格方向 | 所有細節都會被遵守 |
文字生圖(Text-to-Image)是什麼:把描述轉成可挑選的影像文字生圖(Text-to-Image)是什麼:把描述轉成可挑選的影像文字生圖就是生圖 AI 在做的事:把主體、場景和風格描述轉成影像,但提示詞不是每個像素都會遵守的施工圖。本文以校園閱讀角提案為例,示範如何寫出可驗收的要求、比較候選圖與處理不合格細節,並區分文字生圖、圖片編修和擴散模型,說明負面提示與引導設定的適用界線,讓生成素材能接進實際設計工作。閱讀全文
生成式 AI(Generative AI)是什麼生成式 AI(Generative AI)是什麼生成式 AI 從資料學到模式,依輸入條件產生文字、影像、聲音等內容。本文以社區二手市集宣傳素材為例,說明生成與分類、搜尋的差別,介紹語言模型、擴散與對抗生成等不同途徑,並解析內容看起來合理卻可能不忠於事實的原因。讀完能把創意需求、必須保留的資訊與人工驗收分開安排,判斷哪些產物仍只是待確認草稿。閱讀全文
文字生影片(Text-to-Video)是什麼:讓畫面在時間裡保持連貫文字生影片(Text-to-Video)是什麼:讓畫面在時間裡保持連貫文字生影片是影片生成 AI 的基本任務:依描述生成動態畫面,除了物件與風格,還要處理動作順序、鏡頭和跨影格一致性。本文以陶杯轉動展示的示意案例,拆解怎麼寫單一鏡頭、檢查物件是否變形,以及如何分辨影格數、播放速度與真正的動作品質,並說明它和圖片生影片、動畫及剪輯工作的關係,避免把漂亮首幀當成整段影片合格。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算