生活分享

Gemini 圖片生成與修圖:提示詞與參考圖

把 Gemini 當修圖 AI:這篇用一張自製杯子商品概念圖,練習圖片生成、參考圖與局部修改。學完可以把主體、背景、構圖和要保留的細節寫清楚,並用前後對照檢查修改是否符合需求。本篇的提示詞與預期結果是教學範例,沒有冒充實際由 Gemini 生成的作品。

更新日期: 閱讀時間約 5 分鐘

修圖前先固定主體的原創插畫,以文件、裝置與流程等物件呼應提示詞與參考圖;非產品介面。
圖片:Mokaair (© Mokaair)
本篇目錄
  1. 開始前:圖片模型與入口
  2. 第一步:把需求寫成構圖說明
  3. 第二步:用參考圖約束主體
  4. 第三步:每次只修改一類問題
  5. 第四步:文字、圖解與高細節重做
  6. 第五步:下載並檢查實際檔案
  7. 常見問題
  8. 完成後的檢核

這篇用一張自製杯子商品概念圖,練習 Gemini 的圖片生成、參考圖與局部修改。學完可以把主體、背景、構圖和要保留的細節寫清楚,並用前後對照檢查修改是否符合需求。本篇的提示詞與預期結果是教學範例,沒有冒充實際由 Gemini 生成的作品。修圖 改得準不準,多半取決於你有沒有說清楚要保留什麼。

參考圖:說明形狀與顏色用途;單次修改:只改一類問題;前後比對:檢查輪廓與留白
修圖前先固定主體。此為原創教學圖解,並非產品畫面或實測輸出。 · 圖片:Mokaair (© Mokaair)

開始前:圖片模型與入口

依 2026 年 9 月 14 日官方文件,Flash-Lite 的圖片請求對應 Nano Banana 2 Lite,Flash 或 Pro 的一般圖片請求對應 Nano Banana 2;符合條件的訂閱者可再用 Nano Banana Pro 重新生成。文字對話模型的選擇會影響圖片路線,詳見。

本篇採電腦網頁,手機介面請對照實際可用控制。圖片編輯目前不適用未滿十八歲使用者,個人與 Workspace 帳號還有各自的功能條件。先準備自己拍攝或有權使用的圖片,並確認,不要一次提交很多變體後才發現用量不足。

Nano Banana 2 Lite 不適合多張參考圖與多輪修改,因此本篇的參考圖練習應使用支援的圖片模型。名稱相似不代表每個版本都能完成同樣工作;遇到限制時先檢查目前模型,再調整提示詞。

第一步:把需求寫成構圖說明

先決定圖片的用途,例如網站文章的橫式封面。寫出一個主體、一個場景、一種光線和需要留白的位置;這比堆疊十幾個風格詞更容易檢查。若圖片將來需要活動日期或產品尺寸,先把字留給後續排版,避免在視覺草稿階段反覆校正文字。

第一張概念圖 · text
生成一張橫式 16:9 的商品概念插圖。
主體是一隻沒有商標的霧面奶油白陶瓷杯,放在淺木色桌面。
杯子位於畫面右側,左側保留乾淨留白,供後續加入標題。
採柔和自然窗光,背景只有淡米色牆面,不加入其他杯子或餐具。
這是概念插圖,不要加價格、促銷標語、品牌或浮水印文字。

在 Gemini 網頁側邊欄的圖片入口輸入提示詞,送出後查看構圖。成功的判斷是杯子數量、位置、留白和背景符合要求,不是只看細緻程度。若比例或主體位置不對,先修這些基本問題,再增加裝飾。

第二步:用參考圖約束主體

若想保留實際杯子外形,上傳自己拍攝的正面與側面照片,分別說明哪張負責形狀、哪張負責顏色。照片最好主體清楚、背景簡單,避免模型把旁邊其他物品也當成產品的一部分。上傳後看縮圖確認沒有選錯檔案。

參考圖說明 · text
使用附件一作為杯子外形參考,附件二隻參考釉面顏色。
保留杯口輪廓、把手方向與杯身比例。
把背景改成乾淨的淺木桌面,柔和窗光從左上方照入。
不要增加圖案或文字;不要把兩張照片中的杯子合成兩只。
若無法準確保留某個細節,請說明可能變動之處。

預期會得到以參考主體為基礎的新圖,但細節仍可能改變。把杯把、底部、紋理和邊緣放大檢查,不要把生成圖當成商品尺寸、材質或真實外觀的證明。正式商品頁若需要忠實展示,應保留實拍照片並標示概念圖用途。

第三步:每次只修改一類問題

在媒體庫找到要改的圖片,開啟後使用對話入口;也可直接上傳圖片要求編輯。先指明目標位置和變更,再列出需保持的項目。例如只改背景顏色,就不要同時要求換角度、移動光源和加道具,否則很難辨認哪些變更是意外發生。

局部修改提示詞 · text
請只把杯子後方牆面改為淡灰綠色。
保留杯子的形狀、把手、位置、大小、桌面與原本光影。
左側留白維持乾淨,不加入植物、文字或其他物品。
這次不改杯子本身,也不改成另一種攝影角度。

「只修改」是需求描述,不是保證每個像素都不變。把修改前後放在相同大小比較,至少檢查主體輪廓、光影和物件數量。如果杯子也被改了,回到原始圖片重新下更明確的指示,不必在已偏離的版本上一直追加修補。

對多輪修改,可以自行命名為原圖、背景版、構圖版和最終版,記下每次改什麼。版本名稱不要只寫最新,否則下次不知道最新保留的是哪個主體。如果要套用到多張圖片,先用一張完成整套驗收,再決定是否擴大處理。

第四步:文字、圖解與高細節重做

需要圖片含文字時,先提供完整字串並限制字數;生成後逐字對照,不只看遠處是否像中文。日期、網址、價格和電話錯一個字就可能造成誤解,適合在一般排版工具中另加可編輯文字。圖解中的箭頭、單位和順序也需人工核對。

符合資格時可在圖片的更多選單使用「用 Pro 重新生成」,再比對細節是否改善。這是重新生成,不應當成完全無損放大;也不代表額度用完後可以無限切換版本。是否可用與剩餘用量應看當下介面。

第五步:下載並檢查實際檔案

電腦網頁可將遊標移到圖片,選下載原尺寸。下載後打開檔案,確認實際像素、比例和背景;分享連結與圖片檔案是不同成果。若要放網站,應另外製作適當檔案大小與替代文字,並用手機查看主體是否被裁切。

本文網站配圖是原創教學示意,不是 Gemini 介面截圖或模型實測圖。若你將生成圖用在作品集,建議保留提示詞、來源圖片授權與輸出日期;真實人物、商標和商品也要依實際使用情境檢查,不應只因工具能生成就推定可任意使用。

常見問題

「上傳多張圖卻只用了其中一張?」先確認模型支援多圖,再逐張描述用途。把兩張都稱為參考圖,沒有交代應保留哪一張的形狀與風格,容易導致混合錯誤。

「局部修圖改到整張?」回到原始圖,縮小一次修改的範圍,明確說明位置及保留項目。若需要精準像素級選取或完全保留其他區域,應搭配能直接編輯圖層或遮罩的工具。

「為什麼沒有 Google 相簿連接?」查證時圖片個人化與相簿相關入口有美國、年齡及帳號限制;台灣讀者不能把那些步驟當成普遍可用。一般手動上傳和授權是不同路線。

「想讓杯子動起來?」先保留已核對的主體圖,再閱讀。影片還要控制動作、鏡頭與時間連續性,靜態圖正確不代表每一格都會一致。

完成後的檢核

完成實作後逐項確認。
檢查項目通過條件
操作能依正文重做一次,說明每一步使用的輸入。
結果能用原始資料或可重現測試核對輸出,而非只看語氣。
延伸知道下一篇教學解決的問題,以及什麼時候需要它。

接著可以閱讀 、,把本篇的操作接到下一個工作流程。

  • 生活分享

    本機跑 Stable Diffusion 與 Flux:ComfyUI 入門

    ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。

  • 生活分享

    通義千問 Qwen:開放權重模型家族與 Qwen Studio

    阿里巴巴的通義千問 Qwen 一邊把權重放上 Hugging Face 讓人下載,一邊經營叫 Qwen Studio(原 Qwen Chat)的網頁與 App。這篇用 2026 年 9 月查證的官方頁面,說清楚家族成員、模型卡上的參數規模與上下文視窗、Apache 2.0 與兩份 Qwen 授權差在哪、台灣能不能註冊,以及國際站 Qwen Cloud 與中國站阿里雲百煉的 API 價格。

  • 生活分享

    Mistral Vibe(原 Le Chat):歐洲 AI 助手的方案、功能與資料存放

    法國 Mistral AI 的 Le Chat 已改名為 Vibe,分成 Work、Code、Chat 三種模式。這篇整理官網當天的內容:台灣怎麼註冊與下載、Free 與每月 14.99 美元的 Pro 等四個方案給什麼、官方列出的功能、Mistral Large 3 等模型與 Apache 2.0 開放權重、API 每百萬 token 價格,以及資料預設存在歐盟、訓練開關怎麼關。

  • 生活分享

    MiniMax 語音合成:中文配音、有聲書與影片旁白

    把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。

最新旅遊情報攻略

資料來源

生活分享