生活分享
Gemini Omni 在 I/O 亮相:用對話改影片,素材與連續性仍要自己把關
回顧 Google I/O 發布的 Gemini Omni 對話式影片編輯,以自攝陶藝短片為情境,深入探討鏡頭連續性、多輪修改漂移與素材版權把關要點。
更新日期: 閱讀時間約 7 分鐘

事件日期:2026-05-19;本文查核日期:2026-09-14。5 月 19 日 Google I/O 發布 Gemini Omni,初期以影片生成與對話式編輯為重點。
官方示範用文字、圖片、影片作參考,多輪修改場景和角度;音訊參考初期只支援聲音參考,其他音訊是後續計畫。同日 Gemini app 公告列 Plus/Pro/Ultra 分批取得;Flow 等入口有各自供應條件。官方稱物理與場景連貫有所進步,不能當作所有生成影片都符合真實世界或已取得素材權利。以下生活與工作情境為編輯設計的例子,供讀者自行驗證,並非本站產品實測。
拍攝前規劃鏡頭清單與不可變更項目
在運用生成工具介入影片製作之前,最根本的工作依然是扎實的分鏡規劃。以拍攝陶藝拉坯為例,創作者必須先在腳本中明確列出每個鏡頭的拍攝距離、主體焦點與預期畫面動態。拉坯過程包含定中心、開孔、拉高到塑形等多個連續動作,若沒有預先定義鏡頭清單,直接將未經整理的片段送入模型處理,很容易在對話互動過程中失去焦點,導致產出的畫面支離破碎。
除了鏡頭清單之外,創作者更要在專案啟動時劃定主體的不可改項目。陶藝工作室的背景陳設、拉坯機的旋轉方向、陶土的初始份量以及陶藝師的袖口造型,都應該屬於固定不變的視覺錨點。如果在向模型下達調整角度或更換景別的指令時,未將這些固定基準明確鎖定,模型便可能自由發揮,改變原本具備工藝辨識度的核心細節,增加後續銜接的難度。
對話式多輪調整機制與提示詞漂移防範
對話式編輯的核心優勢在於創作者能以自然語言持續微調微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文鏡頭,例如要求拉近特寫或變換俯視角度。然而多輪對話也是產生提示詞漂移的主要來源,當指令層層疊加時,系統往往會逐漸偏離第一輪所設定的環境基調。若創作者直接拿前一輪生成的修改結果繼續往下修正,幾次對話之後,陶土的成色可能變調,原本質樸的木質工作台甚至可能演變成風格突兀的現代桌面。
避免視覺漂移的有效作法,是堅持以原始實拍素材為唯一輸入基準,而非以生成後的影片反覆當作下一輪輸入。每當需要嘗試新的視角或運鏡路徑時,應回到最初確認無誤的參考影片與靜態圖檔,並將修改需求重新組織在單一指令內,清晰指出哪些元素需沿用原素材、哪些視角允許重繪。透過將參照點拉回原點,才能在多輪測試中保有畫面風格的一致性。
首發公告說明音訊輸入初期只支援人聲參考,其他音訊輸入仍是後續計畫。這項限制談的是輸入參考的類型,不能解讀成模型完全不能生成環境音。若陶藝短片需要忠實保留現場陶輪或水聲,較直接的做法仍是保留原始收音,再依實際作品需要決定哪些聲音可用生成素材補充。
| 檢核項目 | 常見潛在瑕疵 | 驗收把關方式 |
|---|---|---|
| 手部動作與陶土交互 | 手指關節融合、陶泥厚度非物理突變 | 逐格核對拉坯受力點與離心力水痕流向 |
| 工作空間環境光源 | 轉換鏡頭視角後陰影方向或色溫跳動 | 比對主光源角度,確保固定照明邏輯一致 |
| 台面周邊工具配置 | 修坯刀或海綿無故移位、憑空消失 | 盤點鏡頭內周邊道具,維持前後鏡頭關聯 |
| 多輪提示詞風格漂移 | 陶土成色與工作室背景風格逐漸變質 | 以原始未修素材為參照,避免遞歸修改 |
| 現場收音與音訊參考 | 首發音訊輸入只支援人聲參考 | 真實環境聲保留原始錄音,另核對目前入口的支援範圍 |
陶藝製作過程的手部細節與物理邏輯檢驗
工藝類短片的核心說服力建立在嚴謹的物理真實性上,而手部動作成形過程往往是生成模型最容易產生破綻的環節。陶藝師在拉坯時,雙手必須維持特定的施力角度,拇指與食指的擠壓力量會直接帶動泥牆向上延伸。驗收生成畫面時,必須逐格檢視手指關節是否出現不自然融合、指尖水痕流向是否順應離心力,以及陶土旋轉時的厚薄變化是否符合塑性力學。
雖然模型開發團隊宣稱物理表現持續進步,但這項宣稱並不能作為所有畫面均符合現實的保證。偶爾出現的泥料瞬間平滑化、旋轉中心無故位移等細微瑕疵,可能一般觀眾難以立刻察覺,卻會嚴重破壞專業工藝愛好者的信任感。因此在工作流程中,涉及技術細節的核心動作應優先保留實拍真實鏡頭,生成技術則退居輔助過場或視角補足,切忌本末倒置。
光影方向一致性與工作室工具配置查核
影片的連續性除了取決於主體動作,更仰賴整體空間光影的邏輯呼應。陶藝工作室通常具有固定的主光源,例如側面的窗戶日光或斜上方的工作投射燈。當使用指令要求轉換為俯瞰視角時,必須仔細核對陶坯內外側的陰影深淺是否正確。若前一個中景鏡頭的光源來自左側,切換到生成特寫時陰影卻落在相反方向,接剪在一起就會產生強烈的視覺突兀感。
工作台上的輔助工具同樣需要嚴格的空間配置檢驗。修坯刀、修邊木片、割線與吸水海綿在拉坯不同階段各司其職,它們在台面上的擺放位置必須具有合理的因果關係。不能在前一個鏡頭看見海綿浸在水盆裡,下一秒切換角度後海綿卻瞬間出現在乾燥的泥台旁。創作者在驗收每段輸出時,需建立周邊道具清單,確認物件不會在對話編輯中憑空出現或位移。
完成單一鏡頭的微調後,必須將所有片段依序放回非線性剪輯軌道進行動態驗收。單獨觀看一個生成片段時或許覺得畫面精美,但唯有與前後實拍鏡頭連貫播放,才能看出轉場瞬間的速度節奏、反光高光點以及色溫是否有微幅跳動。只有通過剪輯軌道交叉比對的片段,才能被視為合格素材,納入最終短片的調色與混音排程中。
素材使用授權邊界與真實紀錄呈現原則
自攝素材也可能包含其他人的面容、作品或品牌資訊。公開製作前,可以先確認參與者同意的使用範圍,並核對所用參考素材及平台條款。生成工具的輸出或浮水印不能代替這些確認;若對特定公開用途的權利仍有疑問,應先釐清再發布,不把模型給出的回答當成授權證明。
最後,創作者在發表短片時應對受眾保持透明誠實,切勿將生成或重構後的工藝畫面包裝成未經修改的現場真實紀錄。工藝的價值在於人手與材料之間的真實博弈,AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 輔助鏡頭調校可以作為視角表現的創意延伸,但若過度修飾而掩蓋實際製作流程,便失去了紀錄的初衷。確立實拍為主、生成為輔的守則,方能在擁抱新工具的同時守護內容的信譽。
2026 年 AI 新聞總整理:1 月至 9 月的重點與生活應用2026 年 AI 新聞總整理:1 月至 9 月的重點與生活應用從 2026 年 1 月至 9 月,依月份整理 AI 重要新聞,連到完整解析,多數另有簡體中文、英文、日文與韓文版。涵蓋模型、工作工具、創作、費用與透明度,說明事件背景、生活用途與開放限制。閱讀全文
Gemini Spark 與 Daily Brief:AI 從晨間摘要走向背景辦事Gemini Spark 與 Daily Brief:AI 從晨間摘要走向背景辦事分析 Google 於 2026 年發布的 Gemini Spark 與 Daily Brief 技術脈絡,探討背景雲端代理在志工排班等日常場景中的四級架構、錯誤放大風險與授權檢核機制。閱讀全文
同主題延伸閱讀
生活分享
NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起價 4,999 美元,兩台可串接成 128GB
NVIDIA 於 2026 年 10 月 2 日宣布,個人 AI 電腦 DGX Spark 新增較平價的 64GB 記憶體版本,10 月 23 日起由 Acer、ASUS 等六家廠商供應,主要對象是想在自己機器上執行 AI 模型的開發者與研究人員。以下整理 NVIDIA 公布的規格、雙機串接說法,以及對一般讀者的意義。
生活分享
Google Cloud 宣布 Spanner queues 正式推出:把訊息佇列放進資料庫交易,瞄準 AI 代理可靠性
Google Cloud 宣布 Spanner queues 正式推出,讓訊息建立成為資料庫交易的一部分,目標是解決 AI 代理「狀態」與「動作」不同步的問題。本文整理官方說法、主要功能與對一般讀者的意義。
生活分享
GPT-6.1 Sol 推出:新一版 Sol 上 API、Codex 與 ChatGPT Work,Chat 裡沒有
OpenAI 在 2026 年 9 月 29 日推出 GPT-6.1 Sol,API 名稱是 gpt-6.1-sol:Plus、Pro、Business、Enterprise、Edu 方案的 Codex 與 ChatGPT Work 在首發推出範圍內,Enterprise 與 Edu 要管理員啟用,Free 與 Go 首發不含,Chat 裡沒有(2026 年 9 月查證)。
生活分享
Claude Sonnet 5.5 推出:牌價與 Sonnet 5 相同,API、雲端平台與 Claude.ai 都能用
Anthropic 在 2026 年 9 月 28 日推出 Claude Sonnet 5.5,API 牌價與 Sonnet 5 相同(每百萬 tokens 輸入 2 美元、輸出 10 美元);Claude.ai、API 與多個雲端平台可用,較高風險的資安請求會退回 Sonnet 5 處理(2026 年 9 月查證)。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Google:Gemini Omni · 查證日期:
- Google:Flow 與 Flow Music 更新 · 查證日期: