生活分享

Google 推出 Gemini 3.8 Live with Live Avatar:會說話、有表情的企業 AI 虛擬形象

Google 於 2026 年 9 月 24 日宣布 Gemini 3.8 Live with Live Avatar,在即時語音對話上加入近即時生成、會對嘴與做表情的虛擬人物影像,先於企業服務 Gemini Enterprise 提供。本文說明它能做什麼、有哪些限制,以及一般人可能在哪裡遇到它。

閱讀時間約 5 分鐘

Google 推出 Gemini 3.8 Live with Live Avatar:會說話、有表情的企業 AI 虛擬形象
圖片:Mokaair (Original editorial artwork)

Google 宣布了什麼

Google 於 2026 年 9 月 24 日在官方部落格發布 Gemini 3.8 Live with Live Avatar。Google 表示,這是延續上週 Gemini 3.8 Live 發布後的新功能,把近即時影片生成與語音結合,讓 AI 以一個能聆聽、觀看並說話的動態虛擬形象與人對話。

據 Google 說明,Live Avatar 具備精準對嘴、自然表情與流暢的輪流對話,可用於客戶服務或互動式導覽等企業情境。Google 表示,該功能自發布當天起在企業服務 Gemini Enterprise 提供,並附有 API 文件供開發者使用(API 是讓開發者把功能接入自家網站或系統的程式介面)。換句話說,它是賣給企業使用的工具,一般人多半會在企業的服務中遇到它。

Google 推出 Gemini 3.8 Live with Live Avatar:會說話、有表情的企業 AI 虛擬形象
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

主要功能:Google 的說法

  • 同時看與聽(多模態輸入):Google 稱 Live Avatar 會同時處理視覺與音訊輸入,再以帶表情的語音與影像回應。
  • 邊聊邊查資料(非同步工具呼叫):Google 表示,虛擬形象可在對話持續時於背景呼叫其他工具、擷取資料,不必中斷談話;示範情境是飯店旅客入住登記。
  • 多語言:Google 稱可在 97 種語言間切換,並表示不會降低影片畫質或產生視覺漂移(即畫面人物逐漸走樣、變形)。
  • 自訂形象:除預設形象庫外,開發者可從高品質參考圖像生成自訂形象;Google 表示此功能目前只透過企業允許清單提供,也就是僅限經 Google 核准的企業使用。

Gemini 3.8 Live 與 Live Avatar 比較

token 是 AI 計算處理內容多寡的單位。資料來源:Google 部落格與 Google DeepMind Gemini 3.8 Audio 模型卡
項目Gemini 3.8 Live加上 Live Avatar
輸出類型音訊與文字音訊、影片與文字
輸出上限64K token24K token
提供管道Gemini API、Gemini App、Google AI Studio、Gemini Enterprise Agent Platform、Google Search Live(依模型卡)Gemini Enterprise(依 Google 部落格)
連續互動時間模型卡未另外註明數分鐘,而非數小時(依模型卡)

模型卡是 Google 說明模型能力、限制與安全表現的文件。根據 Google DeepMind 的模型卡,Gemini 3.8 Audio 以 Gemini 3 Pro 為基礎,Gemini 3.8 Live 的輸入可包含音訊、圖像、影片與文字,上下文視窗(模型一次能參考的內容量)最多 128K token。模型卡也提到,模型可能出現「幻覺」(說出看似合理但錯誤的內容)等基礎模型的一般限制,偶有緩慢或逾時,知識截止日期為 2025 年 1 月。

安全與透明:SynthID 浮水印

Google 表示,其 AI 產品生成的所有輸出都加上 SynthID 浮水印,並直接嵌入音訊與影片中。根據 Google DeepMind,SynthID 的浮水印人類無法察覺,但可由 SynthID 技術偵測;使用者可把圖像、影片或音訊上傳到 Gemini,詢問是否由 Google AI 生成或修改。Google DeepMind 另表示,SynthID Detector 驗證入口目前正與記者和媒體專業人士合作測試。

模型卡另稱,Google 依據 Gemini 3.7 Flash 的評估結果,認為 Gemini 3.8 Live 等模型不太可能達到其前沿安全框架中的「追蹤或關鍵能力等級」,也就是 Google 用來判斷模型能力是否需要特別管控的門檻。這是 Google 的自我評估,並非外部獨立審查結論。

常見問題

一般人現在可以使用 Live Avatar 嗎?

據 Google 部落格,Gemini 3.8 Live with Live Avatar 目前在 Gemini Enterprise 提供,主要面向企業與開發者;自訂虛擬形象更只開放給 Google 核准的企業。一般使用者較可能是在企業的客服或導覽服務中間接接觸到。

Live Avatar 能說哪些語言?

Google 表示,Live Avatar 可在 97 種語言間切換,並在對話中途轉換語言時調整對嘴與表情。Google 的公告並未列出完整語言清單。

可以跟它聊很久嗎?

不行。Google DeepMind 模型卡指出,搭配 Live Avatar 的版本可支援數分鐘的連續互動,而非數小時;也可能偶有緩慢或逾時。

怎麼知道畫面中的人物是 AI 生成的?

Google 表示其 AI 產品輸出都嵌有 SynthID 浮水印。根據 Google DeepMind,可將圖像、影片或音訊上傳到 Gemini,詢問是否由 Google AI 生成或修改。此方法只能判斷 Google AI 的內容。

這些功能說法經過獨立驗證了嗎?

沒有。本文所有資訊均來自 Google 及 Google DeepMind 官方頁面,包括功能、語言數量與安全評估,均屬 Google 自身說法。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享