生活分享

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上線企業版:會說話的 AI 虛擬人走進客服

Google 表示,結合即時語音對話與同步唇形影像虛擬人的 Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 正式提供,並以 SynthID 浮水印與自訂虛擬人允許清單作為防濫用措施。本文整理功能、狀態與對一般人的影響。

閱讀時間約 7 分鐘

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上線企業版:會說話的 AI 虛擬人走進客服
圖片:Mokaair (Original editorial artwork)

發生了什麼:Live Avatar 正式進入企業版

Google Cloud 部落格宣布,Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 正式提供(generally available,意指結束測試階段、開放企業用於正式業務),並稱這項技術已可用於企業正式環境;該篇 Google Cloud 部落格文章日期為 2026 年 9 月 25 日。另有一篇介紹該功能的文章發布於 blog.google,日期為 2026 年 9 月 24 日。據 Google 表示,這項技術曾在 Google Cloud Next 2026 首度預覽。

這次上線建立在 Google 於 2026 年 9 月 15 日發表的 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 之上。據 Google 表示,Gemini 3.8 Live 著重規模與成本效率,Extended Thinking 則針對高複雜度與多步驟推理任務。以上資訊均來自 Google 自家網站,尚未有獨立來源證實。

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上線企業版:會說話的 AI 虛擬人走進客服
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

功能重點與目前狀態比較

據 Google 表示,Live Avatar 可為網頁、行動裝置與互動式資訊站上的對話式影片代理(能以影像和人對談、代辦事務的 AI 程式)生成具同步唇形的虛擬人。Gemini 3.8 Live 能理解並說 97 種語言、可自動偵測語言,虛擬人的唇形與表情也能在這些語言間切換。模型可在背景執行工具與 API 呼叫(也就是讓 AI 去查資料或操作其他系統),同時持續對話;即時視覺理解則可同時處理鏡頭畫面、螢幕分享與音訊。Google 另稱,正式版提供美國與歐盟端點(處理資料的伺服器所在區域)、預留輸送量(企業可預先保留的處理容量)、企業合規與資料治理。

Gemini 3.8 Live 系列各項目比較(資料來源:Google)
項目Google 公布日期Google 描述的定位目前狀態(據 Google)
Gemini 3.8 Live2026 年 9 月 15 日規模與成本效率、流暢對話與視覺理解已發表;作為 Live Avatar 的語音基礎
Gemini 3.8 Live Extended Thinking2026 年 9 月 15 日高複雜度任務與多步驟推理私人預覽(尚未公開提供)
Gemini 3.8 Live with Live Avatar2026 年 9 月 24 日(blog.google 介紹文章)/9 月 25 日(Google Cloud 部落格宣布正式提供)同步唇形的影像虛擬人Gemini Enterprise 正式提供,美國與歐盟端點
自訂虛擬人2026 年 9 月 24 日以參考圖片生成品牌專屬虛擬人僅限允許清單與驗證的企業

在效能方面,Google 表示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的語音對語音(AI 直接聽語音、直接以語音回答)品質指數以 82.6 分居首,在 τ-Voice 得 68.6%、Big Bench Audio 得 97.7%;Gemini 3.8 Live 則在 Speech Agent Arena 取得第二名。這些成績由 Google 自行公布,讀者宜視為廠商說法。

身分保護與浮水印措施

能以真人外貌即時說話的 AI 虛擬人,最受關注的風險是冒用身分與誤導。據 Google 表示,客戶可從預建虛擬人資料庫中選用;若要以參考圖片生成自訂虛擬人,須通過企業允許清單(只有列入名單的企業才能使用)與驗證程序。Google 也稱,所有生成的音訊與影像串流都帶有肉眼難以察覺的 SynthID 浮水印,目的是讓 AI 生成內容可被偵測。

對一般讀者的實際影響

這次發布對象是企業與開發者,一般消費者不會直接購買或啟用這項服務。實際影響在於:採用的企業可能把 AI 虛擬人放進客服、購物導覽或報到流程。Google Cloud 部落格舉例,Cox Automotive 為 Autotrader 打造 AI 購物助理,引導購車者搜尋與比較車輛;Google 也展示保險理賠受理示範,使用者對著鏡頭說明損壞,由背景代理查核保單並整理資料。

Google Cloud 部落格另引述 Equal AI 執行長 Akhilesh Damaraju 表示,其 AI 每天以九種印度語言處理逾百萬通即時通話;並引述 Salesforce 的 Bob Van Osten 提及 Gemini 3.8 Live 與 Agentforce 的合作。這些都是 Google 選錄的客戶說法。對使用者來說,多語言、可看畫面的 AI 客服可能讓部分服務更方便,但也代表你分享給鏡頭的畫面與聲音會交由企業的 AI 系統處理,使用前值得留意該企業的隱私說明。

常見問題

一般人現在可以自己使用 Live Avatar 嗎?

據 Google 表示,Gemini 3.8 Live with Live Avatar 是在 Gemini Enterprise 提供給企業客戶,並透過 API(讓企業把功能接進自家程式的介面)供開發者整合。一般人較可能是在企業的網站、App 或資訊站上間接接觸到它。

Live Avatar 和之前發表的 Gemini 3.8 Live 有什麼不同?

Google 在 2026 年 9 月 15 日發表的 Gemini 3.8 Live 是即時語音對話模型;隨後推出的 Live Avatar(blog.google 介紹文章日期 9 月 24 日,Google Cloud 部落格宣布正式提供日期 9 月 25 日)則在其上加入具同步唇形的影像虛擬人,讓對話代理有可見的形象。

Extended Thinking 也一起正式上線了嗎?

沒有。據 Google Cloud 部落格,Gemini 3.8 Live Extended Thinking 仍處於私人預覽,尚未公開提供;正式提供的是 Gemini 3.8 Live with Live Avatar。

有人能用它冒充別人的臉嗎?

Google 表示,自訂虛擬人須經企業允許清單與驗證程序,一般客戶只能從預建虛擬人資料庫選用;所有輸出也帶有 SynthID 浮水印。這些是 Google 描述的防護措施,實際成效尚無獨立驗證。

支援中文嗎?

Google 表示 Gemini 3.8 Live 支援 97 種語言並可自動偵測,但公告中沒有列出完整語言清單,因此目前無法確認特定語言的支援程度。

使用費用是多少?

Google Cloud 部落格只表示價格列於其定價頁面,公告本身沒有提到具體金額。

Google 還有哪些相關的語音模型?

Google Cloud 部落格列出 Gemini 3.5 Transcribe 與 Gemini 3.5 Live Translate 等。Google 稱 3.5 Transcribe 於 2026 年 8 月 26 日發表,可轉錄逾 85 種語言;3.5 Live Translate 於 2026 年 6 月 9 日發表,可在逾 70 種語言間近即時翻譯語音。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享