生活分享

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上线企业版:会说话的 AI 虚拟人走进客服

Google 表示,结合实时语音对话与同步唇形影像虚拟人的 Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 正式提供,并以 SynthID 水印与自定义虚拟人允许名单作为防滥用措施。直接使用者是企业与开发者,普通人则可能在客服、购物等场景遇到它。本文梳理其功能、状态以及对普通人的影响。

阅读时间约 7 分钟

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上线企业版:会说话的 AI 虚拟人走进客服
图片:Mokaair (Original editorial artwork)

发生了什么:Live Avatar 正式进入企业版

Google Cloud 博客宣布,Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 正式提供(generally available,即正式版,不再只是预览测试),并称这项技术已可用于企业生产环境;该篇 Google Cloud 博客文章日期为 2026 年 9 月 25 日。另有一篇介绍该功能的文章发布于 blog.google,日期为 2026 年 9 月 24 日。据 Google 表示,这项技术曾在 Google Cloud Next 2026 首度预览。

此次上线建立在 Google 于 2026 年 9 月 15 日发布的 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 之上。据 Google 表示,Gemini 3.8 Live 侧重规模与成本效率,Extended Thinking 则面向高复杂度与多步骤推理任务。以上信息均来自 Google 自家网站,尚无独立来源证实。

Google 宣布 Gemini 3.8 Live with Live Avatar 正式上线企业版:会说话的 AI 虚拟人走进客服
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

功能要点与当前状态对比

据 Google 表示,Live Avatar 可为网页、移动设备与交互式信息亭上的对话式视频代理生成具有同步唇形的虚拟人。这里的“代理”指能与人对话并代为处理任务的 AI 程序。Gemini 3.8 Live 能理解并说 97 种语言、可自动检测语言,虚拟人的唇形与表情也能在这些语言间切换。模型可在后台执行工具与 API 调用,同时持续对话;API 是让不同软件互相连接的程序接口。实时视觉理解则可同时处理摄像头画面、屏幕共享与音频。Google 另称,正式版提供美国与欧盟端点(即位于这两个地区的服务接入点)、预留吞吐量(为企业预先保留的处理容量)、企业合规与数据治理。

Gemini 3.8 Live 系列各项目对比(资料来源:Google)
项目Google 公布日期Google 描述的定位当前状态(据 Google)
Gemini 3.8 Live2026 年 9 月 15 日规模与成本效率、流畅对话与视觉理解已发布;作为 Live Avatar 的语音基础
Gemini 3.8 Live Extended Thinking2026 年 9 月 15 日高复杂度任务与多步骤推理私人预览
Gemini 3.8 Live with Live Avatar2026 年 9 月 24 日(blog.google 介绍文章)/9 月 25 日(Google Cloud 博客宣布正式提供)同步唇形的影像虚拟人Gemini Enterprise 正式提供,美国与欧盟端点
自定义虚拟人2026 年 9 月 24 日以参考图片生成品牌专属虚拟人仅限允许名单与验证的企业

在性能方面,Google 表示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音对语音质量指数中以 82.6 分居首,在 τ-Voice 得 68.6%、Big Bench Audio 得 97.7%;Gemini 3.8 Live 则在 Speech Agent Arena 取得第二名。这些成绩由 Google 自行公布,读者宜视为厂商说法。

身份保护与水印措施

能以真人外貌实时说话的 AI 虚拟人,最受关注的风险是冒用身份与误导。据 Google 表示,客户可从预建虚拟人库中选用。若要以参考图片生成自定义虚拟人,须通过企业允许名单与验证程序;允许名单指只有获准的企业才能使用这项功能。Google 也称,所有生成的音频与影像流都带有肉眼难以察觉的 SynthID 水印,这是一种嵌入内容中的隐形标记,目的是让 AI 生成内容可被检测。

对普通读者的实际影响

此次发布的对象是企业与开发者,普通消费者不会直接购买或启用这项服务。实际影响在于:采用的企业可能把 AI 虚拟人放进客服、购物导览或登记流程。Google Cloud 博客举例,Cox Automotive 为 Autotrader 打造 AI 购物助手,引导购车者搜索与比较车辆;Google 也展示了保险理赔受理演示,用户对着镜头说明损坏情况,由后台代理核查保单并整理资料。

Google Cloud 博客另引述 Equal AI 首席执行官 Akhilesh Damaraju 表示,其 AI 每天以九种印度语言处理逾百万通实时通话;并引述 Salesforce 的 Bob Van Osten 提及 Gemini 3.8 Live 与 Agentforce 的合作。这些都是 Google 选录的客户说法。对用户来说,多语言、能看画面的 AI 客服可能让部分服务更方便,但也意味着你分享给镜头的画面与声音会交由企业的 AI 系统处理,使用前值得留意该企业的隐私说明。

常见问题

普通人现在可以自己使用 Live Avatar 吗?

据 Google 表示,Gemini 3.8 Live with Live Avatar 是在 Gemini Enterprise 提供给企业客户,并通过 API 供开发者集成。普通人更可能是在企业的网站、App 或信息亭上间接接触到它。

Live Avatar 和之前发布的 Gemini 3.8 Live 有什么不同?

Google 在 2026 年 9 月 15 日发布的 Gemini 3.8 Live 是实时语音对话模型;随后推出的 Live Avatar(blog.google 介绍文章日期 9 月 24 日,Google Cloud 博客宣布正式提供日期 9 月 25 日)则在其基础上加入具有同步唇形的影像虚拟人,让对话代理有可见的形象。

Extended Thinking 也一起正式上线了吗?

没有。据 Google Cloud 博客,Gemini 3.8 Live Extended Thinking 仍处于私人预览,也就是尚未向所有客户开放;正式提供的是 Gemini 3.8 Live with Live Avatar。

有人能用它冒充别人的脸吗?

Google 表示,自定义虚拟人须经企业允许名单与验证程序,一般客户只能从预建虚拟人库中选用;所有输出也带有 SynthID 水印。这些是 Google 描述的防护措施,实际效果尚无独立验证。

支持中文吗?

Google 表示 Gemini 3.8 Live 支持 97 种语言并可自动检测,但 Google 的公告没有列出完整语言清单,因此无法确认特定语言的支持程度。

使用费用是多少?

Google Cloud 博客只表示价格列于其定价页面,公告本身没有给出具体金额。

Google 还有哪些相关的语音模型?

Google Cloud 博客列出了 Gemini 3.5 Transcribe 与 Gemini 3.5 Live Translate 等。Google 称 3.5 Transcribe 于 2026 年 8 月 26 日发布,可转录逾 85 种语言;3.5 Live Translate 于 2026 年 6 月 9 日发布,可在逾 70 种语言间近实时翻译语音。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享