生活分享

Google 推出 Gemini 3.8 Live with Live Avatar:会说话、有表情的企业 AI 虚拟形象

Google 于 2026 年 9 月 24 日宣布 Gemini 3.8 Live with Live Avatar,在实时语音对话中加入近实时生成的虚拟人物影像,首先在 Gemini Enterprise 提供。本文依据 Google 官方资料,整理其功能、限制及对普通用户的影响。

阅读时间约 5 分钟

Google 推出 Gemini 3.8 Live with Live Avatar:会说话、有表情的企业 AI 虚拟形象
图片:Mokaair (Original editorial artwork)

Google 宣布了什么

Google 于 2026 年 9 月 24 日在官方博客发布 Gemini 3.8 Live with Live Avatar。Google 表示,这是继上周发布 Gemini 3.8 Live 之后推出的新功能,将近实时视频生成与语音相结合,让 AI 以一个能聆听、观看并说话的动态虚拟形象与人对话。

据 Google 介绍,Live Avatar 具备精准的口型同步、自然的表情和流畅的轮流对话,可用于客户服务或互动式导览等企业场景。Google 表示,该功能自发布当天起在 Gemini Enterprise 提供,并附有 API 文档供开发者使用。

Google 推出 Gemini 3.8 Live with Live Avatar:会说话、有表情的企业 AI 虚拟形象
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

主要功能:Google 的说法

  • 多模态输入(同时理解声音、画面等多种信息):Google 称 Live Avatar 会同时处理视觉与音频输入,再以带表情的语音和影像作出回应。
  • 异步工具调用(一边继续对话,一边在后台执行查询等任务):Google 表示,虚拟形象可在对话持续进行时于后台调用工具、获取数据,演示场景为酒店旅客办理入住登记。
  • 多语言:Google 称可在 97 种语言之间切换,并表示不会降低视频保真度,也不会产生视觉漂移(即画面中的形象逐渐走样、失真)。
  • 自定义形象:除预设形象库外,开发者可根据高质量参考图像生成自定义形象;Google 表示该功能目前只向列入允许名单的企业开放。

Gemini 3.8 Live 与 Live Avatar 对比

下表中的 token 是 AI 模型处理内容时使用的计量单位,数值越大,代表一次能输出的内容越多。

资料来源:Google 博客与 Google DeepMind Gemini 3.8 Audio 模型卡
项目Gemini 3.8 Live加上 Live Avatar
输出类型音频和文本音频、视频和文本
输出上限64K token24K token
提供渠道Gemini API、Gemini App、Google AI Studio、Gemini Enterprise Agent Platform、Google Search Live(据模型卡)Gemini Enterprise(据 Google 博客)
连续互动时长模型卡未另行注明数分钟,而非数小时(据模型卡)

根据 Google DeepMind 的模型卡(介绍模型能力与限制的官方说明文件),Gemini 3.8 Audio 以 Gemini 3 Pro 为基础。Gemini 3.8 Live 的输入可包括音频、图像、视频和文本,上下文窗口(模型在一次对话中能参考的内容量)最多为 128K token。模型卡还提到,模型可能出现“幻觉”等基础模型的常见局限,也就是生成看似合理但不正确的内容;偶尔还会出现响应缓慢或超时。其知识截止日期为 2025 年 1 月。

安全与透明:SynthID 水印

Google 表示,其 AI 产品生成的所有输出都会加上 SynthID 水印,并直接嵌入音频和视频中。根据 Google DeepMind,SynthID 水印人类无法察觉,但可由 SynthID 技术检测;用户可将图像、视频或音频上传到 Gemini,询问其是否由 Google AI 生成或修改。Google DeepMind 另表示,SynthID Detector 验证门户目前正在与记者和媒体专业人士合作测试。

模型卡另称,Google 根据 Gemini 3.7 Flash 的评估结果,认为 Gemini 3.8 Live 等模型不太可能达到其前沿安全框架中的跟踪或关键能力等级。这些等级是 Google 用来判断模型是否具备潜在高风险能力的门槛。这是 Google 的自我评估,并非外部独立审查的结论。

常见问题

普通人现在可以使用 Live Avatar 吗?

据 Google 博客,Gemini 3.8 Live with Live Avatar 目前在 Gemini Enterprise 提供,主要面向企业和开发者;自定义虚拟形象更是只向列入允许名单的企业开放。普通用户更可能是在企业的客服或导览服务中间接接触到。

Live Avatar 能说哪些语言?

Google 表示,Live Avatar 可在 97 种语言之间切换,并在对话中途切换语言时调整口型和表情。Google 在发布文章中没有列出具体包括哪些语言。

可以和它聊很久吗?

目前还不适合长时间对话。Google DeepMind 模型卡指出,搭配 Live Avatar 的版本可支持数分钟的连续互动,而非数小时;也可能偶尔出现响应缓慢或超时。

怎么知道画面中的人物是 AI 生成的?

Google 表示其 AI 产品的输出都嵌有 SynthID 水印。根据 Google DeepMind,可将图像、视频或音频上传到 Gemini,询问其是否由 Google AI 生成或修改。此方法只能判断 Google AI 生成的内容。

这些功能说法经过独立验证了吗?

没有。本文所有信息均来自 Google 及 Google DeepMind 官方页面,包括功能、语言数量与安全评估,均属 Google 自身的说法。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享