ライフスタイル

Google、Gemini 3.8 Live with Live Avatarを企業向けに正式提供開始:話すAIアバターがカスタマーサポートへ

Googleは、リアルタイム音声対話と唇の動きが同期する映像アバターを組み合わせたGemini 3.8 Live with Live AvatarをGemini Enterpriseで正式提供したと発表し、不正利用対策としてSynthID透かしとカスタムアバターの許可リストを導入しています。本記事では機能、提供状況、一般の人への影響をまとめます。

読了目安 10 分

Google、Gemini 3.8 Live with Live Avatarを企業向けに正式提供開始:話すAIアバターがカスタマーサポートへ
画像:Mokaair (Original editorial artwork)

何が起きたか:Live Avatarが企業向けに正式提供

Google Cloudブログは、Gemini 3.8 Live with Live AvatarをGemini Enterpriseで正式提供(generally available)したと発表しました。正式提供とは、試験段階を終えて一般の顧客が利用できる状態になったことを指し、Googleはこの技術が企業の本番環境で利用できる段階にあるとしています。このGoogle Cloudブログ記事の日付は2026年9月25日です。また、機能を紹介する別の記事がblog.googleに2026年9月24日付で公開されています。Googleによると、この技術はGoogle Cloud Next 2026で初めてプレビューされました。

今回の提供は、Googleが2026年9月15日に発表したGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを基盤としています。Googleによると、Gemini 3.8 Liveは規模とコスト効率を重視し、Extended Thinkingは高度に複雑なタスクや多段階の推論を対象としています。以上の情報はいずれもGoogle自身のサイトによるもので、独立した情報源による裏付けはまだありません。

Google、Gemini 3.8 Live with Live Avatarを企業向けに正式提供開始:話すAIアバターがカスタマーサポートへ
Mokaair 編集検証フロー · 画像:Mokaair (Original editorial artwork)
詳しい説明を読む

情報源を収集し、独立検証を行ってから Jev が判断します。

主な機能と現在の提供状況の比較

Googleによると、Live Avatarはウェブ、モバイル端末、インタラクティブな案内端末上の対話型動画エージェント(利用者と会話しながら用件を処理するAI)向けに、唇の動きが同期するアバターを生成できます。Gemini 3.8 Liveは97言語を理解して話すことができ、言語を自動検出し、アバターの唇の動きや表情もこれらの言語間で切り替えられます。モデルは会話を続けながら、バックグラウンドでツールやAPI(ソフトウェア同士が機能をやり取りするための窓口)の呼び出しを実行できます。たとえば、データの検索などを裏で進めながら会話を途切れさせない仕組みです。リアルタイムの視覚理解では、カメラ映像、画面共有、音声を同時に処理できます。さらにGoogleは、正式版では米国とEUのエンドポイント(サービスに接続する地域ごとの窓口)、プロビジョニングされたスループット(処理能力をあらかじめ確保しておける仕組み)、企業向けコンプライアンスとデータガバナンスが提供されるとしています。

Gemini 3.8 Liveシリーズ各項目の比較(出典:Google)
項目Googleの発表日Googleが説明する位置づけ現在の状況(Googleによる)
Gemini 3.8 Live2026年9月15日規模とコスト効率、自然な会話と視覚理解発表済み。Live Avatarの音声基盤
Gemini 3.8 Live Extended Thinking2026年9月15日高度に複雑なタスクと多段階の推論プライベートプレビュー(限られた顧客のみが試せる段階)
Gemini 3.8 Live with Live Avatar2026年9月24日(blog.googleの紹介記事)/9月25日(Google Cloudブログで正式提供を発表)唇の動きが同期する映像アバターGemini Enterpriseで正式提供、米国とEUのエンドポイント
カスタムアバター2026年9月24日参照画像からブランド専用アバターを生成許可リストに登録され検証を受けた企業のみ

性能面では、GoogleはGemini 3.8 Live Extended ThinkingがArtificial Analysisの音声対音声品質指数で82.6点を獲得して首位となり、τ-Voiceで68.6%、Big Bench Audioで97.7%を記録したとしています。Googleによると、Gemini 3.8 LiveはSpeech Agent Arenaで2位を獲得しました。これらの成績はGoogleが自ら公表したもので、ベンダーの主張として受け止めるのが妥当です。

なりすまし対策と透かし措置

実在の人物の外見でリアルタイムに話せるAIアバターで最も懸念されるリスクは、なりすましと誤認です。Googleによると、顧客は事前に用意されたアバターライブラリから選ぶことができます。参照画像からカスタムアバターを生成するには、企業の許可リスト(Googleが利用を認めた企業の名簿)への登録と検証手続きを経る必要があります。またGoogleは、生成されるすべての音声・映像ストリームにSynthID透かしが入っているとしています。SynthIDは、音声や映像そのものに埋め込まれ、肉眼ではほぼ判別できないGoogleの電子透かしで、AI生成コンテンツを検出可能にすることが目的だとされています。

一般の読者への実際の影響

今回の発表は企業と開発者を対象としており、一般消費者がこのサービスを直接購入したり有効化したりすることはありません。実際の影響は、導入企業がAIアバターをカスタマーサポート、買い物の案内、チェックイン手続きなどに組み込む可能性がある点です。Google Cloudブログは例として、Cox AutomotiveがAutotrader向けにAIショッピングアシスタントを構築し、車の購入希望者による車両の検索や比較を案内していることを挙げています。Googleはまた、保険金請求受付のデモも紹介しており、利用者がカメラに向かって損傷を説明すると、バックグラウンドのエージェントが保険契約を照合して情報を整理します。

Google Cloudブログはさらに、Equal AIのCEOであるAkhilesh Damaraju氏の、同社のAIが毎日9つのインドの言語で100万件を超えるリアルタイム通話を処理しているとの発言や、SalesforceのBob Van Osten氏によるGemini 3.8 LiveとAgentforceの連携に関する発言を引用しています。これらはいずれもGoogleが選んで掲載した顧客の声です。利用者にとっては、多言語対応で画面を見られるAIサポートにより一部のサービスが便利になる可能性がある一方、カメラに映した映像や声が企業のAIシステムで処理されることも意味するため、利用前にその企業のプライバシーに関する説明を確認しておくとよいでしょう。

よくある質問

一般の人は今すぐLive Avatarを自分で使えますか?

Googleによると、Gemini 3.8 Live with Live AvatarはGemini Enterpriseで企業顧客向けに提供され、APIを通じて開発者が自社のサービスに組み込めるようになっています。一般の人は、企業のウェブサイト、アプリ、案内端末などで間接的に触れる可能性が高いでしょう。

Live Avatarと以前発表されたGemini 3.8 Liveは何が違いますか?

Googleが2026年9月15日に発表したGemini 3.8 Liveはリアルタイム音声対話モデルです。その後登場したLive Avatar(blog.googleの紹介記事は9月24日付、Google Cloudブログでの正式提供の発表は9月25日付)は、その上に唇の動きが同期する映像アバターを加え、対話エージェントに目に見える姿を与えるものです。

Extended Thinkingも同時に正式提供されたのですか?

いいえ。Google Cloudブログによると、Gemini 3.8 Live Extended Thinkingは引き続きプライベートプレビューの段階で、正式提供されたのはGemini 3.8 Live with Live Avatarです。

これを使って他人の顔になりすますことはできますか?

Googleによると、カスタムアバターには企業の許可リスト登録と検証手続きが必要で、一般の顧客は事前に用意されたアバターライブラリからのみ選択できます。すべての出力にはSynthID透かしも入っています。これらはGoogleが説明する保護措置であり、実際の効果についての独立した検証はまだありません。

日本語には対応していますか?

Googleによると、Gemini 3.8 Liveは97言語に対応し自動検出も可能だとしていますが、公開されている資料には完全な言語リストが記載されておらず、日本語を含む特定の言語への対応状況はこれをもとに確認できません。

利用料金はいくらですか?

Google Cloudブログは、価格は同社の料金ページに掲載されているとしており、具体的な金額はブログ記事には示されていません。

Googleには他にどのような関連音声モデルがありますか?

Google Cloudブログでは、Gemini 3.5 TranscribeやGemini 3.5 Live Translateなどが挙げられています。Googleによると、3.5 Transcribeは2026年8月26日に発表され85以上の言語を文字起こしでき、3.5 Live Translateは2026年6月9日に発表され70以上の言語間で音声をほぼリアルタイムに翻訳できます。

このトピックの最新ニュースを見る

最新の旅の情報・ガイド

出典

ライフスタイル