ライフスタイル

Google、Gemini 3.8 Live with Live Avatarを発表:話して表情を見せる企業向けAIアバター

Googleは2026年9月24日、Gemini 3.8 Live with Live Avatarを発表した。リアルタイム音声会話に、ほぼリアルタイムで生成される人物アバター映像を加えるもので、まずGemini Enterpriseで提供される。本記事ではGoogleの公式資料をもとに、機能、制約、一般ユーザーへの影響を整理する。

読了目安 7 分

Google、Gemini 3.8 Live with Live Avatarを発表:話して表情を見せる企業向けAIアバター
画像:Mokaair (Original editorial artwork)

Googleは何を発表したのか

Googleは2026年9月24日、公式ブログでGemini 3.8 Live with Live Avatarを発表した。Googleによれば、これは前週に発表されたGemini 3.8 Liveに続く新機能で、ほぼリアルタイムの動画生成と音声を組み合わせ、聞き、見て、話す動くアバターとしてAIが人と対話できるようにするものだという。

Googleの説明では、Live Avatarは正確なリップシンク(口の動きを音声に合わせること)、自然な表情、スムーズなターンテイキング(話し手の交代)を備え、カスタマーサービスやインタラクティブな案内といった企業の場面で使えるという。Googleは、この機能を発表当日からGemini Enterpriseで提供し、開発者向けのAPIドキュメントも用意しているとしている。

Google、Gemini 3.8 Live with Live Avatarを発表:話して表情を見せる企業向けAIアバター
Mokaair 編集検証フロー · 画像:Mokaair (Original editorial artwork)
詳しい説明を読む

情報源を収集し、独立検証を行ってから Jev が判断します。

主な機能:Googleの説明

  • マルチモーダル入力(映像や音声など複数の種類の情報を扱うこと):Googleによると、Live Avatarは視覚と音声の入力を同時に処理し、表情を伴う音声と映像で応答する。
  • 非同期ツール呼び出し:Googleによれば、アバターは会話を止めずに、バックグラウンドで外部のツールを呼び出してデータを取得できる。デモではホテルのチェックイン手続きが紹介された。
  • 多言語対応:Googleは97言語を切り替えられるとし、動画の忠実度が落ちたり視覚的なドリフト(映像の見た目のずれ)が生じたりすることはないと説明している。
  • カスタムアバター:標準のアバターライブラリに加え、開発者は高品質な参照画像からカスタムアバターを生成できる。Googleによると、この機能は現在、企業の許可リスト(Googleが利用を認めた企業の一覧)経由でのみ提供されている。

Gemini 3.8 LiveとLive Avatarの比較

出典:GoogleブログおよびGoogle DeepMind Gemini 3.8 Audioモデルカード
項目Gemini 3.8 LiveLive Avatar追加時
出力の種類音声とテキスト音声、動画、テキスト
出力上限64Kトークン24Kトークン
提供チャネルGemini API、Geminiアプリ、Google AI Studio、Gemini Enterprise Agent Platform、Google Search Live(モデルカードによる)Gemini Enterprise(Googleブログによる)
連続対話時間モデルカードに個別の記載なし数時間ではなく数分(モデルカードによる)

トークンとは、AIが文章などの情報を処理する際の単位のこと。Google DeepMindのモデルカードによると、Gemini 3.8 AudioはGemini 3 Proをベースとしており、Gemini 3.8 Liveの入力には音声、画像、動画、テキストを含めることができ、コンテキストウィンドウ(一度に扱える情報量)は最大128Kトークンだ。モデルカードでは、ハルシネーション(事実と異なる内容をもっともらしく出力すること)など基盤モデルに一般的な制約があること、まれに動作が遅くなったりタイムアウトしたりすること、知識のカットオフ(学習した情報の時点)が2025年1月であることにも触れている。

安全性と透明性:SynthIDの透かし

Googleは、同社のAI製品が生成するすべての出力にSynthIDの透かしを付け、音声と動画に直接埋め込んでいるとしている。Google DeepMindによれば、SynthIDの透かしは人間には知覚できないが、SynthIDの技術で検出できる。ユーザーは画像、動画、音声をGeminiにアップロードし、Google AIで生成または編集されたものかを尋ねることができる。Google DeepMindはまた、検証ポータルのSynthID Detectorを現在ジャーナリストやメディア関係者と協力してテストしているとしている。

モデルカードではさらに、GoogleはGemini 3.7 Flashの評価結果に基づき、Gemini 3.8 Liveなどのモデルが同社のフロンティア安全フレームワークにおける追跡対象の能力レベルや重大な能力レベルに達する可能性は低いと判断したとしている。これはGoogleによる自己評価であり、外部の独立した審査による結論ではない。

よくある質問

一般ユーザーは今すぐLive Avatarを使えますか?

Googleブログによると、Gemini 3.8 Live with Live Avatarは現在Gemini Enterpriseで提供されており、主に企業や開発者向けです。カスタムアバターはさらに企業の許可リストに限られます。一般ユーザーは、企業のカスタマーサービスや案内サービスを通じて間接的に触れる可能性が高いでしょう。

Live Avatarはどの言語を話せますか?

Googleによると、Live Avatarは97言語を切り替えられ、会話の途中で言語を変えた際にもリップシンクや表情を調整します。Googleの発表では、対応言語の完全な一覧は示されていません。

長時間会話できますか?

できません。Google DeepMindのモデルカードによると、Live Avatar付きのバージョンが対応する連続対話は数時間ではなく数分です。また、まれに動作が遅くなったりタイムアウトしたりすることがあります。

画面の人物がAI生成だとどうすれば分かりますか?

Googleは、同社のAI製品の出力にはすべてSynthIDの透かしが埋め込まれているとしています。Google DeepMindによると、画像、動画、音声をGeminiにアップロードし、Google AIで生成または編集されたものかを尋ねることができます。この方法で判別できるのはGoogle AIのコンテンツのみです。

これらの機能に関する説明は独立して検証されていますか?

いいえ。本記事の情報はすべてGoogleおよびGoogle DeepMindの公式ページに基づいており、機能、対応言語数、安全性評価はいずれもGoogle自身の説明です。

このトピックの最新ニュースを見る

最新の旅の情報・ガイド

出典

ライフスタイル