ライフスタイル

GPT-LiveでChatGPTの音声が聞きながら話せるように:割り込み、プラン別の利用枠、録音の設定

OpenAIは2026年7月にGPT-Liveを発表し、ChatGPTの音声モードで聞き取りと発話を同時に行い、途中で割り込めるようにしました。検索や推論はバックグラウンドのモデルが担います。本稿では公式の説明に基づき、会話のリズムの変化、9月の変更後のプラン別モデルと利用枠、料理や会話練習などの利用場面、録音の保存と学習の設定を整理し、APIの料金にも簡単に触れます。

更新日: 読了目安 13 分

スマートフォン上で音声の波形と吹き出しが交互に重なり、聞きながら話す様子を表したオリジナルイラスト
画像:Mokaair (© Mokaair)

OpenAIは2026年7月8日、新世代の音声モデルGPT-Liveを発表しました。公式ブログとChatGPTのリリースノートのいずれもこの日付を記載しています。GPT-Liveは全二重のアーキテクチャを採用しており、聞き取りと発話を同時に行うことができ、現在はChatGPTの音声モードで使われています。ウェブ検索やより踏み込んだ推論、より複雑な作業が必要な質問では、バックグラウンドで別のフロンティアモデル(提供開始当初はGPT-5.5)に処理を委ね、結果がそろった時点で会話に戻します。OpenAIはGPT-Live-1とGPT-Live-1 miniの2つのバージョンを同時に公開しました。

本稿は2026年9月15日に、OpenAIの発表記事、ヘルプセンターのChatGPT音声モードのページ、リリースノートを確認しました。発表記事は世界中のiOS、Android、ChatGPT.comのユーザーに段階的に提供すると書いており、リリースノートは対応地域で提供を始め、提供開始時点ではBusiness、Enterprise、Eduワークスペースを含まないとしています。ただし、どちらも地域の一覧は示しておらず、台湾についての個別の言及もありません。当サイトは実際には試用しておらず、機能に関する記述はすべてOpenAIの説明によるものです。お使いの台湾アカウントにこのオプションが表示されているかどうかは、アプリ内の設定で確認してください。本文中の料理、会話練習、車内の場面は、編集部が設計した例です。

聞きながら話せるようになると、会話のリズムはどう変わるのか

OpenAIの説明によると、初期のChatGPTの音声機能は、音声のテキスト変換、言語モデル、テキストの音声変換という3つのモデルをつないでいたため、応答が遅くぎこちないものでした。その後の高度な音声モードは1つのモデル内で音声を処理するようになりましたが、ユーザーが話し終えるのを待ってから応答する点は変わらず、ターンの区切りを無音で判断していたため、短い間や背景音が話し終わりと受け取られることがありました。

一方、GPT-Liveは音声を生成しながらも聞き続けます。OpenAIによると、モデルは1秒間に何度も、話す、聞き続ける、間を置く、割り込む、ツールを呼び出す、のいずれにするかを判断できます。会話中は、回答の途中で割り込んで質問したり、いったん止まって考えを整理したり、ゆっくり話すよう頼んだりできます。GPT-Liveは「うんうん」「なるほど」といった相づちで話についてきていることを示す場合があり、黙って聞いているよう頼んだときも、それに従うはずです。

ヘルプセンターは同時に、発話の重なり、背景音、ネットワーク状況、マイク設定が聞き取る内容に影響する可能性があり、長い沈黙やそばにいる人の話し声によって話し始めてしまうこともあると注意を促しています。公式には、ヘッドフォンを使う、より静かな場所に移るといった方法が勧められており、iPhoneのユーザーはコントロールセンターのマイクモードで「声を分離」をオンにできます。考えながら話したいときは、最初に「私が答えてと言うまで待ってください」と伝えておく方法もあります。Liveは主に1対1の会話向けに設計されており、複数の人が同時に話す場面にはまだ最適化されていません。

調べものをしている間の待ち方も、以前とは異なります。OpenAIによると、検索や推論をバックグラウンドのモデルが処理している間もGPT-Liveは会話を続けることができ、結果がそろってから会話に戻します。編集部としては、待っている間の暫定的な応答を結論とみなさず、結果が返ってきてから根拠を説明してもらうことをおすすめします。

プランごとのモデルと、1日に使える時間

発表当日、OpenAIはGPT-Live-1をGo、Plus、Proユーザーのデフォルトモデルとし、無料版のデフォルトはGPT-Live-1 miniとしていました。当時の音声モードでは、すばやく応答するか、時間をかけて考えるかという推論レベルも別に選べました。Goのモデルとこの推論レベルは、いずれも2026年9月9日のリリースノートで変更されているため、初期の報道を読んだ方は現在の状況を基準にしてください。

9月9日のリリースノートとヘルプセンターによると、GoはこれまでのGPT-Live-1に代わってGPT-Live-1 miniを最大3時間使える形に変わりました。PlusはGPT-Live-1を最大3時間、月額100ドルのProは最大15時間、月額200ドルのProは時間無制限です。PlusとProは、上限に達してもminiに切り替わらなくなりました。利用量は直近24時間のローリング方式で計測され、無料版は制限付きの利用で、上限は変更される場合があります。

9月9日のリリースノートには、音声モードで検索や難しい質問についての思考が必要な場合にGPT-5.6またはGPT-6 Astraを使えること、モデルと推論の強度はテキストのチャットと同じコントロールで選ぶ形に変わったこと、利用できるモデルと利用量はプランによって異なることも書かれています。これまでの音声専用の3段階の推論レベルは廃止されました。ヘルプセンターには現在、対象となるBusiness、Enterprise、Edu、Healthcareワークスペースでも、ワークスペースの設定の範囲内で音声モードを利用できると記載されています。

2026年9月15日確認。OpenAIヘルプセンターと9月9日のリリースノートに基づきます。利用量は直近24時間のローリング方式で計測され、ワークスペース向けのプランは掲載していません。
プランLiveのモデル利用上限
無料版GPT-Live-1 mini制限付き、変更の可能性あり
GoGPT-Live-1 mini3時間
PlusGPT-Live-13時間
Pro(月額100ドル)GPT-Live-115時間
Pro(月額200ドル)GPT-Live-1無制限

料理、会話練習、CarPlay:3つの利用場面

1つ目の場面は、料理をしながらの質問です。手に小麦粉がついたままでも、ある材料を別のもので代用できるかをそのまま尋ねられ、回答の途中で家に卵が2個しか残っていないと気づいたら、話し終わるのを待たずに割り込んで条件を訂正できます。ただし、加熱温度、アレルゲン、保存方法は、耳にした一言だけに頼らず、レシピや食品のパッケージで確認してください。

2つ目の場面は、会話の練習です。OpenAIは発表記事で、毎週1億5,000万人以上が音声や音声入力などの機能を通じてChatGPTと会話しており、その用途には語学の練習も含まれると述べています。設定 → 音声で最もよく話す言語を選べるほか、会話の途中で言語の切り替えやゆっくり話すことを頼むこともできますが、ヘルプセンターによると、現在は再生速度を細かく調整することはできません。OpenAIは最もよく使われる一部の言語向けに最適化したとしていますが、その一覧は示しておらず、言語によってはネイティブとは異なるアクセントが混じったり、流暢さが足りなかったりする場合があります。発音を練習するときは、そのアクセントを手本とみなさないようにしてください。

3つ目の場面は車内です。ヘルプセンターによると、ChatGPTは対応するiPhoneでApple CarPlayを通じて利用できますが、同時に、モバイルデバイスは法律で認められ、安全に使用できる状況でのみ使うこと、運転前にアプリを設定しておくこと、車両の走行中は操作を避けることを求めています。編集部としては、運転中は画面に表示されるテキストの応答を見ないことをおすすめします。営業時間や住所といった情報は、駐車してから公式の情報源で確認してください。

ほかのアプリに切り替えたときやスマートフォンをロックしたときも会話を続けたい場合は、設定 → 音声でバックグラウンド会話をオンにする必要があります。2026年8月31日のリリースノートでは、iPhoneのロック画面とDynamic IslandにLiveの音声会話の内容を表示できることにも触れています。バックグラウンド会話は、ユーザーが会話を終了したとき、アプリを強制終了したとき、利用上限または最大セッション時間に達したときに終了します。

GPT-Liveの音声会話の4つのポイントを示す図解:聞き取りと発話の同時進行、バックグラウンドでの調べもの、プランと利用量、録音と確認
GPT-Live音声の4つのポイント:聞き取りと発話の同時進行、バックグラウンドでの調べもの、プラン別のモデルと利用量、録音の保存と回答の確認。OpenAIの公式説明をもとに整理しました。 · 画像:Mokaair (© Mokaair)

録音、文字起こし、学習:まず公式のデータコントロールの説明を確認

ヘルプセンターによると、Liveと高度な音声モードの会話の音声クリップは、チャット履歴の文字起こしとともに保存され、30日間保持されます。チャットを削除すると関連する音声クリップも30日以内に削除されますが、セキュリティ、安全性、法的な理由で保持が必要な場合や、以前に共有を選択していてクリップがすでにアカウントとの関連付けを解除されている場合は例外です。削除は元に戻せず、アーカイブはチャットをサイドバーから外すだけで、音声は削除されません。

録音がモデルの学習に使われるかどうかは、2つのスイッチ次第です。ヘルプセンターは、ユーザーが共有を選択しない限り、音声クリップを学習には使わないとしています。個人ワークスペースの無料版、Plus、Proのユーザーは、設定 → データコントロールで「すべての人のためにモデルを改善する」をオンにし、さらに「音声録音を含める」をオンにしてはじめて共有されます。Business、Enterprise、Eduワークスペースでは、クリップを共有できません。また、「すべての人のためにモデルを改善する」がオンになっている限り、音声会話の文字起こしやその他のファイルは、プランと設定に応じて学習に使われる可能性がある点にも注意が必要です。

共有されたクリップはOpenAIのチームが確認する場合があり、共有を停止しても、以前に関連付けが解除されたクリップは引き続き使われる可能性があります。またOpenAIは2026年7月31日に発表記事を更新し、GPT-Liveが生成した対応音声にSynthIDの透かしを追加したとしています。保護者は、ペアレンタルコントロールで10代の子どもが音声モードを使えるかどうかを決めることもできます。

音声の回答も確認が必要、APIの料金にも簡単に触れる

声で聞いた回答は聞いたらそれきりになりやすく、テキストよりも後から見直すのが難しいものです。ヘルプセンターは、ChatGPTは誤りを犯すことがあり、特に日付、時間、場所に関わる質問は確認が必要だと注意しています。音声モードは「今日」「明日」をデバイスまたはブラウザのタイムゾーンで解釈するため、回答が合っていないときは正確な日付と場所をはっきり伝えることができます。Liveを使うと回答は話すと同時にテキストでも表示され、終了後はチャット履歴で確認できますが、文字起こしは逐語記録ではなく、実際に話された内容と完全には一致しない場合があります。

Liveには現時点での機能の制約もあります。ヘルプセンターによると、Liveは動画、画面共有、接続済みアプリ、プラグインに対応しておらず、動画や画面共有が必要な場合、対象のサブスクリプション利用者はiOSとAndroidのアプリでAdvancedに切り替えられます。音声会話は一度に1件しか行えず、利用上限、最大セッション時間、または長い会話のコンテキスト上限に達したときにも会話が終了することがあります。

開発者向けの提供とChatGPTでの提供は別の話です。OpenAIのAPIの変更履歴には、2026年9月10日付でGPT-Live 1がAPIで一般提供となり、音声セッションは1分あたり0.05ドルで秒単位の課金、背後で組み合わせて使われるモデルとツールの利用量は別途課金されると書かれています。

最新の旅の情報・ガイド

出典

ライフスタイル