ライフスタイル

GPT-Live 1がAPIで正式提供開始:電話対応はできるのか、声は誰のものか、録音されるのか

2026年9月10日、OpenAIのAPI更新履歴に、全二重音声モデルGPT-Live 1がAPIで正式提供されたと記載されました。開発者はこれを電話対応、アプリ、または自社製品に組み込めます。本記事はOpenAI開発者向けドキュメントに基づき、このモデルのAPI仕様、電話の接続方法、そしてこのエンドポイントは発信に対応しないとドキュメントが述べていること、内蔵された12種類の名前付き音声とドキュメントに記載のない対応言語、録音の扱いと分単位の課金方式を整理しました。当サイトは実地の検証を行っておりません。

読了目安 19 分

オリジナルイラスト:左側にスマートフォンが1台あり、その横に4本の音波線が描かれている。1本の線がスマートフォン下部から右側の角丸パネルへ折れ曲がっており、パネルの中には吹き出しといくつかの音波が描かれ、かかってきた電話の背後で音声モデルが応答を引き継いでいることを表している。
画像:Mokaair (© Mokaair)

OpenAIは2026年9月10日、APIの開発者向けドキュメントの更新履歴に新しい項目を記載しました。全二重音声モデルGPT-Live 1がAPIで正式(GA)に提供され、対応するモデルIDはgpt-live-1、エンドポイントはv1/live/sessionsです。公式ドキュメントには、音声セッションは1分あたり0.05ドルで秒単位課金、バックエンドのモデルとツールの利用分は別途課金と記載されています。これが意味するのは、聞きながら話せる音声モデルが、開発者が自分の電話システムやアプリ、製品に組み込める部品として手に入るということです。

本記事は2026年9月18日に、OpenAIの開発者向けドキュメントであるAPI更新履歴、GPT-Live 1モデルページ、電話・SIP連携ガイド、セッション管理ガイドを確認しました。読んだのは確認当日時点の版で、これらのドキュメントページにはバージョン番号がなく、内容は今後変更される可能性があります。当サイトはこのAPIを実際に連携・検証しておらず、本文中の機能説明はすべてOpenAIの説明によるものです。本記事が扱うのはAPI開発者向けのこの更新のみで、ChatGPT利用者側のプランや設定については扱いません。

9月10日の更新履歴:正式提供(GA)、モデルIDと2つの委任方式

公式モデルページはGPT-Live 1を全二重音声モデルと定義しています。同時に聞くことと話すことができ、推論とツールの利用をバックエンドのエージェントに委任します。つまり情報検索や演算が必要なときはその処理を裏側に任せながら、会話自体は続けられるということです。更新履歴は9月10日の状態を「APIで正式(GA)に提供開始」と記載していますが、これは提供状況を表す言葉であり、本記事が確認した4件のドキュメントにはこれが初めて登場したものだとは書かれていません。むしろ電話連携ガイドには、既存の連携が非推奨になった着信イベント名を今も受け取る場合があると書かれており、これより前から連携が動いていたことがうかがえます。

モデルページに記載されているモデルIDはgpt-live-1で、対応するエンドポイントはv1/live/sessionsです。公式ドキュメントはこれを「スムーズな割り込み処理を備えた、自然で表現力豊かな音声対話のための最上位モデル」と説明していますが、これはOpenAI自身の説明です。このモデルの入力と出力はいずれも音声とテキストの2つの形式で、画像と動画には対応していません。モデルページに記載されている知識のカットオフ日は2025年7月31日で、これはモデル自体の学習データの時点を示しています。

開発者がGPT-Live 1に情報検索や演算が必要な問題を処理させたい場合、ドキュメントには2つの委任方式が記載されています。1つはOpenAIのモデルと組み合わせるResponses委任、もう1つは開発者自身が構築したバックエンドに接続するclient委任です。指定しない場合やnullに設定した場合はclientが選択されます。ドキュメントには、委任方式はセッション開始後に変更できず、変更するには新しいセッションを開始する必要があると記載されています。

APIにおけるこのモデルの仕様:対応エンドポイントは1つのみ、無料階層には非対応

GPT-Live 1がAPIで対応と表示されているエンドポイントはLive(v1/live/sessions)の1つだけです。公式のエンドポイント一覧では、Chat Completions、Responses、Realtimeなど既存のエンドポイントに加え、旧式のCompletions (legacy) もあわせて非対応と表示されています。電話連携ガイドも、それぞれのAPIには独自の認証、セッション作成方法、イベント契約があり、互いに流用できないと注意を促しています。

利用量の計算方法もやや異なります。ドキュメントにはレート制限が「同時に進行しているセッション数」で計算されると明記されており、無料(Free)は非対応の利用階層として挙げられています。アカウントの利用階層に応じて、Tier 1からTier 5まででそれぞれ25、50、200、300、500セッションを同時に開始できます。

OpenAI開発者向けドキュメントをもとに作成。確認日は2026年9月18日。
項目内容備考
モデルIDgpt-live-1対応エンドポイントはv1/live/sessionsのみ
対応モダリティ音声とテキスト(入力・出力とも)画像・動画には非対応
委任方式Responses委任またはclient委任セッション作成時に選択、途中変更は不可
同時実行上限Tier 1–5:25/50/200/300/500無料階層には非対応
音声料金1分あたり0.05ドル、秒単位課金バックエンドのモデルとツールは別途課金

電話がかかってきたとき、GPT-Live 1はどう応答を引き継ぐか

GPT-Live 1を電話システムに接続する方法として、公式ドキュメントは2つの経路を挙げています。1つはDirect SIPで、通話音声を電話業者とOpenAIの間でやり取りし、開発者のアプリケーションがイベント通知、セッション設定、電話を受けるかどうかの判断、ビジネスロジックを担当します。もう1つはサーバー音声ブリッジで、開発者のアプリケーションが電話業者や会議室の音声をWebSocket経由でGPT-Liveへ転送し、両端の接続、イベント変換、再生、通話のライフサイクルをすべて自分で管理します。ドキュメントには、Twilio、Telnyx、LiveKit、Daily/Pipecatといった業者にそれぞれ専用の連携ガイドがあると記載されています。

電話がかかってきた後の流れです。開発者のアプリケーションが自らの認可・ルーティングのルールに従い、それぞれ1つのAPI操作で応答または拒否を行います。応答する場合はモデル、声、委任方式などの設定を送信し、拒否する場合は300から699の間のSIPステータスコード(たとえば話し中を表す486)を付ける必要があります。最初に送られた応答または拒否の判断が有効となり、その後重ねて送られた判断は拒否されます。通話中にはさらに2つの操作があり、電話を転送するか、そのまま切断することができ、いずれも成功時には内容のない200 OKが返されます。

ドキュメントはこの流れの最後に、これが扱うのはかかってきた電話であり、POST /v1/live/sessionsを通じて発信するSIP通話を作成することには対応していないと明記しています。発信を行うには、ドキュメントは開発者にパートナーの連携方式を使うよう求めており、発信はパートナー業者自身が担うものだと説明しています。ドキュメントはまた、着信に付随するSIPヘッダーは信頼できない発信者情報として扱うべきであり、認可の根拠にはできないと注意を促しています。

4コマ図解:GPT-Live 1がAPIに入った際の4つの要点——電話は着信対応が中心、対応言語は記載なし、初期設定では録音しない、音声は1分あたり0.05ドル
GPT-Live 1がAPIに入った際の4つの要点:電話は着信対応が中心、音声の対応言語は記載なし、初期設定では録音しない、1分あたり0.05ドル。OpenAI開発者向けドキュメントをもとに作成、確認日は2026年9月18日。 · 画像:Mokaair (© Mokaair)

声は誰のものか:内蔵12種類、この4件のドキュメントには対応言語の記載なし

GPT-Live 1の声は1種類だけではありません。デフォルトのmarinに加えて、公式ドキュメントには選択できる12種類の名前付き音声が挙げられています。たとえば言語欄が英語、地域的特徴欄がイギリスと表示されるvesper、同じく英語で北米と表示されるgleam、言語欄がポルトガル語、地域的特徴欄がブラジルと表示されるbossaとtempoなどです。開発者はセッション作成時にその中から1つを選んで設定に入れます。会話が始まった後は途中で変更できず、変更するには新しいセッションを開始する必要があります。

台湾の読者が注意すべき点があります。ドキュメントはこれらの音声を「地域的特徴」と表現しつつ、それはあくまで話し方のスタイルであり、アクセントの再現性を保証するものではないと特に注記しています。さらに重要なのは、本記事が確認した4件の公式ドキュメントには、このモデルがどの話し言葉に対応しているかの一覧が記載されていないことです。12種類の名前付き音声の言語欄にあるのは英語とポルトガル語だけで、デフォルトの音声marinについても言語の説明は別途ありません。ドキュメントは挨拶文について触れる際、開発者に対し発信者が話し出すまでアプリケーションが指定した言語を使うよう求め、自社アプリケーションが対応する言語でテストするよう促しています。つまり、コールセンターの電話口で実際にGPT-Live 1が使われた場合、それがどれほど中国語を話せるのかについて、この4件のドキュメントは答えを示しておらず、話せると決めてかかることはできません。

公式ドキュメントには、承認を受けた音声であれば自分の録音データを使ってカスタム音声を作成できるとも記載されています。詳細は別のガイドにあり、本記事では踏み込みません。

録音されるのか、記憶はどれくらい続くのか、電話を何分か話すとだいたいいくらになるのか

録音されるかどうかは開発者が決めることで、初期設定でオンになっているわけではありません。公式ドキュメントには、セッションの録音設定は初期状態でオフになっており、開発者が自らオンにし、かつプロジェクトが事前に許可されて初めて、完了した録音をダウンロードしたり新しいセッションへ「フォーク」したりできるようになると明記されています。ダウンロードとフォークにはさらに、データの保持を認めるデータポリシーが必要です。保存された録音は30日後に期限切れとなります。プロジェクトでZero Data Retention(データのゼロ保持)が有効になっている場合、録音設定は常にオフとして扱われ、ダウンロードとフォークも利用できません。ダウンロードした録音はステレオのWAVファイルで、入力音声と出力音声がそれぞれ左右のチャンネルに分かれています。

長時間の通話については記憶にも上限があります。ドキュメントによれば、セッションの初期設定のコンテキストウィンドウは128,000トークンで、開発者が与える指示、会話のテキスト、さらに書き起こしには表示されない音声トークンが含まれます。使用量がウィンドウの90%を超えると、システムは同じセッションの中で別の音声エンジンに交代させます。新しいエンジンは元の指示と、最大8,192トークンの会話履歴(直近のメッセージ、および要約が利用できる場合はそれより前のメッセージの要約)を受け取ります。これはつまり、非常に長い通話では、それより前に話された内容が要約されたり省略されたりする可能性があるということです。

料金の計算方法自体はシンプルです。音声セッションは1分あたり0.05ドルで、実際の秒数に応じて課金され、切り上げて1分単位にすることはないとドキュメントに注記されています。バックエンドのモデルとツールはそれぞれの料金で別途課金され、この4件のドキュメントはこの2つの費用を合わせた例は示していません。以下は本記事が確認日である2026年9月18日時点の料率で行った換算であり、公式の数字ではありません。音声だけで3分間話した場合、単純計算で0.15ドルになりますが、実際の総額はバックエンドがどれだけ処理したかによって変わります。セッション終了時、公式ドキュメントに挙げられている終了理由には、アプリケーションが自ら終了した場合、セッションが時間の上限に達した場合、安全フィルターによって中断された場合、リモート接続が正常に終了した場合、接続が予期せず切断された場合が含まれますが、時間の上限が実際に何分なのかはドキュメントに記載されていません。

よくある質問

GPT-Live 1は2026年9月10日に初めて使えるようになったのですか?

更新履歴には「APIで正式(GA)に提供開始」と記載されていますが、これは提供状況を表す言葉であり、本記事が確認した4件の公式ドキュメントには、これが初めて登場したものだとは書かれていません。むしろ電話・SIP連携ガイドには、既存の連携が非推奨になった着信イベント名を今も受け取る場合があると記載されており、これより前から連携が動いていたことがうかがえます。この4件のドキュメントには、それより前のプレビュー時期や段階的な提供開始のスケジュールも書かれていません。

GPT-Live 1は中国語がわかりますか?電話をかけて中国語で質問できますか?

本記事が確認した4件の公式ドキュメントには、このモデルがどの話し言葉に対応しているかは記載されていません。ドキュメントに挙げられている12種類の名前付き音声は、言語欄が英語とポルトガル語しかなく、デフォルトの音声marinについても言語の説明は別途ありません。ドキュメントは挨拶文について触れる際、開発者に対し発信者が話し出すまでアプリケーションが指定した言語を使うよう求め、自社アプリケーションが対応する言語でテストするよう促しています。本記事が2026年9月18日に確認したドキュメントの版では、中国語に対応しているという説明は見当たらず、流暢な中国語を理解したり話したりできると決めてかかることはできません。

台湾の開発者は今すぐこのAPIを使えますか?

本記事が確認した4件の公式ドキュメントには、利用できる国や地域の一覧は記載されておらず、台湾について特に触れている箇所もありません。申請や利用ができるかどうかは、自分のアカウントでOpenAIのプラットフォーム上に実際に表示される画面を基準にしてください。本記事は台湾のアカウントが現在この機能を使えるかどうかを検証していません。

企業が電話システムと連携する場合、OpenAI公式の経路しか使えないのですか?

そうとは限りません。公式ドキュメントには、この電話フローが扱うのはかかってきた電話であり、POST /v1/live/sessionsを通じて発信するSIP通話を作成することには対応していないと記載されています。発信を行うには、ドキュメントは開発者にパートナーの連携方式を使うよう求めており、名前が挙がっているのはTwilio、Telnyx、LiveKit、Daily/Pipecatです。これらはいずれもサードパーティ業者自身のサービス範囲に属するもので、実際の機能や料金は各社の説明によります。

この音声セッションは録音され、保存されるのですか?

初期設定では保存されません。公式ドキュメントには、セッションの録音設定は初期状態でオフになっており、開発者が自らオンにし、プロジェクトが事前に許可され、さらにダウンロードとフォークにはデータの保持を認めるデータポリシーが必要で、それらが揃って初めて録音が残ると明記されています。残った録音は30日後に期限切れとなります。プロジェクトでZero Data Retention(データのゼロ保持)が有効になっている場合、録音設定は常にオフとして扱われ、ダウンロードできる録音は存在しません。

電話を1本かけると、だいたいいくらかかりますか?

公式に公開されているのは音声そのものの料率のみです。1分あたり0.05ドルで、実際の秒数に応じて課金され、確認日は2026年9月18日です。以下は本記事による換算で、公式の数字ではありません。3分間の通話を音声分だけで単純計算すると0.15ドルになります。バックエンドのモデルと呼び出したツールはそれぞれの料金で別途課金され、実際の通話1本あたりの総額はどれだけ処理したかによって変わります。この4件のドキュメントは通話1本あたりの総額の例を示していません。

  • ライフスタイル

    Gemini 3.8 LiveとExtended Thinking:新しい音声モデル、あなたのアカウントは使えるか

    2026年9月15日、Googleは音声対話モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」の2機種を発表しました。本稿はGoogle公式の発表文、開発者向け記事、モデルカード、料金ページをもとに、開発者・企業・一般ユーザー・Workspace加入者それぞれが使える範囲、料金の仕組み、モデルカードに記された知識のカットオフ日、そして公式が明記していない提供地域を整理します。

  • ライフスタイル

    GPT-LiveでChatGPTの音声が聞きながら話せるように:割り込み、プラン別の利用枠、録音の設定

    OpenAIは2026年7月にGPT-Liveを発表し、ChatGPTの音声モードで聞き取りと発話を同時に行い、途中で割り込めるようにしました。検索や推論はバックグラウンドのモデルが担います。本稿では公式の説明に基づき、会話のリズムの変化、9月の変更後のプラン別モデルと利用枠、料理や会話練習などの利用場面、録音の保存と学習の設定を整理し、APIの料金にも簡単に触れます。

  • ライフスタイル

    OpenAIがHabitatストレージ基盤を公開:毎週10億人超の利用を支える規模と限界

    2026年9月11日、OpenAIは公式エンジニアリングブログで、社内ストレージ基盤Habitatが1つのPythonクライアントライブラリから独立したサービスへ進化し、今年第2四半期にRustで書き直された経緯を説明する記事を公開しました。本稿は同記事の原文に基づき、OpenAIが自ら述べるリクエスト数・対応地域・データ量の数字と、公式が説明していない耐久性や地域の詳細を整理しています。当サイトは実地の検証を行っておらず、利用や購入を勧めるものでもありません。

  • ライフスタイル

    NVIDIA、DGX Spark 64GB版を発表:10月23日発売、価格は4,999ドルから、2台接続で128GBに

    NVIDIAは2026年10月2日、パーソナルAIコンピューター「DGX Spark」に、より手頃な64GBメモリ版を追加すると発表した。10月23日からAcer、ASUSなど6社が供給し、主な対象は自分のマシンでAIモデルを実行したい開発者や研究者。NVIDIAが公表した仕様、2台接続に関する説明、一般読者にとっての意味を整理する。

最新の旅の情報・ガイド

出典

ライフスタイル