生活分享

GPT-Live 1 開放 API:電話客服能不能接、聲音是誰的、會不會錄音

2026 年 9 月 10 日,OpenAI 的 API 更新紀錄寫下全雙工語音模型 GPT-Live 1 已在 API 正式提供,開發者可以把它接進電話客服、App 或自己的產品。本文依 OpenAI 開發者文件整理這個模型在 API 裡的規格、電話怎麼接上以及文件說這個端點不支援外撥、內建的 12 個具名語音與沒有列出的支援語言,還有錄音與每分鐘計費方式;本站沒有實測。

閱讀時間約 12 分鐘

原創插圖:左邊一支手機,旁邊有四條聲波線;一條線從手機底部折向右邊的圓角面板,面板裡有一個對話泡泡和幾條聲波,代表打進來的電話由背後的語音模型接手回應。
圖片:Mokaair (© Mokaair)

2026 年 9 月 10 日,OpenAI 在 API 開發者文件的更新紀錄寫下一則新條目:全雙工語音模型 GPT-Live 1 已在 API 正式提供(generally available),對應模型代號 gpt-live-1、端點 v1/live/sessions。官方文件寫,語音工作階段每分鐘 0.05 美元、按秒計費,後端模型與工具的用量另外計費。這件事的意義是:一個會邊聽邊說的語音模型,是開發者可以買來裝進自己電話系統、App 或產品裡的零件。

本文於 2026 年 9 月 18 日查核 OpenAI 開發者文件的 API 更新紀錄、GPT-Live 1 模型頁、電話與 SIP 整合指南,以及工作階段管理指南,讀到的是查核當天的版本;這些文件頁沒有版本號,內容可能之後再更動。本站沒有實際串接或測試這個 API,文中的能力描述都是 OpenAI 的說法。本文只談 API 開發者端的這次更新,不談 ChatGPT 使用者端的方案與設定。

9 月 10 日的更新紀錄:正式提供(GA)、模型代號與兩種委派方式

官方模型頁把 GPT-Live 1 定義成一個全雙工語音模型:它可以同時聆聽與說話,並把推理與工具使用委派給後端代理,也就是查資料或運算時交給背後處理,對話還能繼續。更新紀錄把 9 月 10 日的狀態寫成「已在 API 正式(generally available)推出」,那句話講的是供應狀態,本文查核的四份文件沒有寫這是第一次出現;電話串接指南反而提到,既有整合可能仍會收到一個已淘汰的來電事件名稱,可見這之前就有整合在跑。

模型頁列出的模型代號是 gpt-live-1,對應的端點是 v1/live/sessions;官方文件形容它是「我們最頂級的模型,用於自然、有表情的語音對話,並能流暢處理插話」,這是 OpenAI 自己的說法。模型的輸入與輸出都是聲音與文字兩種形式,不支援圖片與影片;模型頁列出的知識截止日是 2025 年 7 月 31 日,也就是模型本身訓練資料的時間點。

開發者要讓 GPT-Live 1 處理需要查資料或運算的問題時,文件寫有兩種委派方式:一種是 Responses 委派,搭配 OpenAI 的模型;另一種是 client 委派,接到開發者自己架設的後端,沒有指定或設成 null 時走的就是 client。文件寫委派模式在工作階段啟動後不能更改,要換得開一個新的工作階段。

這個模型在 API 裡的規格:只有一個端點,不支援免費層級

GPT-Live 1 在 API 裡只有一個端點被標為支援——Live(v1/live/sessions);官方的端點列表把 Chat Completions、Responses、Realtime 等既有端點,連同舊式的 Completions (legacy) 一起列為不支援。電話串接指南也提醒,每一種 API 有自己的驗證、工作階段建立方式與事件契約,不能互相套用。

用量的算法也不太一樣:文件寫明速率限制是以「同時進行的工作階段數」計算,並把免費(Free)列為不支援的使用層級。依帳號的使用層級,Tier 1 到 Tier 5 分別可以同時開啟 25、50、200、300、500 個工作階段。

依 OpenAI 開發者文件整理,查核日 2026 年 9 月 18 日。
項目內容備註
模型代號gpt-live-1唯一支援端點 v1/live/sessions
支援模態聲音與文字(輸入輸出皆同)不支援圖片與影片
委派模式Responses 委派或 client 委派建立工作階段時選定,中途不能換
併發上限Tier 1–5:25/50/200/300/500不支援免費層級
語音費用每分鐘 0.05 美元,按秒計費後端模型與工具另計

電話打進來,GPT-Live 1 怎麼接手

要把 GPT-Live 1 接到電話系統,官方文件列出兩條路:一種是 Direct SIP,由電話業者與 OpenAI 交換通話音訊,開發者的應用程式負責事件通知、工作階段設定、接不接電話的決定與商業邏輯;另一種是伺服器音訊橋接,由開發者的應用程式把電話業者或會議室的音訊透過 WebSocket 轉送給 GPT-Live,兩端連線、事件轉換、播放與通話生命週期都要自己管。文件提到 Twilio、Telnyx、LiveKit 與 Daily/Pipecat 這幾家業者都有專屬的整合說明。

電話打進來後的流程:由開發者的應用程式依自己的授權與路由規則,分別用一個 API 動作接聽或拒接,接聽要送出模型、聲音與委派模式等設定,拒接則要附上一個介於 300 到 699 之間的 SIP 狀態碼(例如代表忙線的 486);第一個接聽或拒接的決定生效,之後重複送出的決定會被拒絕。通話中另有兩個動作,可以把電話轉接出去或直接掛斷,兩者成功時都回應 200 OK 且沒有內容。

文件在這段流程的結尾寫明,它處理的是打進來的電話,不支援透過 POST /v1/live/sessions 建立對外撥出的 SIP 通話;要做外撥,文件要開發者改用合作夥伴的整合方案,並把外撥講成業者自己掌握的事。文件也提醒,來電附帶的 SIP 標頭要當成不可信的來電方資訊,不能當成授權依據。

四格圖解:GPT-Live 1 進 API 的四個重點——電話以接聽為主、支援語言未列明、預設不錄音、語音每分鐘 0.05 美元
GPT-Live 1 進 API 的四個重點:電話接聽為主、聲音語言未列明、預設不錄音、每分鐘 0.05 美元;依 OpenAI 開發者文件整理,查核日 2026 年 9 月 18 日。 · 圖片:Mokaair (© Mokaair)

聲音是誰的:內建 12 種,這四份文件沒有列出支援語言

GPT-Live 1 的聲音不是只有一種。除了預設的 marin,官方文件另外列出 12 個具名語音可以選,例如語言欄標英語、地區風格欄標英國的 vesper 與標北美的 gleam,以及語言欄標葡萄牙語、風格欄標巴西的 bossa 與 tempo。開發者在建立工作階段時選一個放進設定,對話開始後就不能中途更換,要換就得開新的工作階段。

台灣讀者要注意的是:文件用「地區風格」形容這些語音,同時特別註明那只是說話風格,不保證腔調的擬真度。更重要的是,本文查核的四份官方文件沒有列出這個模型支援哪些口說語言——12 個具名語音的語言欄位只有英語與葡萄牙語,預設語音 marin 的語言也沒有另外說明;文件談到開場白時,要開發者在來電者開口前「用應用程式指定的語言」,並拿自己支援的語言去測試。也就是說,客服電話那頭若真的用上 GPT-Live 1,它中文講得如何,這四份文件沒有給答案,不能預設它會。

官方文件也提到,經過核准的聲音可以用自己的錄音打造成客製化語音,細節在另一份說明裡,本文不深入。

會不會被錄音、記憶有多長、電話講幾分鐘大概多少錢

會不會被錄音,由開發者決定,不是預設開啟。官方文件寫明,工作階段的錄音設定預設是關閉,開發者要主動把它打開、而且專案要先被允許,才能留下已完成的錄音供下載或「分叉」出新的工作階段,下載與分叉還要有一份允許留存的資料政策。留下來的錄音會在 30 天後到期;如果專案啟用了 Zero Data Retention(資料零保留),錄音設定一律視為關閉,下載與分叉也就不可用。錄音下載下來是雙聲道的 WAV 檔,輸入與輸出的聲音分別在左右聲道。

長時間通話的記憶也有上限。文件寫,工作階段預設的上下文視窗是 128,000 tokens,裡面包含開發者給的指示、對話文字,以及不會出現在逐字稿裡的聲音 token;用量超過視窗的 90% 時,系統會在同一個工作階段裡換上另一個語音引擎接手,新引擎會拿到原本的指示,以及最多 8,192 tokens 的對話歷史(近期訊息,以及在有摘要可用時,舊訊息的摘要)。這代表很長的通話,前面談到的細節有可能被摘要或省略。

費用的算法本身不複雜:語音工作階段每分鐘 0.05 美元,依實際秒數計費,文件註明不會無條件進位到整分鐘;後端模型與工具依各自的價格另外計費,這四份文件沒有把這兩筆費用合併成一個範例。以下是本文依查核日 2026 年 9 月 18 日費率做的換算,不是官方數字:語音部分講滿三分鐘,單計語音是 0.15 美元,實際總價還要看後端處理了多少工作。工作階段結束時,官方文件列出的結束原因包含應用程式主動關閉、工作階段達到時長上限、安全過濾中止、遠端連線正常結束,以及連線意外中斷,但文件沒有寫出時長上限實際是幾分鐘。

常見問題

GPT-Live 1 是 2026 年 9 月 10 日才第一次能用嗎?

更新紀錄寫的是「已在 API 正式(generally available)推出」,那句話講的是供應狀態,本文查核的四份官方文件沒有寫這是第一次出現。電話與 SIP 整合指南反而提到,既有整合可能仍會收到一個已淘汰的來電事件名稱,代表在這之前就有整合在跑。這四份文件也沒有寫出更早的預覽時程,或分批開放的安排。

GPT-Live 1 聽得懂中文嗎?可以打電話去用中文問問題嗎?

本文查核的四份官方文件沒有列出這個模型支援哪些口說語言。文件列出的 12 個具名語音,語言欄位只有英語與葡萄牙語,預設語音 marin 也沒有另外標明語言;文件談到開場白時,要開發者在來電者開口前用應用程式指定的語言,並拿自己支援的語言去測試。以本文查核到 2026 年 9 月 18 日的文件版本,沒有看到支援中文的說明,不能預設它聽得懂或答得出流利中文。

台灣的開發者現在可以用這個 API 嗎?

本文查核的四份官方文件沒有列出可以使用的國家或地區清單,也沒有另外提到台灣。能不能申請與使用,請以自己帳號在 OpenAI 平台上實際看到的畫面為準;本文沒有查證台灣帳號目前是否能使用這個功能。

企業要串接電話系統,只能用 OpenAI 官方管道嗎?

不一定。官方文件寫,這個電話流程處理的是打進來的電話,不支援透過 POST /v1/live/sessions 建立對外撥出的 SIP 通話;要做外撥,文件要開發者改用合作夥伴的整合方案,文件點名的幾家是 Twilio、Telnyx、LiveKit 與 Daily/Pipecat。這些屬於第三方業者自己的服務範圍,實際功能與費用要看各家自己的說明。

這個語音工作階段會被錄音留存嗎?

預設不會。官方文件寫明,工作階段的錄音設定預設是關閉,開發者要主動打開、專案要先被允許,下載與分叉還要有一份允許留存的資料政策,才會有錄音留下;留下的錄音會在 30 天後到期。如果專案啟用了資料零保留(Zero Data Retention),錄音設定會一律視為關閉,不會有錄音可以下載。

打一通電話大概要多少錢?

官方公布的是語音本身的費率:每分鐘 0.05 美元,依實際秒數計費,查核日是 2026 年 9 月 18 日。以下是本文的換算,不是官方數字:三分鐘的通話單計語音是 0.15 美元。後端模型與呼叫的工具是另外計費,依各自的價格而定,實際一通電話的總價要看它處理了多少工作,這四份文件沒有提供整通電話的總價範例。

  • 生活分享

    Gemini 3.8 Live 與 Extended Thinking:新語音模型,你的帳號能用嗎?

    2026 年 9 月 15 日,Google 發表 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款語音對話模型。本文依 Google 官方發表文、開發者文、模型卡與定價頁,整理開發者、企業、一般使用者與 Workspace 訂閱者各自能用到什麼、費用怎麼計算,以及模型卡寫的知識截止日與官方未說明的開放地區。

  • 生活分享

    GPT-Live 讓 ChatGPT 語音邊聽邊說:插話、方案用量與錄音設定

    OpenAI 在 2026 年 7 月發布 GPT-Live,讓 ChatGPT 語音能同時聽與說、可以被插話,搜尋與推理則交給背景模型。本文依官方說明整理對話節奏的改變、9 月調整後各方案的模型與用量、做菜與練口說等使用情境、錄音保存與訓練設定,並簡短帶過 API 價格。

  • 生活分享

    OpenAI 揭露 Habitat 儲存架構:每週逾十億人使用背後的規模與極限

    OpenAI 在 2026 年 9 月 11 日於官方工程部落格發布文章,說明內部儲存平台 Habitat 如何從一個 Python 用戶端函式庫演變成獨立服務,並在今年第二季改寫成 Rust。本文依官方文章原文,整理 OpenAI 自陳的請求量、涵蓋地區與資料量等數字,以及官方沒有說明的耐久性與地區細節;本站沒有實測,也不提供任何使用或購買建議。

  • 生活分享

    NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起價 4,999 美元,兩台可串接成 128GB

    NVIDIA 於 2026 年 10 月 2 日宣布,個人 AI 電腦 DGX Spark 新增較平價的 64GB 記憶體版本,10 月 23 日起由 Acer、ASUS 等六家廠商供應,主要對象是想在自己機器上執行 AI 模型的開發者與研究人員。以下整理 NVIDIA 公布的規格、雙機串接說法,以及對一般讀者的意義。

最新旅遊情報攻略

資料來源

生活分享