生活分享

GPT-Live 1 开放 API:电话客服能不能接、声音是谁的、会不会录音

2026 年 9 月 10 日,OpenAI 的 API 更新记录写下全双工语音模型 GPT-Live 1 已在 API 正式提供,开发者可以把它接入电话客服、App 或自己的产品。本文依据 OpenAI 开发者文档整理这个模型在 API 里的规格、电话怎么接入,以及文档说明这个端点不支持外呼、内置的 12 个具名语音与没有列出的支持语言,还有录音与每分钟计费方式;本站没有实测。

阅读时间约 12 分钟

原创插图:左边一部手机,旁边有四条声波线;一条线从手机底部折向右边的圆角面板,面板里有一个对话气泡和几条声波,代表打进来的电话由背后的语音模型接手回应。
图片:Mokaair (© Mokaair)

2026 年 9 月 10 日,OpenAI 在 API 开发者文档的更新记录里写下一条新条目:全双工语音模型 GPT-Live 1 已在 API 正式提供(generally available),对应模型代号 gpt-live-1、端点 v1/live/sessions。官方文档写明,语音会话每分钟 0.05 美元、按秒计费,后端模型与工具的用量另外计费。这件事的意义是:一个能边听边说的语音模型,是开发者可以买来装进自己电话系统、App 或产品里的组件。

本文于 2026 年 9 月 18 日查核了 OpenAI 开发者文档的 API 更新记录、GPT-Live 1 模型页、电话与 SIP 集成指南,以及会话管理指南,读到的是查核当天的版本;这些文档页面没有版本号,内容之后可能还会变动。本站没有实际对接或测试这个 API,文中的能力描述都是 OpenAI 的说法。本文只谈 API 开发者端的这次更新,不谈 ChatGPT 用户端的订阅方案与设置。

9 月 10 日的更新记录:正式提供(GA)、模型代号与两种委派方式

官方模型页把 GPT-Live 1 定义成一个全双工语音模型:它可以同时聆听与说话,并把推理与工具使用委派给后端代理,也就是查资料或运算时交给背后处理,对话仍能继续。更新记录把 9 月 10 日的状态写成“已在 API 正式(generally available)推出”,那句话讲的是供应状态,本文查核的四份文档没有写这是第一次出现;电话集成指南反而提到,现有集成可能仍会收到一个已弃用的来电事件名称,可见在这之前就有集成在运行。

模型页列出的模型代号是 gpt-live-1,对应的端点是 v1/live/sessions;官方文档形容它是“我们最顶级的模型,用于自然、有表现力的语音对话,并能流畅处理插话”,这是 OpenAI 自己的说法。模型的输入与输出都是声音与文字两种形式,不支持图片与视频;模型页列出的知识截止日是 2025 年 7 月 31 日,也就是模型本身训练数据的时间点。

开发者要让 GPT-Live 1 处理需要查资料或运算的问题时,文档写有两种委派方式:一种是 Responses 委派,搭配 OpenAI 的模型;另一种是 client 委派,接到开发者自己搭建的后端,没有指定或设为 null 时走的就是 client。文档写委派模式在会话启动后不能更改,要换就得开一个新的会话。

这个模型在 API 里的规格:只有一个端点,不支持免费层级

GPT-Live 1 在 API 里只有一个端点被标为支持——Live(v1/live/sessions);官方的端点列表把 Chat Completions、Responses、Realtime 等现有端点,连同旧式的 Completions (legacy) 一起列为不支持。电话集成指南也提醒,每一种 API 都有自己的认证、会话创建方式与事件契约,不能互相套用。

用量的算法也不太一样:文档写明速率限制是按“同时进行的会话数”计算,并把免费(Free)列为不支持的使用层级。依账号的使用层级,Tier 1 到 Tier 5 分别可以同时开启 25、50、200、300、500 个会话。

依据 OpenAI 开发者文档整理,查核日 2026 年 9 月 18 日。
项目内容备注
模型代号gpt-live-1唯一支持端点 v1/live/sessions
支持模态声音与文字(输入输出皆同)不支持图片与视频
委派模式Responses 委派或 client 委派创建会话时选定,中途不能换
并发上限Tier 1–5:25/50/200/300/500不支持免费层级
语音费用每分钟 0.05 美元,按秒计费后端模型与工具另计

电话打进来,GPT-Live 1 怎么接手

要把 GPT-Live 1 接入电话系统,官方文档列出两条路径:一种是 Direct SIP,由电话运营商与 OpenAI 交换通话音频,开发者的应用负责事件通知、会话设置、接不接电话的判断与业务逻辑;另一种是服务器音频桥接,由开发者的应用把电话运营商或会议室的音频通过 WebSocket 转发给 GPT-Live,两端连接、事件转换、播放与通话生命周期都要自己管理。文档提到 Twilio、Telnyx、LiveKit 与 Daily/Pipecat 这几家服务商都有专属的集成说明。

电话打进来后的流程:由开发者的应用依自己的授权与路由规则,分别用一个 API 操作接听或拒接,接听要发送模型、声音与委派模式等设置,拒接则要附上一个介于 300 到 699 之间的 SIP 状态码(例如代表占线的 486);第一个接听或拒接的判断生效,之后重复发送的判断会被拒绝。通话中另有两个操作,可以把电话转接出去或直接挂断,两者成功时都返回 200 OK 且没有内容。

文档在这段流程的结尾写明,它处理的是打进来的电话,不支持通过 POST /v1/live/sessions 创建对外呼出的 SIP 通话;要做外呼,文档要求开发者改用合作伙伴的集成方案,并把外呼描述成运营商自己掌握的事。文档也提醒,来电附带的 SIP 头部要当成不可信的来电方信息,不能当成授权依据。

四格图解:GPT-Live 1 进入 API 的四个要点——电话以接听为主、支持语言未列明、默认不录音、语音每分钟 0.05 美元
GPT-Live 1 进入 API 的四个要点:电话接听为主、声音语言未列明、默认不录音、每分钟 0.05 美元;依据 OpenAI 开发者文档整理,查核日 2026 年 9 月 18 日。 · 图片:Mokaair (© Mokaair)

声音是谁的:内置 12 种,这四份文档没有列出支持语言

GPT-Live 1 的声音不止一种。除了默认的 marin,官方文档另外列出 12 个具名语音可选,例如语言字段标英语、地区风格字段标英国的 vesper 与标北美的 gleam,以及语言字段标葡萄牙语、风格字段标巴西的 bossa 与 tempo。开发者在创建会话时选一个放进设置,对话开始后就不能中途更换,要换就得开新的会话。

台湾读者要注意的是:文档用“地区风格”形容这些语音,同时特别注明那只是说话风格,不保证口音的还原度。更重要的是,本文查核的四份官方文档没有列出这个模型支持哪些口语语言——12 个具名语音的语言字段只有英语与葡萄牙语,默认语音 marin 的语言也没有另外说明;文档谈到开场白时,要求开发者在来电者开口前“使用应用指定的语言”,并用自己支持的语言去测试。也就是说,客服电话那头若真的用上 GPT-Live 1,它中文讲得如何,这四份文档没有给出答案,不能预设它会。

官方文档也提到,经过核准的声音可以用自己的录音打造成定制语音,细节在另一份说明里,本文不深入展开。

会不会被录音、记忆有多长、打电话几分钟大概多少钱

会不会被录音,由开发者决定,不是默认开启。官方文档写明,会话的录音设置默认是关闭,开发者要主动打开、而且项目要先获得许可,才能保留已完成的录音供下载或“分叉”出新的会话,下载与分叉还需要一份允许留存的数据政策。留存的录音会在 30 天后过期;如果项目启用了 Zero Data Retention(数据零保留),录音设置一律视为关闭,下载与分叉也就不可用。下载的录音是双声道 WAV 文件,输入与输出的声音分别在左右声道。

长时间通话的记忆也有上限。文档写,会话默认的上下文窗口是 128,000 tokens,里面包含开发者给的指示、对话文字,以及不会出现在文字记录里的语音 token;用量超过窗口的 90% 时,系统会在同一个会话里切换到另一个语音引擎接手,新引擎会拿到原本的指示,以及最多 8,192 tokens 的对话历史(近期消息,以及在有摘要可用时,旧消息的摘要)。这代表很长的通话,前面谈到的细节有可能被摘要或省略。

费用的算法本身不复杂:语音会话每分钟 0.05 美元,按实际秒数计费,文档注明不会无条件进位到整分钟;后端模型与工具依各自的价格另外计费,这四份文档没有把这两笔费用合并成一个示例。以下是本文依查核日 2026 年 9 月 18 日费率做的换算,不是官方数字:语音部分讲满三分钟,单计语音是 0.15 美元,实际总价还要看后端处理了多少工作。会话结束时,官方文档列出的结束原因包括应用主动关闭、会话达到时长上限、安全过滤中止、远程连接正常结束,以及连接意外中断,但文档没有写出时长上限实际是几分钟。

常见问题

GPT-Live 1 是 2026 年 9 月 10 日才第一次能用吗?

更新记录写的是“已在 API 正式(generally available)推出”,那句话讲的是供应状态,本文查核的四份官方文档没有写这是第一次出现。电话与 SIP 集成指南反而提到,现有集成可能仍会收到一个已弃用的来电事件名称,说明在这之前就有集成在运行。这四份文档也没有写出更早的预览时间表,或分批开放的安排。

GPT-Live 1 听得懂中文吗?可以打电话用中文提问吗?

本文查核的四份官方文档没有列出这个模型支持哪些口语语言。文档列出的 12 个具名语音,语言字段只有英语与葡萄牙语,默认语音 marin 也没有另外标明语言;文档谈到开场白时,要求开发者在来电者开口前使用应用指定的语言,并用自己支持的语言去测试。以本文查核到 2026 年 9 月 18 日的文档版本,没有看到支持中文的说明,不能预设它听得懂或能讲流利中文。

台湾的开发者现在可以用这个 API 吗?

本文查核的四份官方文档没有列出可以使用的国家或地区清单,也没有另外提到台湾。能不能申请与使用,请以自己账号在 OpenAI 平台上实际看到的画面为准;本文没有查证台湾账号目前是否能使用这个功能。

企业要接入电话系统,只能用 OpenAI 官方渠道吗?

不一定。官方文档写明,这个电话流程处理的是打进来的电话,不支持通过 POST /v1/live/sessions 创建对外呼出的 SIP 通话;要做外呼,文档要求开发者改用合作伙伴的集成方案,文档点名的几家是 Twilio、Telnyx、LiveKit 与 Daily/Pipecat。这些属于第三方服务商自己的服务范围,实际功能与费用要看各家自己的说明。

这个语音会话会被录音留存吗?

默认不会。官方文档写明,会话的录音设置默认是关闭,开发者要主动打开、项目要先获得许可,下载与分叉还需要一份允许留存的数据政策,才会有录音留下;留下的录音会在 30 天后过期。如果项目启用了数据零保留(Zero Data Retention),录音设置会一律视为关闭,不会有录音可以下载。

打一通电话大概要多少钱?

官方公布的是语音本身的费率:每分钟 0.05 美元,按实际秒数计费,查核日是 2026 年 9 月 18 日。以下是本文的换算,不是官方数字:三分钟的通话单计语音是 0.15 美元。后端模型与调用的工具是另外计费,依各自的价格而定,实际一通电话的总价要看它处理了多少工作,这四份文档没有提供整通电话的总价示例。

  • 生活分享

    Gemini 3.8 Live 与 Extended Thinking:新语音模型,你的账号能用吗?

    2026 年 9 月 15 日,Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音对话模型。本文依据 Google 官方发布文章、开发者文章、模型卡与定价页,整理开发者、企业、普通用户与 Workspace 订阅者各自能用到什么、费用怎么计算,以及模型卡写明的知识截止日与官方未说明的开放地区。

  • 生活分享

    GPT-Live 让 ChatGPT 语音边听边说:插话、套餐用量与录音设置

    OpenAI 在 2026 年 7 月发布 GPT-Live,让 ChatGPT 语音能同时听与说、可以被插话,搜索与推理则交给后台模型。本文依据官方说明整理对话节奏的变化、9 月调整后各套餐的模型与用量、做菜与练口语等使用场景、录音保存与训练设置,并简要带过 API 价格。

  • 生活分享

    OpenAI 揭露 Habitat 存储架构:每周逾十亿人使用背后的规模与极限

    OpenAI 在 2026 年 9 月 11 日于官方工程博客发布文章,说明内部存储平台 Habitat 如何从一个 Python 客户端库演变成独立服务,并在今年第二季度改写成 Rust。本文依官方文章原文,整理 OpenAI 自陈的请求量、覆盖地区与数据量等数字,以及官方没有说明的耐久性与地区细节;本站没有实测,也不提供任何使用或购买建议。

  • 生活分享

    NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起价 4,999 美元,两台可串接成 128GB

    NVIDIA 于 2026 年 10 月 2 日宣布,个人 AI 电脑 DGX Spark 新增较平价的 64GB 内存版本,10 月 23 日起由 Acer、ASUS 等六家厂商供应,主要面向希望在自己机器上运行 AI 模型的开发者与研究人员。以下整理 NVIDIA 公布的规格、双机串接说法,以及对普通读者的意义。

最新旅游情报攻略

资料来源

生活分享