生活分享

GPT-Live 让 ChatGPT 语音边听边说:插话、套餐用量与录音设置

OpenAI 在 2026 年 7 月发布 GPT-Live,让 ChatGPT 语音能同时听与说、可以被插话,搜索与推理则交给后台模型。本文依据官方说明整理对话节奏的变化、9 月调整后各套餐的模型与用量、做菜与练口语等使用场景、录音保存与训练设置,并简要带过 API 价格。

更新日期: 阅读时间约 8 分钟

手机上的语音波形与对话气泡交错,呈现边听边说的原创插图
图片:Mokaair (© Mokaair)

OpenAI 在 2026 年 7 月 8 日发布新一代语音模型 GPT-Live,官方博客与 ChatGPT 版本说明都标注了这一天。GPT-Live 采用全双工架构,能同时聆听与说话,现在用于 ChatGPT 语音;遇到需要联网搜索、较深入推理或较复杂工作的问题,它会在后台委派给另一个前沿模型,推出初期是 GPT-5.5,等结果准备好再带回对话。OpenAI 同时推出了 GPT-Live-1 与 GPT-Live-1 mini 两个版本。

本文于 2026 年 9 月 15 日核查了 OpenAI 发布文章、帮助中心的 ChatGPT 语音页面与版本说明。发布文章写的是面向全球 iOS、Android 与 ChatGPT.com 用户逐步推出,版本说明则写在支持的地区推出、发布时不含 Business、Enterprise 与 Edu 工作空间,但两者都没有列出地区清单,也未另外提到台湾。本站没有实际试用,能力描述都是 OpenAI 的说法;你的台湾账号是否已出现这个选项,请以 App 内的设置为准。文中的做菜、练口语与车上场景,是编辑设计的例子。

边听边说之后,对话节奏有什么不同

OpenAI 介绍,最初的 ChatGPT 语音把语音转文字、语言模型与文字转语音三个模型串在一起,响应慢且生硬;后来的高级语音模式改为在单一模型内处理音频,但仍要等用户说完才回应,而且以静音判断一轮发言是否结束,短暂停顿或背景噪音都可能被当成说完了。

GPT-Live 则在生成语音的同时持续聆听,OpenAI 表示模型每秒可多次决定要说话、继续听、暂停、插话或调用工具。对话时,你可以在它回答到一半时插话提问、停下来整理思路,或请它放慢;它可能用“嗯嗯”“明白”表示有在跟着听,你要求它安静地听时也应照做。

帮助中心同时提醒,语音重叠、背景噪音、网络状况与麦克风设置都可能影响它听到的内容,长时间停顿或旁人说话仍可能让它开口。官方建议可改用耳机、换到较安静的地方,iPhone 用户可在控制中心的麦克风模式中开启语音隔离;想边想边说时,可以在开头先说“等我请你回复时再回复”。Live 主要为一对一对话设计,尚未针对多人同时说话进行优化。

查资料时的等待也和以前不同。OpenAI 表示,搜索或推理交给后台模型处理时,GPT-Live 仍能继续和你交谈,结果好了才带回对话。编辑建议不要把等待时的临时回应当成结论,结果回来后再请它说明依据。

各套餐用哪个模型、每天能用多久

发布当天,OpenAI 表示 GPT-Live-1 是 Go、Plus 与 Pro 用户的默认模型,免费版则默认使用 GPT-Live-1 mini;当时语音还能另外选择快速回复或多花时间思考的推理程度。Go 的模型与这组推理程度,都在 2026 年 9 月 9 日的版本说明中做了调整,读过早期报道的人要以现状为准。

根据 9 月 9 日版本说明与帮助中心,Go 改为最多 3 小时的 GPT-Live-1 mini,取代原本的 GPT-Live-1;Plus 最多 3 小时 GPT-Live-1,每月 100 美元的 Pro 最多 15 小时,每月 200 美元的 Pro 不限时长。Plus 与 Pro 达到上限后不再切换到 mini。用量按滚动 24 小时计算,免费版为有限使用,上限可能调整。

9 月 9 日版本说明也写到,语音需要搜索或思考较难的问题时,可以使用 GPT-5.6 或 GPT-6 Astra,模型与推理强度改用和文字聊天相同的控件选择,可用模型与用量视套餐而定;原本语音专用的三种推理程度已取消。帮助中心现在也写明,符合条件的 Business、Enterprise、Edu 与 Healthcare 工作空间可使用语音,但受工作空间设置约束。

2026 年 9 月 15 日核查;依据 OpenAI 帮助中心与 9 月 9 日版本说明,用量按滚动 24 小时计算,未列出工作空间套餐。
套餐Live 模型用量上限
免费版GPT-Live-1 mini有限,可能调整
GoGPT-Live-1 mini3 小时
PlusGPT-Live-13 小时
Pro(每月 100 美元)GPT-Live-115 小时
Pro(每月 200 美元)GPT-Live-1不限

做菜、练口语与 CarPlay:三个使用场景

第一个场景是边做菜边问。手上沾着面粉时,可以直接问某样食材能不能替代,听到一半发现家里只剩两个鸡蛋,就插话更正条件,不必等它讲完。不过烹饪温度、过敏原与保存方式,仍应回到菜谱或食品包装上核对,别只靠听到的一句话。

第二个场景是练习口语。OpenAI 在发布文章中提到,每周有超过 1.5 亿人通过语音与听写等功能和 ChatGPT 对话,用途包括练习语言。你可以在设置 → 语音中选择最常说的语言,也能在对话中要求它换一种语言或说慢一点,但帮助中心写明目前无法精确控制播放速度。OpenAI 表示已针对部分最常用的语言进行优化,但未列出清单,部分语言可能带有非母语口音或不够流畅,练发音时别把它的口音当作标准。

第三个场景是在车上。帮助中心写明 ChatGPT 可在受支持的 iPhone 上通过 Apple CarPlay 使用,同时提醒仅在法律允许且安全的情况下使用移动设备,应在驾驶前设置好应用,避免在车辆行驶时操作。编辑建议行车中不要看屏幕上的文字回复;营业时间、地址这类信息,停车后再用官方来源确认。

如果想在切换到其他 App 或手机锁定时继续对话,需要在设置 → 语音中开启后台对话;2026 年 8 月 31 日的版本说明也提到,iPhone 的锁定屏幕与灵动岛可以显示 Live 语音对话的内容。后台对话会在你结束对话、强制关闭 App、达到用量上限或最长会话时长时结束。

GPT-Live 语音对话四个要点的图解:同时听与说、后台查资料、套餐与用量、录音与核对
GPT-Live 语音的四个要点:同时听与说、后台查资料、各套餐模型与用量、录音保存与回答核对;依据 OpenAI 官方说明整理。 · 图片:Mokaair (© Mokaair)

录音、转录文本与训练:先看官方数据控制说明

帮助中心写明,Live 与高级语音对话的音频片段,会和聊天记录中的转录文本一起存储,保留 30 天。删除聊天后,相关音频片段会在 30 天内删除,但出于安全、防护或法律原因需要保留,或你此前已选择共享且片段已与账户解除关联的情况除外。删除无法撤销,归档只是从侧边栏移除,不会删除音频。

录音会不会被拿去训练模型,要看两个开关。帮助中心表示,除非你选择共享,否则不会用音频片段训练;个人工作空间的免费版、Plus 与 Pro 用户,要先在设置 → 数据控制中开启“为所有人改进模型”,再开启“包含你的音频录音”才会共享;Business、Enterprise 与 Edu 工作空间则无法共享片段。另外要注意,只要“为所有人改进模型”开着,语音对话的转录文本与其他文件就可能视套餐与设置被用于训练。

共享的片段可能由 OpenAI 团队审核;停止共享后,此前已解除关联的片段仍可能继续被使用。OpenAI 另在 2026 年 7 月 31 日更新发布文章,表示 GPT-Live 生成的受支持音频已加入 SynthID 水印;家长也可通过家长控制决定青少年子女能否使用语音。

语音回答仍要核对,API 价格简单带过

说出来的回答听过就过去了,比文字更难回头检查。帮助中心提醒 ChatGPT 可能出错,与日期、时间或地点相关的问题尤其要核对;语音会用设备或浏览器的时区理解“今天”“明天”,回答不对时可以直接说出确切的日期与地点。使用 Live 时,回答会同步以文字显示,结束后可在聊天记录中查看,但转录文本不是逐字记录,可能与实际说的内容不完全一致。

Live 目前也有功能边界。帮助中心写明它不支持视频、屏幕共享、已连接的应用或插件,需要视频或屏幕共享时,符合条件的订阅用户可在 iOS 与 Android App 中改用高级模式;一次只能进行一个语音对话,达到用量上限、最长会话时长或长对话的上下文限制时,对话也可能结束。

开发者端和 ChatGPT 里的推出是两回事:OpenAI 的 API 更新日志在 2026 年 9 月 10 日写到,GPT-Live 1 在 API 中正式开放,语音会话每分钟 0.05 美元、按秒计费,背后搭配的模型与工具用量另行计费。

最新旅游情报攻略

资料来源

生活分享