OpenAI 在 9 月 10 日放进 API 的这个语音模型,会在自己还在说话的时候继续听;而有意思的后果并不是对话变得更自然,而是「轮次结束」——你那套技术栈用来决定何时调工具、何时写追踪、何时跑护栏、何时停表的那个事件——不再发生了。上面每一个决定,挂的都是一个全双工模型根本不会发出的信号。
速览
GPT-Live-1 刻意不做大脑。它是嘴和耳朵,与「思考」分开售卖。
| 属性 | GPT-Live-1 | 它取代了什么 |
|---|---|---|
| 对话模型 | 全双工——边听边说,同时进行。 | 半双工:先判定说完,再作答。 |
| 推理与工具 | 委托给一个你自己挑的后端文本模型。 | 在实时模型内部完成。 |
| 价格 | 每分钟 $0.05,按秒计费——只买语音层。 | 音频按 token 计量。 |
| 传输方式 | WebRTC、WebSocket 与 SIP,经由 v1/live/sessions。 |
同样三种,但会话对象不同。 |
实际发布了什么
2026 年 9 月 10 日,OpenAI 让 gpt-live-1 在 API 中全面可用,每分钟五美分,按秒计费。该模型把进来的音频与出去的音频一并处理:在它自己的音频还在播放的时候,它就能对一次打断、一声「嗯哼」的附和、一次说到一半的改口,或是背景里的人声作出反应。
底下那个架构选择值得读两遍。GPT-Live-1 不负责思考。你要给它配一个后端文本模型——OpenAI 点名了 GPT-6 Astra、Luna 与 Terra,也允许用第三方模型——由那个模型去做推理与工具调用,而语音层则让对话一直流动下去。已公布的数字来自这种搭配,而不是来自语音模型单独的表现:在 Full Duplex Bench 上,它的交互性得分为 80.1%,GPT-Realtime-2.1 为 45.4%,轮次切换延迟从 1.4 秒降到 0.8 秒;在 Full Duplex Bench v3 上,以 Terra 作后端、推理力度设为低,工具调用 Pass@1 为 87.0%,对照配置分别为 60.0% 与 58.0%。而与 GPT-6 Astra 以中等推理力度搭配时,OpenAI 称其在 Tau3——一项覆盖口语客服任务的端到端基准——上取得第一。
从运维角度看,它仍是一个公测形态的产品。并发会话上限在 tier 1 为 25、tier 5 为 500,且不支持免费层——这意味着你要写的第一份容量规划,是一份档位升级申请,而不是一次压测。
留意基准配置暗含的意思:每一个头条数字,都是「语音模型 + 后端模型 + 推理力度」的一个三元组。「GPT-Live-1 得了 87%」并不是一句关于某个模型的陈述。引用时把三者都记下来,测自己的时候也把三者都记下来。
轮次是承重的,而几乎没人把这件事写下来
在级联式技术栈里,端点检测是你的代码做出的一个决定:语音活动检测回答这一帧里有没有人声,端点检测器回答来电者是不是说完了。后面那个决定是语音智能体里后果最重的一行,团队会为它调上几个月。而被注意得少得多的,是还有多少东西被悄悄拴在了它上面。
- 工具派发。「等来电者说完再调工具」是默认设计,因为在一句话中途调工具,有对着半句话动手的风险。轮次结束就是那道闸。
- 追踪边界。一轮一个 span,是语音追踪的成形方式。没有轮次,一通三十分钟的电话就是一个没有内部结构的 span,而追踪恰好在你最需要它的那个长度上变得无法阅读。
- 护栏。一个针对完整话语运行的输出检查,没法去检查一段"来电者正说着话、它也还在往外吐"的话语。
- 评估。逐轮打分——在这个用户轮次下,这次回应对不对——几乎是每一套语音评测的搭法。语音评测厂商都按轮次切分,因为那是当时存在的单位。
- 转人工。「在当前这一轮结束时升级」是转接的礼貌版本。而现在没有「当前这一轮结束」这回事了。
这些一旦被看见,没有一个是难题。它们危险,是因为它们隐形:你的代码里没有任何一处为这五件事写着 on_end_of_turn。这份依赖分散在一个状态机、一个追踪装饰器、一段护栏中间件和一套测试框架里,而前三者仍会照跑不误、不报任何错。它们只是会在错误的时刻运行,或者根本不运行。
由此产生的失败不是崩溃。它是:一次针对来电者还在修改的句子发出的工具调用、一道因为求值对象是空缓冲而通过的护栏,以及一条声称"发生了一件事"的追踪。这里的每一项,在你的看板上都长得像一次模型回退。
取代轮次的,是你自己声明的提交点
诚实的答案是:轮次一直都是另一样东西的代理——那个「智能体的理解已经稳定到可以据此动手」的时刻。半双工让你可以把两者混为一谈,因为「来电者不说话了」是「来电者说完了」的一个不错的近似。全双工把这道区分逼到了台面上,这既让人不适,也是对的。
所以,把提交点命名出来,而不是继承过来:
- 按槽位填满来提交,而不是按静音来提交。一个订位智能体并不需要来电者停下;它需要一个日期、一个人数和一个名字。当槽位填满并稳定了一小段时间就发起调用,让来电者继续说下去。这正是显式对话状态的用途,而全双工把它从"整洁"变成了"必须"。
- 把撤回做成一等通路。如果你在来电者说完之前就动了手,他们有时会在工具已经跑完之后来更正你——「不对,是周二」。这从此是常态而非边角情形,所以每一个提前提交的工具都需要一个补偿动作。只读查询尽可提前触发;任何会产生变更的动作,都需要你给重试订单准备的那套幂等键与对账。
- 按活动而不是按轮次开 span。工具触发时、后端模型被调用时、智能体开始与停止说话时,各发一个 span。通话于是成为一条由相互重叠的区间构成的时间线——它本来就是这个样子。
- 把护栏挪到流上。一个需要完整话语的输出检查,现在形状就不对了。去检查后端模型的工具参数——那些是离散的——并接受一件事:音频本身由模型自己的行为来治理。
不舒服的那部分是:「何时开口」这个决定已经搬进了模型权重里面。在级联式方案中,你调的是一个数,而一个数是可复审、可比对、可回滚的。一条学出来的打断策略,三样都不是。这与业界从规则式对话转向 LLM 时做的是同一笔交易,只是降了一层落地,也值得同样的应对——钉住版本、留一组冻结的场景集、每次变更都重做基线。
两块表,形状相反
把语音层与思考解绑,会把你的账单拆成两块行为迥异的表,而这道拆分很容易被忽略,因为只有其中一块会出现在发布页上。
语音层是按墙上时钟计的每分钟五美分。来电者说话时它在走,智能体说话时它在走,而——这一点值得记牢——没人说话时它照样在走。一位正在翻找账号的来电者不产生任何 token,却和一位正说到一半的来电者花一样多的钱。按 token 计量的音频,为"说了什么"定价;按分钟计的语音层,为"这条线开了多久"定价。任何拉长通话的东西,如今都以一个统一费率在花钱,这悄悄地给整套设计重新定了价:一个慢的后端模型、一步检索、一次等工具返回的静默、一位话多的来电者。
后端模型正相反:按 token 计量、与时长无关,由你让它想多久来驱动。推理力度是一个旋钮,它能在不改变一分钟音频的前提下改变你的单次通话成本——而上面那张基准表还表明,它同时也在改变质量。于是这两块表被一个不出现在任何一张发票上的旋钮耦合在了一起。
由此,该盯的那个数字既显而易见又略有些不寻常:每一通"解决了问题的通话"的成本,并拆解为分钟数与 token 数。不是每分钟成本,也不是每 token 成本。一次"换成更便宜的模型从而削减后端开支、但每次交互多出八秒思考时间"的改动,很容易是亏钱的,而单看任何一块表都不会告诉你这件事。这正是智能体单位经济学所要求的那套纪律,只不过被用在了一个"延迟已从体验问题变成一条直接成本项"的系统上。
一次具体的稽核:取一周的通话录音,量出静音总时长,乘以每分钟 $0.05。这个数就是你那份"端点检测的耐心"——它过去免费,现在不是了。如果它很大,解法通常不是一个更快的模型,而是一套更短的对话设计。
谁该动,什么时候动
| 情形 | 现在就上全双工 | 继续留在半双工 |
|---|---|---|
| 对话式、打断频繁、单句话赌注不大 | 该上——它就是为此而生的。 | 仅当你的打断处理已经很好用。 |
| 每个动作都是一次变更(支付、预订、派工) | 先把补偿动作建好再说。 | 该留——轮次边界是一道便宜的安全护栏。 |
| 带脚本化披露话术的受监管通话流程 | 还不行——一段被来电者盖过去的披露,是一条合规发现。 | 该留。 |
| 你的评测套件按轮次打分 | 先重建评测,再迁移。 | 在那之前该留。 |
| 长静默是结构性的(查询、等待音乐、遗留 IVR) | 先把分钟成本算出来再定。 | 可能更便宜。 |
放大来看:OpenAI 对语音栈做的,正是Agents API 对控制循环做过的事——拿走一层各家都做得很糟的东西,把它做到出色,然后把一个你原本自己掌握的决定,挪进一个你钉不住的版本里。两次都是划算的交易,而两次的代价都是你对回退做归因的能力。防御手段也一样——一组你每天重跑的冻结场景,以及一个你自己算出来的数字。
常见问题
全双工是不是意味着我不再需要语音活动检测?
你不再需要它来决定智能体何时该回应——那件事由模型来做。但你仍然想要它去做 VAD 另外擅长的那些事:发现一通电话已经静默、度量抢话率,以及为复听切分录音。
GPT-Live-1 为什么需要一个单独的后端模型?
因为"让对话流动下去"和"仔细推理"是两件延迟预算不同的活。把它们分开,能让语音层保持灵敏、同时让一个更慢的模型去想,并让你按通话去选那个模型该想多狠。这也意味着,每一个基准数字都是这一对的属性,而不是其中任何一半的属性。
每分钟 $0.05 比我现在付的便宜吗?
单看它无法比较,因为它买到的只是语音层。要加上后端模型的 token 和任何工具。结构性的变化在于:语音那部分如今按经过的时间计费,而不再按音频 token 计费,于是静默与慢工具调用有了它们过去没有的价格。
把一个现成的智能体切过去,最先坏的是什么?
通常是工具派发那道闸,其次是评测套件。任何形如"等用户说完,然后动手"的东西都没有了触发器;任何按轮次切分的打分框架也没有了切分单位。
全双工通话里还能保留转人工的通路吗?
能,但交接点必须被声明出来,而不是被推断出来。挑一个明确条件——一个置信度阈值、来电者的某句话、一次失败的工具调用——让智能体在该条件上停止说话,而不是去等一轮结束。参见升级与热转接。
延伸阅读
本站相关:
- 全双工语音 —— 这个概念本身,以及它为什么不只是"更快的半双工"。
- 语音与实时智能体 —— 这一切所依托的"级联还是语音到语音"之选。
- 轮次切换与打断 —— 半双工难题的完整版。
- 延迟预算 —— 毫秒到底花在了哪里。
- 语音工具与状态 —— 对话状态,正是提交点赖以搭建的东西。
- 长会话与发布 —— 一个通话形状的负载会对你的发布流程做什么。
信息来源:
- Build more natural voice experiences with GPT-Live-1 in the API —— OpenAI,2026 年 9 月 10 日。
- OpenAI API 文档 — gpt-live-1 —— 模型卡、传输方式与会话上限。
- Getting started with GPT-Live —— 会话建立、后端模型、WebRTC/WebSocket/SIP。