AI 博客

标签: voice-agents

← 返回 AI 博客

10 分钟读完

Pipecat、LiveKit Agents、TEN 与 Bolna:该买的是媒体通路,不是流水线

四个在功能表上看起来可以互换的开源语音框架,重心其实落在四个不同的列上——运行时、媒体服务器、图、电话线——而其中只有一个是事后难以更换的。人人拿来跑分的流水线手感,恰恰是全双工模型正在商品化掉的那部分;所以要按媒体通路归属、电话接入广度与维护速度来挑,并且在上线之前先把 TEN 的许可证读一遍。

11 分钟读完

全双工删掉了「轮次」——而轮次正是你的提交点

GPT-Live-1 于 9 月 10 日进入 API,能一边听一边说。这读起来像一次自然度升级,实则是一次结构变更。「轮次结束」曾是你的语音智能体用来决定何时调工具、何时写日志、何时跑护栏、何时停表的那个事件——而一个全双工模型根本不会发出它。补救之道不是调一个更好的阈值,而是自己把提交点命名出来,并为一块如今按墙上时钟而非按说话计费的表重新算账。

10 分钟读完

Coval vs Hamming vs Cekura vs Bluejay:你买的是一位模拟来电者

四个平台都能对你的语音智能体跑上几千通测试电话,而它们主推的那个数字——并发量——恰恰是最不重要的那条轴。真正把它们区分开的,是电话那头的来电者从哪儿来,因为那设定了所有这些评测能告诉你什么的上限。

11 分钟读完

ElevenLabs vs Cartesia vs Deepgram vs Rime:买的是长尾,不是平均值

这四家宣称的首字节音频时延在 40 到 200 毫秒之间,而独立测试台量到的云端中位数是 188 到 313 毫秒——但真正毁掉一通电话的是离散度而不是中位数,其中一家的抖动接近另一家的四倍。价格在这片市场里相差约 2.5 倍,而它两个都预测不了。长尾是用部署方式买来的。

9 分钟读完

Deepgram、AssemblyAI、ElevenLabs 与 Speechmatics:你买的是一个话轮检测器

四家之间的词错误率已接近尘埃落定,而那一两个点大多落在意图分类器根本不看的虚词上。真正决定一台语音智能体像不像人的,是话轮结束检测——它比底下的转写延迟大出好几倍,也是这四家真正存在分歧的那一件事。

12 分钟读完

Google 的智能体打电话给商店,而每一项协议保证都掉了下去

Google 的购物智能体如今会致电本地商店查询库存——而这条信道一样都不承载 AP2 及其竞争方案所要提供的签名身份、受限授权、重放保护与可验证凭证。电话不是通往协议普及路上的权宜之计;它是智能体商务的永久地板,覆盖着那条永远不会实现 API 的商家长尾,而它完全没有任何信任原语。

15 分钟读完

ElevenLabs、Vapi、Retell 与 OpenAI gpt-realtime:让智能体开口说话的四种下注方式

语音正变成大多数智能体停留时间最久的界面——而四家平台在如何把语音、语言与工具调用合并到一次往返里做了架构上完全相反的下注。选哪一家,关键并非 TTS 音质,而是你掌握的是音频通路、模型本身,还是只能改一下 prompt。