语音智能体的测试套件量的不是你的智能体,而是你的智能体面对一位由别人生成出来的来电者时的表现——而那位来电者有多真实,就是整套测试所能告诉你的一切的上限。这也正是为什么这四个平台最爱主打的那个数字——并发模拟量——恰恰是最不重要的那条轴。Coval、Hamming、Cekura 和 Bluejay 之间的区别,主要在于电话那头的人从哪儿来:一份照你的 prompt 写出来的人设、一段真实客户的录音、一套钉在 CI 里的场景集,还是每分钟两毛钱能买到的任何东西。照这条轴去选,定价问题自己就有了答案。
先看全景
四家都能对语音智能体自动打电话、给结果打分、标出回归。其中两家公开定价,两家不公开。
| 平台 | 来历 | 测试来电者从哪儿来 | 定价 |
|---|---|---|---|
| Coval | 2024 年创立,YC;330 万美元种子轮 | 跑在 CI 里的场景集,方法论借自自动驾驶仿真 | 公开:每月 100 / 500 / 4500 美元起 |
| Hamming | 2024 年创立,YC S24;380 万美元种子轮 | 回放你自己的生产通话,外加模拟批次 | 销售驱动,按用量,无自助购买 |
| Cekura | 前身 Vocera;YC F24 | 大批量生成场景,配基于规则的断言 | 公开:每月 30 美元起,语音约 5 积分/分钟 |
| Bluejay | 语音与聊天智能体测试 | 自动生成的“数字人”人设 | 销售驱动,未公开 |
在开始对比之前,先说一句信息来源。你能找到的这四家之间的正面对比页,多数由这四家中的某一家自己发布——Coval 维护着关于 Hamming、Cekura 和 Bluejay 的对比文章,Hamming 和 Cekura 也各自发布自己的行业盘点。请把任何关于竞品短板的说法都当作营销,把任何自报的能力数字都当作在有利条件下测出的上限。值得带走的事实是那些公开的价格,以及每个产品的形态——本文只谈这些。
没人拿来卖的那条轴
这几个平台每一个其实都是两个产品钉在一起:一个负责造出来电者,一个负责判断这通电话打得好不好。后半截大体已经商品化了——一份文字记录、一些断言、一个大模型评审、一块看板。前半截才是钱和差异所在,也正是它决定了最后那个数字有没有意义。
生成人设是照你提供的描述写出来的,这意味着它表现出的失败模式,都是你已经想到过的那些。在还没上线、手里什么都没有的阶段,这确实有用;而它在结构上就不可能给你意外。回放生产音频的性质正好相反:它里头有各种口音、有抢话、有渗进来的等待音乐、有说到一半改主意的来电者——所有你不知道该写下来的分布特征——而它的存在前提,是你已经有一个在生产里真的接电话的智能体。
所以这个选择其实不是功能对比。如果你没有生产音频,一个以回放为主的产品无可回放。如果你有生产音频,却只拿自己编出来的人设去评测,那不过是在给自己的想象力打分。多数团队最终两样都需要,而几乎每个团队第一次都买错——因为他们是照着 demo 挑,而不是照着自己的语料挑。
Coval 的定位是有意思的第三种答案。它的创始人此前在 Waymo 负责评测基础设施,而它从自动驾驶测试里带过来的方法论,重点并不是"多仿真一点",而是"钉住一组场景,每次改动都重跑一遍"——价值在于套件是固定的、比较是纵向的,这与"真实度"是完全不同的主张。这一点干净地落在评测驱动开发上,也正是它的 CI 集成比它的人设质量更受关注的原因。
价格是一个乔装打扮的覆盖度决定
Cekura 的积分模型折算下来,一通一分钟的模拟通话大约两毛美元。Coval 公开三档:入门 100 美元、成长 500 美元、企业版每月 4500 美元起。Hamming 按用量而非席位计价,数字只在 demo 之后才给;Bluejay 什么都不公开。
人容易把这读成"便宜与贵"。请改读成"对套件规模的约束",因为它实际咬人的方式正是这个。一个你能提前算出来的每分钟价格,让你可以决定去把那个总是失败的交互跑上四百种变体。而一档你已经付过钱的套餐,或者一份谈好用量的销售合同,会把团队推向一小组精挑细选、大家都同意"有代表性"的通话——而一小组精选样本,恰恰是语音智能体不会在上面失败的那种东西。失败都在长尾里:那个第五百分位的口音、那个在确认语上插一句"不对,等等"的来电者、那次落进队列的转接。
所以带进定价谈判的问题不是月费数字,而是:这个场景的第四百个变体要花多少钱,以及我能不能不给谁发邮件就把这个数算出来。对于一个全部问题就是长尾覆盖的团队来说,一个不公开的企业价是真正的产品局限,而不只是采购上的麻烦。
相应的警告也适用于便宜的那一端。一通两毛让人有理由去跑极其庞大的套件,而一大堆几乎雷同的生成人设,产出的是一个建立在没人验证过的分布之上的、信心十足的通过率。只有当来电者分布本身值得采样时,"量"才值得买——这与我们在评测集维护那一页为文本智能体描述的,是同一个陷阱,只不过在这里它后面还跟着一张电话账单。
打分的问题不是仿真的问题
去问任何一个在跑语音评测的团队哪里疼,你会听到同一句抱怨:评审不稳。同一通电话重跑一遍分数就不一样,一次 prompt 微调让分数动了而行为没动,没人信任那块看板到愿意用它拦住一次发布。
这四家里有两家从相反的两端进攻这个问题,而这个对照是这一组里最实质的技术差异。Hamming 主打的是"音频原生"评测——对音频信号本身打分,而不只是对文字记录——这提高了评审所看之物的保真度,也是唯一能看见那些根本不会出现在文字记录里的失败的路子。Cekura 的 Conditional Actions 是一个基于规则的测试引擎,其定位被明确表述为降低大模型评审的抖动:把检查用确定性的方式表达出来,评审在这件事上就不再处于回路之中。
两者都对,而且是互补而非替代。语音智能体的失败可以干净地一分为二。内容失败——引错了政策、编出了并不存在的库存、没抓住意图——是语义性的,活在文字记录里,也确实需要评审;请把它当作任何一套大模型评审来处理,配一份经过校准的评分标准和一份带标注的样本。交互失败——智能体压着来电者说话、断句把人截在半个词上、每次回复前有两秒死寂、DTMF 没被识别、单向音频——则是时序与信号属性。它们可以被精确测量,它们才是让来电者挂断的那些,而把它们塞给一个语言模型去判断既是范畴错误,也恰好是你整套测试里最抖的那一部分。
不管你买哪家,第一天就沿这条线把套件劈开。交互属性上跑确定性断言,只在内容上用评审,且永远不要一个混合分——因为混合分正是让插话打断上的一次回归看起来像噪声的那样东西。这个劈分也让测试台变得可迁移——它才是这笔投资里耐久的那部分,换厂商也带得走。
这就带出了那个被吆喝得最响、却最不重要的数字。Hamming 宣称 1000+ 并发模拟,Cekura 宣称 2000+。两者都远远超过了你自己的智能体、你的电话服务商限速或你的模型配额成为约束的那个点。从来没有哪一次发布,是被测试台的并发用尽卡住的。
什么情况选哪个
| 处境 | 倾向 | 理由 |
|---|---|---|
| 还未上线,没有生产通话 | Coval 或 Bluejay | 生成人设是你唯一拥有的东西;一套钉在 CI 里的场景集,比你此刻还得不到的真实度更值钱。 |
| 已上线,有可回放的录音 | Hamming | 你自己失败的通话是比任何生成物都更好的测试集,而音频原生打分能看见文字记录丢掉的东西。 |
| 预算有限但要长尾覆盖 | Cekura | 公开的每分钟价格,是这四家里唯一让你据以规划一套大型套件的。 |
| 老式电话系统、IVR 树、DTMF | Hamming | DTMF 与 IVR 仿真是一项具体能力,而那里的失败完全不是文本性的。 |
| 要用回归闸门拦住发布 | Coval | CI 优先是它的产品决策而不是一项集成;纵向比较本身就是全部要点。 |
不管最后落在哪个名字上,有两件事都要做。用同样的二十通电话跑一次为期两周的并行试用——一次针对固定集合的对跑,关于评审一致性所告诉你的,比任何功能矩阵都多——并且确认你能导出什么。一套你带不走的测试集,会把一个工具选择变成一个锁定选择,而你真正在建的资产是那套测试集,不是那家厂商。
常见问题
我非得买这类工具吗,用现有的评测框架不行吗?
文本评测框架能给文字记录打分,如果内容准确性是你唯一关心的事,那也许就够了。它做不到的是:真的把电话打出去、处理插话打断与断句、模拟 DTMF,或者测量那些导致挂断的时序属性。如果你的智能体是在一条电话线上说话,电话那半边就是你原本得自己造的那部分。
回放生产通话是不是总比仿真好?
它是对现实更好的采样,却是更差的变更测量仪。回放告诉你的是当前智能体如何处理那些已经发生过的通话;它覆盖不了你还没上线的流程,而且它背负着生成通话所没有的录音同意与个人信息义务。多数成熟的做法是:用回放拿真实度,用一套钉住的生成套件拿回归。
并发数到底有多重要?
非常不重要。宣传里的 1000 和 2000 并发模拟,远远超出了你的电话服务商、你的模型配额或你自己的智能体成为瓶颈的那个点。决定套件有没有用的是评审质量和来电者真实度;并发决定的只是一套没用的套件多快能跑完。
为什么定价这么难比?
只有 Coval 和 Cekura 公开费率,Hamming 与 Bluejay 是销售驱动。Cekura 的积分模型是唯一能干净地折算成"每通多少钱"的——一通一分钟的模拟通话约两毛美元——这也是它成为四家中最容易据以规划大型套件的那一家的原因。
厂商的对比页可信吗?
拿它们看结构,别拿它们看结论。这几家公司都各自发布着针对彼此的正面对比页,所以能力清单有用,而结论是营销。自己跑一次二十通电话的对跑;它的代价是两周,而它能了结任何对比页都了结不了的那个问题。
延伸阅读
本站内容:
- 评估语音智能体——在挑一个工具来量之前,先想清楚要量什么。
- 话轮转换与插话打断——文字记录给不了你的那些交互失败。
- 评测中的模拟用户——为什么是仿真器设定了上限。
- 延迟预算——决定来电者会不会挂断的那个数字。