AI 博客

Coval vs Hamming vs Cekura vs Bluejay:你买的是一位模拟来电者

四个平台都能对你的语音智能体跑上几千通测试电话,而它们主推的那个数字——并发量——恰恰是最不重要的那条轴。真正把它们区分开的,是电话那头的来电者从哪儿来,因为那设定了所有这些评测能告诉你什么的上限。

作者 智能体 AI 维基 26 分钟读完

语音智能体的测试套件量的不是你的智能体,而是你的智能体面对一位由别人生成出来的来电者时的表现——而那位来电者有多真实,就是整套测试所能告诉你的一切的上限。这也正是为什么这四个平台最爱主打的那个数字——并发模拟量——恰恰是最不重要的那条轴。Coval、Hamming、Cekura 和 Bluejay 之间的区别,主要在于电话那头的人从哪儿来:一份照你的 prompt 写出来的人设、一段真实客户的录音、一套钉在 CI 里的场景集,还是每分钟两毛钱能买到的任何东西。照这条轴去选,定价问题自己就有了答案。

先看全景

四家都能对语音智能体自动打电话、给结果打分、标出回归。其中两家公开定价,两家不公开。

平台来历测试来电者从哪儿来定价
Coval2024 年创立,YC;330 万美元种子轮跑在 CI 里的场景集,方法论借自自动驾驶仿真公开:每月 100 / 500 / 4500 美元起
Hamming2024 年创立,YC S24;380 万美元种子轮回放你自己的生产通话,外加模拟批次销售驱动,按用量,无自助购买
Cekura前身 Vocera;YC F24大批量生成场景,配基于规则的断言公开:每月 30 美元起,语音约 5 积分/分钟
Bluejay语音与聊天智能体测试自动生成的“数字人”人设销售驱动,未公开

在开始对比之前,先说一句信息来源。你能找到的这四家之间的正面对比页,多数由这四家中的某一家自己发布——Coval 维护着关于 Hamming、Cekura 和 Bluejay 的对比文章,Hamming 和 Cekura 也各自发布自己的行业盘点。请把任何关于竞品短板的说法都当作营销,把任何自报的能力数字都当作在有利条件下测出的上限。值得带走的事实是那些公开的价格,以及每个产品的形态——本文只谈这些。

没人拿来卖的那条轴

Where the test caller comes from, and how the call is scored Four sources of a test caller feed one voice agent under test: generated personas written from a prompt, replayed audio from real production calls, a pinned scenario suite running in continuous integration, and high-volume generated scenarios bought by the minute. The agent under test sits in the centre. Below it the scoring layer splits into two paths: deterministic assertions over interaction properties such as barge-in, endpointing, latency and DTMF, and a language-model judge over the transcript for content accuracy. A note records that the realism of the source sets the ceiling on the entire evaluation. Where the caller comes from Generated personas written from your prompt — cannot surprise you Replayed production real accents, cross-talk, a caller changing their mind Pinned CI suite fixed set, re-run on change — longitudinal, not realistic Volume generation cheap per minute — breadth over an unvalidated tail Voice agent under test the only part you can change Scoring splits in two Deterministic assertions barge-in · endpointing · time-to-first-word dead air · DTMF · one-sided audio measurable exactly, no judge in the loop THE FAILURES THAT END CALLS Judge over the transcript policy quoted correctly · intent captured nothing invented · escalation at the right point needs a rubric and a labelled sample SEMANTIC, AND GENUINELY HARD One blended score hides a barge-in regression inside judge noise. Keep the two apart.
四种来源、一个智能体、两条截然不同的打分路径。

这几个平台每一个其实都是两个产品钉在一起:一个负责造出来电者,一个负责判断这通电话打得好不好。后半截大体已经商品化了——一份文字记录、一些断言、一个大模型评审、一块看板。前半截才是钱和差异所在,也正是它决定了最后那个数字有没有意义。

生成人设是照你提供的描述写出来的,这意味着它表现出的失败模式,都是你已经想到过的那些。在还没上线、手里什么都没有的阶段,这确实有用;而它在结构上就不可能给你意外。回放生产音频的性质正好相反:它里头有各种口音、有抢话、有渗进来的等待音乐、有说到一半改主意的来电者——所有你不知道该写下来的分布特征——而它的存在前提,是你已经有一个在生产里真的接电话的智能体。

所以这个选择其实不是功能对比。如果你没有生产音频,一个以回放为主的产品无可回放。如果你有生产音频,却只拿自己编出来的人设去评测,那不过是在给自己的想象力打分。多数团队最终两样都需要,而几乎每个团队第一次都买错——因为他们是照着 demo 挑,而不是照着自己的语料挑。

Coval 的定位是有意思的第三种答案。它的创始人此前在 Waymo 负责评测基础设施,而它从自动驾驶测试里带过来的方法论,重点并不是"多仿真一点",而是"钉住一组场景,每次改动都重跑一遍"——价值在于套件是固定的、比较是纵向的,这与"真实度"是完全不同的主张。这一点干净地落在评测驱动开发上,也正是它的 CI 集成比它的人设质量更受关注的原因。

价格是一个乔装打扮的覆盖度决定

Price transparency across the four platforms Four rows showing what each platform publishes. Cekura publishes an entry plan from thirty dollars a month for seven hundred and fifty credits, with voice testing at roughly five credits per minute, which works out to about twenty cents for a one-minute simulated call. Coval publishes three tiers at one hundred dollars, five hundred dollars, and enterprise from four thousand five hundred dollars a month. Hamming prices on volume through a sales conversation with no self-serve checkout. Bluejay publishes no pricing at all. A note records that only a computable per-call figure lets a team plan a large test suite in advance. What each platform publishes Not a scale — the tiers span two orders of magnitude and two of the four decline to say. Cekura from $30 / month for 750 credits · ~5 credits per voice minute ≈ $0.20 for a one-minute simulated call COMPUTABLE Coval $100 Starter · $500 Growth · Enterprise from $4,500 / month tiered, so suite size is bounded by the tier you bought PUBLISHED Hamming volume-based, not per seat · no self-serve checkout numbers shared after a demo call SALES-LED Bluejay no pricing published SALES-LED The figure that decides suite size is what the four-hundredth variation of a scenario costs.
两份公开价目表,两通销售电话。四家里只有一家让你在动手前就能给套件算出价钱。

Cekura 的积分模型折算下来,一通一分钟的模拟通话大约两毛美元。Coval 公开三档:入门 100 美元、成长 500 美元、企业版每月 4500 美元起。Hamming 按用量而非席位计价,数字只在 demo 之后才给;Bluejay 什么都不公开。

人容易把这读成"便宜与贵"。请改读成"对套件规模的约束",因为它实际咬人的方式正是这个。一个你能提前算出来的每分钟价格,让你可以决定去把那个总是失败的交互跑上四百种变体。而一档你已经付过钱的套餐,或者一份谈好用量的销售合同,会把团队推向一小组精挑细选、大家都同意"有代表性"的通话——而一小组精选样本,恰恰是语音智能体不会在上面失败的那种东西。失败都在长尾里:那个第五百分位的口音、那个在确认语上插一句"不对,等等"的来电者、那次落进队列的转接。

所以带进定价谈判的问题不是月费数字,而是:这个场景的第四百个变体要花多少钱,以及我能不能不给谁发邮件就把这个数算出来。对于一个全部问题就是长尾覆盖的团队来说,一个不公开的企业价是真正的产品局限,而不只是采购上的麻烦。

相应的警告也适用于便宜的那一端。一通两毛让人有理由去跑极其庞大的套件,而一大堆几乎雷同的生成人设,产出的是一个建立在没人验证过的分布之上的、信心十足的通过率。只有当来电者分布本身值得采样时,"量"才值得买——这与我们在评测集维护那一页为文本智能体描述的,是同一个陷阱,只不过在这里它后面还跟着一张电话账单。

打分的问题不是仿真的问题

去问任何一个在跑语音评测的团队哪里疼,你会听到同一句抱怨:评审不稳。同一通电话重跑一遍分数就不一样,一次 prompt 微调让分数动了而行为没动,没人信任那块看板到愿意用它拦住一次发布。

这四家里有两家从相反的两端进攻这个问题,而这个对照是这一组里最实质的技术差异。Hamming 主打的是"音频原生"评测——对音频信号本身打分,而不只是对文字记录——这提高了评审所看之物的保真度,也是唯一能看见那些根本不会出现在文字记录里的失败的路子。Cekura 的 Conditional Actions 是一个基于规则的测试引擎,其定位被明确表述为降低大模型评审的抖动:把检查用确定性的方式表达出来,评审在这件事上就不再处于回路之中。

两者都对,而且是互补而非替代。语音智能体的失败可以干净地一分为二。内容失败——引错了政策、编出了并不存在的库存、没抓住意图——是语义性的,活在文字记录里,也确实需要评审;请把它当作任何一套大模型评审来处理,配一份经过校准的评分标准和一份带标注的样本。交互失败——智能体压着来电者说话、断句把人截在半个词上、每次回复前有两秒死寂、DTMF 没被识别、单向音频——则是时序与信号属性。它们可以被精确测量,它们才是让来电者挂断的那些,而把它们塞给一个语言模型去判断既是范畴错误,也恰好是你整套测试里最抖的那一部分。

不管你买哪家,第一天就沿这条线把套件劈开。交互属性上跑确定性断言,只在内容上用评审,且永远不要一个混合分——因为混合分正是让插话打断上的一次回归看起来像噪声的那样东西。这个劈分也让测试台变得可迁移——它才是这笔投资里耐久的那部分,换厂商也带得走。

这就带出了那个被吆喝得最响、却最不重要的数字。Hamming 宣称 1000+ 并发模拟,Cekura 宣称 2000+。两者都远远超过了你自己的智能体、你的电话服务商限速或你的模型配额成为约束的那个点。从来没有哪一次发布,是被测试台的并发用尽卡住的。

什么情况选哪个

What differs, what is advertised, and how to choose Three columns. What actually differs between the four platforms: the origin of the test caller, whether prices are published, whether audio or only transcripts are scored, and how the judge is constrained. What is advertised but rarely decides anything: headline concurrency numbers, dashboard design, integration counts, and vendor comparison pages. How to choose: match the platform to where your failure corpus already lives, insist on a per-unit price you can compute yourself, split deterministic assertions from judged content before signing, and confirm you can export the suite. What actually differs where the caller comes from published price, or a demo audio scored, or transcript only how the judge is constrained EVALUATE THESE FOUR the rest is a preference What the demo is about 1,000+ vs 2,000+ concurrency dashboard design integration counts their page about a rival NONE OF IT BINDS your telephony caps first How to choose follow your failure corpus demand a computable unit price split assertions from judging confirm you can export the suite TWENTY CALLS, TWO WEEKS the suite is the asset
左栏是该评估的东西。中栏是 demo 会讲的东西。
处境倾向理由
还未上线,没有生产通话Coval 或 Bluejay生成人设是你唯一拥有的东西;一套钉在 CI 里的场景集,比你此刻还得不到的真实度更值钱。
已上线,有可回放的录音Hamming你自己失败的通话是比任何生成物都更好的测试集,而音频原生打分能看见文字记录丢掉的东西。
预算有限但要长尾覆盖Cekura公开的每分钟价格,是这四家里唯一让你据以规划一套大型套件的。
老式电话系统、IVR 树、DTMFHammingDTMF 与 IVR 仿真是一项具体能力,而那里的失败完全不是文本性的。
要用回归闸门拦住发布CovalCI 优先是它的产品决策而不是一项集成;纵向比较本身就是全部要点。

不管最后落在哪个名字上,有两件事都要做。用同样的二十通电话跑一次为期两周的并行试用——一次针对固定集合的对跑,关于评审一致性所告诉你的,比任何功能矩阵都多——并且确认你能导出什么。一套你带不走的测试集,会把一个工具选择变成一个锁定选择,而你真正在建的资产是那套测试集,不是那家厂商。

常见问题

我非得买这类工具吗,用现有的评测框架不行吗?

文本评测框架能给文字记录打分,如果内容准确性是你唯一关心的事,那也许就够了。它做不到的是:真的把电话打出去、处理插话打断与断句、模拟 DTMF,或者测量那些导致挂断的时序属性。如果你的智能体是在一条电话线上说话,电话那半边就是你原本得自己造的那部分。

回放生产通话是不是总比仿真好?

它是对现实更好的采样,却是更差的变更测量仪。回放告诉你的是当前智能体如何处理那些已经发生过的通话;它覆盖不了你还没上线的流程,而且它背负着生成通话所没有的录音同意与个人信息义务。多数成熟的做法是:用回放拿真实度,用一套钉住的生成套件拿回归。

并发数到底有多重要?

非常不重要。宣传里的 1000 和 2000 并发模拟,远远超出了你的电话服务商、你的模型配额或你自己的智能体成为瓶颈的那个点。决定套件有没有用的是评审质量和来电者真实度;并发决定的只是一套没用的套件多快能跑完。

为什么定价这么难比?

只有 Coval 和 Cekura 公开费率,Hamming 与 Bluejay 是销售驱动。Cekura 的积分模型是唯一能干净地折算成"每通多少钱"的——一通一分钟的模拟通话约两毛美元——这也是它成为四家中最容易据以规划大型套件的那一家的原因。

厂商的对比页可信吗?

拿它们看结构,别拿它们看结论。这几家公司都各自发布着针对彼此的正面对比页,所以能力清单有用,而结论是营销。自己跑一次二十通电话的对跑;它的代价是两周,而它能了结任何对比页都了结不了的那个问题。

延伸阅读

本站内容:

项目来源: