实战手册 / 语音与实时智能体
语音与实时智能体
实时语音智能体——语音栈、轮替、打断、延迟预算、语音特有的工具与状态。
- 实时智能体架构级联(STT→LLM→TTS)vs 原生语音到语音、有状态的音频传输,以及一切所系的那个决策:智能体循环住在哪里。
- 延迟预算把亚秒轮次逐行记账:毫秒去了哪里、为何端点检测是最大一块,以及被感知 vs 实际的延迟。
- 轮次与打断VAD vs 端点检测、语义轮次结束检测、强制打断、作为前提的回声消除,以及附和 vs 真正的打断。
- STT、TTS 与语音到语音流式 STT、转写错误税、TTS 首段音频时间、原生音频模型,以及为何 8 kHz 电话改变每一个基准。
- 语音中的工具调用与状态不留空气死寂地调工具:前导语、异步/并行工具运行、变更前靠耳朵确认,以及贯穿可打断通话的槽位状态。
- 语音智能体失败模式幻听、空气死寂、无限道歉循环、延迟死亡螺旋,以及你必须为之设计的升级/移交。
- 外呼语音智能体主动拨打而非接听的智能体——节奏、放弃率、身份披露,以及把炫酷 demo 变成罚单的合规雷区。
- 评估语音智能体文字记录评测量的是唯一那层本来就没坏的东西:用录下来的音频搭黄金集,量实体错误率而不是 WER,并把时序当作一等公民的评分项。
- 电话与 PSTN 接入一半的轮次延迟、全部的音质,以及通话到底接不接得通,都住在一条你无法剖析的运营商链路里:固定的传输税、作为信誉资产的号码、缺失的元数据通道,以及作为代码路径而非提示词的同意机制。
- 多语言与语码转换语音智能体多加一种语言坏掉的是识别而不是生成——而按轮锁定语言这个标准解法,恰恰会被双语来电者的第一句话打破,而受损的正是你正要传给工具的那些人名与号码。
- 语音智能体的来电者核验三秒音频就能克隆一位客户,而如今约每五次生物特征欺诈尝试就有一次是深度伪造,于是声纹只能识别、不再能认证——把证明挪出音频通道、绑定到动作而非这通电话,并留意你自己的外呼智能体正在把那套攻击正常化。
- 把检索塞进语音轮次一个有依据的回答必须在来电者停口后约 800 毫秒开始从扬声器出来,而"检索—改写—重排"链条在模型看到文档之前就花掉了大半——所以检索延迟是一个准确率指标:对着部分转写就开始查、把问题分布的头部预先算好,并删掉那些别人告诉你必不可少的阶段。
- 升级与温转接一个语音智能体可以把每一轮都答对,却仍在交接处丢掉客户,因为人工一句问候仿佛这通电话从未发生——所以衡量交接的是来电者重复了多少,而不是它有没有接通:在来电者开口之前就升级,携带一个在人工第一个字之前送达的上下文包(已验证身份、来电者原话、已采取的动作),永远设计好"没有人工"那条分支,并为重复率而不是转接率给自己传呼。
- 通话后处理与 CRM 回写来电者只听一次对话;而处置码与摘要会被路由、分析师与审计员读上好几年——可你的语音评测在来电者挂断时就停了。处置码是一个披着生成外衣的分类问题,你那套结案码分类体系多半本来就是坏的,而摘要必须去引用而不是去定性——因为 ASR 的错误恰恰集中在姓名与金额上,而那正是一份持久记录错不起的地方。
- 录音、同意与脱敏你的留存规则指着通话录音,而录音如今是最不值一提的那份副本:同样一分钟还以转写稿、模型上下文、工具参数、追踪 span 与 CRM 摘要的形式活着——这五件由智能体造出来的产物,一条策略都没继承到。让缓冲区挂在同意事件而不是呼叫建立上,把卡片数据完全挡在智能体这条腿之外(因为模型没法把视线挪开),并在写入时于每一个落地点前面跑同一个带版本的脱敏器。
- 替换一套 IVR你手上那两件起步的东西都是陷阱:菜单树记录的是按键音能表达什么、而不是来电者想要什么;而接住率——传统 IVR 常被引作 5–10%,语音智能体 60–90%——把放弃通话的人算成了成功。用转人工的通话记录搭出意图清单,把智能体摆在你已经信得过的那套 IVR 前面、一次迁一个意图好让回滚只是一次配置切换,量 72 小时内无回访的解决、并把智能体环节内的放弃率当作一票否决,数字输入则留给 DTMF。
- 无障碍语音智能体你的智能体没有一个失败率,它对每一种嗓音各有一个;而失败得最惨的那些人群——言语障碍或语速缓慢者、口音很重的人、年长的来电者、任何走中继服务打进来的人——替代选择最少,于是他们的失败以挂断的形式抵达,永远进不了你的指标。基于静音的端点检测不只是对他们视而不见,它就是那台机器:按语速而不是按任何标签分层,第一次重新提示之后就把阈值永久抬高,让 DTMF 与人工通道在每一轮都活着,并用「最差人群比中位人群的成功率」给发布设闸。
- 把字母数字串念给智能体听你的转写很出色而订单查询照样失败,因为预订号背后没有语言模型,而完全匹配是每字符准确率的长度次方——每字符 97%,十个字符就是 73.7%。厂商的拼读模式与关键词偏置只能买到几个百分点;真正改变形状的,是拿来电号码本就给你的那个小候选集去解析它、确实必须采集时按分组逐组复述、按后果而不是按置信度设确认门槛,以及把结论一路带到上游的标识符格式上。
- 在通话里披露这是个智能体你依法必须说出的那一句,恰恰最可能被你自己的打断功能掐掉,而日志会记成已播放。三种形状不同的义务——欧盟《AI 法案》第 50 条自 2026 年 8 月 2 日起要求开场即告知、犹他州要求经询问即告知、犹他州对高风险工作另要求醒目告知——需要三条代码路径:一句不可打断的短开场白、只在播到最后一帧时才记为完成;一条在转接、有人加入与会话恢复时重新求值的 must_disclose 谓词;以及一条常量字符串应答的确定性「你是机器人吗」意图路径,因为写在系统提示词里的一行会把一项成文法义务变成一种模型行为。
- 在语音里收卡付款呼叫中心的每一项降范围手法靠的都是把某个听者从音频通路里挪走,而一个语音智能体不是听者——它就是这通电话,于是一个被念出来的卡号会同时落进六件产物里,其中两件装着 PCI DSS 明说授权后永不得存储的数据。有三种架构能把数据挡在模型之外,而它们的差别只在于让来电者付出多少代价。今天就该改的是工具签名:只要 PAN 能当参数,你的追踪存储就进了范围。