实战手册 / 语音与实时智能体
语音与实时智能体
实时语音智能体——语音栈、轮替、打断、延迟预算、语音特有的工具与状态。
- 实时智能体架构级联(STT→LLM→TTS)vs 原生语音到语音、有状态的音频传输,以及一切所系的那个决策:智能体循环住在哪里。
- 延迟预算把亚秒轮次逐行记账:毫秒去了哪里、为何端点检测是最大一块,以及被感知 vs 实际的延迟。
- 轮次与打断VAD vs 端点检测、语义轮次结束检测、强制打断、作为前提的回声消除,以及附和 vs 真正的打断。
- STT、TTS 与语音到语音流式 STT、转写错误税、TTS 首段音频时间、原生音频模型,以及为何 8 kHz 电话改变每一个基准。
- 语音中的工具调用与状态不留空气死寂地调工具:前导语、异步/并行工具运行、变更前靠耳朵确认,以及贯穿可打断通话的槽位状态。
- 语音智能体失败模式幻听、空气死寂、无限道歉循环、延迟死亡螺旋,以及你必须为之设计的升级/移交。
- 外呼语音智能体主动拨打而非接听的智能体——节奏、放弃率、身份披露,以及把炫酷 demo 变成罚单的合规雷区。
- 评估语音智能体文字记录评测量的是唯一那层本来就没坏的东西:用录下来的音频搭黄金集,量实体错误率而不是 WER,并把时序当作一等公民的评分项。
- 电话与 PSTN 接入一半的轮次延迟、全部的音质,以及通话到底接不接得通,都住在一条你无法剖析的运营商链路里:固定的传输税、作为信誉资产的号码、缺失的元数据通道,以及作为代码路径而非提示词的同意机制。
- 多语言与语码转换语音智能体多加一种语言坏掉的是识别而不是生成——而按轮锁定语言这个标准解法,恰恰会被双语来电者的第一句话打破,而受损的正是你正要传给工具的那些人名与号码。
- 语音智能体的来电者核验三秒音频就能克隆一位客户,而如今约每五次生物特征欺诈尝试就有一次是深度伪造,于是声纹只能识别、不再能认证——把证明挪出音频通道、绑定到动作而非这通电话,并留意你自己的外呼智能体正在把那套攻击正常化。
- 把检索塞进语音轮次一个有依据的回答必须在来电者停口后约 800 毫秒开始从扬声器出来,而"检索—改写—重排"链条在模型看到文档之前就花掉了大半——所以检索延迟是一个准确率指标:对着部分转写就开始查、把问题分布的头部预先算好,并删掉那些别人告诉你必不可少的阶段。