日期:2026-07-18
本文为工程实践复盘,客户信息已脱敏;所述数据均为示意值。
我们当时服务的是一家全国性服务企业的客服热线系统。它的痛点非常典型:日均来电约 30 万通,全部压在几百个人工坐席上,人力成本居高不下;夜间和节假日坐席缩编,用户基本等不到人工;更早前上线的传统 IVR(语音菜单)体验很差,客户要在层层按键里绕,想转人工往往要听完一长串播报,平均要按 4-5 次才接进人工,投诉频发。
客户的核心诉求是用语音大模型把热线"自助化"——用户开口说需求,系统自动识别意图、办业务、建工单,只有在必要环节才转人工。这个项目里我们面对的不只是"接住一句话",而是端到端把 ASR、语义理解、业务系统、语音合成串成一条低延迟、可降级的实时链路,并且要在嘈杂话务环境和各地口音下稳定可用。
整体架构是"语音识别 + 大模型语义理解 + 语音合成"的热线助手,跑在客户私有化部署的推理底座上。实时语音流先做流式 ASR 转写为文本,再由我们采用的推理底座上的语义模型做意图识别与槽位抽取,命中自助能力的直接调业务接口(查账单、报故障、改套餐),生成结果用 TTS 回播给用户。
链路上层由我们采用的 AI 网关统一做路由与编排:意图置信度高的走自助闭环,置信度低或涉及敏感/复杂业务(如退款、投诉)的请求,按策略直接转人工坐席,并把已识别的意图和上下文一并推送给坐席,减少重复询问。网关还负责限流熔断与降级——下游模型超时或异常时自动切换到简化流程或纯 IVR 兜底,保证热线永远"接得通"。
第一个挑战是嘈杂环境下的 ASR 准确率。呼叫中心现场有背景杂音、多方说话、电话带宽限制,通用 ASR 字错率明显偏高。我们的做法是双管齐下:在音频前端加 WebRTC 降噪和 VAD 语音活动检测,先把静音段和噪声段切掉;ASR 侧用电话信道微调过的声学模型,并开启流式解码降低首字延迟。关键是在网关层对低置信度转写结果做标记,触发语义模型的"澄清反问"而不是硬猜。
第二个挑战是方言与口音适配。客户用户覆盖南北多省,粤语、川渝、闽南口音普遍。我们没有为每个方言单独训一个大模型,而是把方言适配放在 ASR 层:加载多方言 acoustic model,并在识别后接一个口音归一化后处理,把口语化、方言词映射回标准领域词表。语义模型侧则扩充了带口音标注的少量训练样本做鲁棒性微调,避免"听对但理解错"。
第三个挑战是低延迟语音交互。端到端从用户说完到 TTS 出声,用户能容忍的空窗大概在 1 秒左右,超过就会觉得"卡"。我们采用流式处理:ASR 边转写边把片段推给语义模型做增量理解,命中高频意图(如"查余额")可不等待整句结束就并行预取业务数据。全链路 p99 延迟通过网关埋点持续监控:
案例片段(已脱敏): 语音意图路由与降级片段(网关路由规则节选)
yaml intent_router: asr_confidence_gate: 0.60 # 转写置信度低于此值走澄清 auto_self_service: # 高置信且低风险意图,自助闭环 - balance_query - fault_report - package_change direct_to_human: # 低置信或敏感意图,早转人工 - refund - complaint - confidence_below: 0.45 fallback: # 模型超时/异常降级 strategy: ivr_or_human timeout_ms: 800 latency_slo: e2e_p99_ms: 1100
第四个挑战是意图识别与转人工策略。语音助手最忌讳"硬撑"——该转人工却强行自助,反而拉长通话、惹恼用户。我们的原则是"意图兜底早转人工":语义模型对意图给出置信度,低于阈值立刻转人工并带上下文;对退款、投诉等敏感意图无条件转人工;当自助流程连续两轮没听懂用户,也立即升级人工,绝不与用户空耗。转人工时通过网关把已识别意图、账号、历史工单推给坐席,坐席一接起就掌握背景。
热线助手上线约一个季度后,关键指标改善明显(均为脱敏示意值):
| 指标 | 上线前(传统 IVR) | 上线后(语音助手) |
|---|---|---|
| 语音识别字错率(CER) | 约 14% | 降至约 6% |
| 自助解决率 | 约 22% | 提升至约 58% |
| 平均通话时长 | 基线 100% | 下降约 35% |
| 转人工率 | — | 约 42% |
字错率降了一半多,自助解决率从两成提升到近六成,意味着超过一半的来电不再占用人工坐席;平均通话时长下降约 35%,既省成本也改善用户体验。约 42% 的来电最终转人工,这部分多为复杂或敏感业务——我们把人工资源集中到真正需要人的场景,整体坐席吞吐明显提升。
第一,ASR 是整条链路的天花板。我们当时反复验证过:语义模型再强,前端转写错了后面全错。语音项目要把至少三分之一的精力投在 ASR 降噪、方言适配和置信度校准上,而不是只盯着大模型。
第二,意图兜底要"早转人工"。语音助手的价值是分流简单业务,不是取代人工。宁可早一点把复杂、敏感、听不清的请求转给坐席,也别让用户和机器互相折磨。置信度门限要设得偏保守。
第三,降级链路必须先于主链路设计。语音是实时且高可用的场景,模型超时、GPU 抖动都可能发生。我们在网关层预设了 IVR/人工降级与超时熔断,保证"宁可功能打折,也不能接不通"。
第四,上下文要跟着转人工一起走。转人工时把已识别意图和用户信息推给坐席,能省掉大量重复询问,这是提升整体体验、降低通话时长最划算的一笔投入。