日期:2026-09-07
某客服中心每天几万通对话,覆盖售后、账单、物流各类问题。客户情绪恶化往往藏在长对话里:前面还好好的,中间某个回复踩了雷,情绪一路向下,等坐席注意到时已经骂开了。更糟的是,少数极端案例会升级到监管投诉或晒到社交媒体,处置晚一步就成舆情。
我们进场盘点时,这类升级案例几乎都是事后才发现。坐席一人盯好几通对话,忙起来顾不上细看语气,等投诉工单进来,黄金处置时间早过了。管理层最头疼的不是量大,是看不见风险在哪儿冒头,全靠运气和个别敏感坐席。
我们做的第一件事是实时情绪识别,对话进行中就给每通打情绪分,恶化趋势实时标红。实时情绪识别是第一段,结合语义和语气信号。风险话术检测是第二段,识别投诉、曝光、找媒体这类高风险表达,命中即预警。客诉升级预警放第三段,情绪分跌破线或命中风险话术,自动推给主管并建议转接,不等坐席自己发现。复盘归因兜底,每次升级都落因,反哺识别模型。
案例片段(已脱敏): 对话情绪识别与升级预警配置片段(示意):
emotion: score_per_turn: true trend: worsen_alert risk_phrase: match: [投诉, 曝光, 找媒体] escalate: on_score_below: 0.3 or_risk_hit: true to: supervisor上线后情绪识别准确率约 92%,升级预警平均提前约 8 分钟,重大投诉拦截率约 85%,坐席对高确信预警的响应时效约 2 分钟。
第一个坑是误报。早期模型一识别到负面词就弹客户要投诉了,结果大量虚惊,坐席一周就被烦死,预警直接无视。我们做法是置信度分层,只有高确信才推主管,低分只做静默标记,且加复核,让主管确认过的案例反哺模型。这一步比堆准确率重要,因为预警失去信任就废了。
第二个难点是长对话的恶化趋势。单句看都正常,连起来才显恶化,模型得看上下文不是单句。我们让情绪打分带趋势项,连续下行才告警,偶发一句难听不算,避免被个别气话误触发。这里有个权衡,趋势窗口多长,太短抓不到、太长漏报,按业务调到能覆盖一次完整沟通的长度。
第三个点是预警后的处置闭环。光预警不接处置,主管看到了也手忙脚乱。我们把预警和转接、工单打通,主管一键接手,处置动作自动记下来,闭环才真闭环,不然预警只是多一个红点。
情绪识别准确率约 92%,升级预警平均提前约 8 分钟,重大投诉拦截率约 85%,坐席对高确信预警响应约 2 分钟。最明显的是极端案例从事后曝光变成事中拦截,管理层第一次能对风险有主动权。我们复盘时发现,误报压下去后,主管真在看预警了,闭环才转起来。(数据均为脱敏示意值)
运营侧把预警数据接进了坐席培训。哪类话术容易引爆情绪、哪类回应能降温,整理成案例库给新人学,培训从讲理论变成看真实对话。模型也跟着复盘在迭代,每次漏报和误报都成为新样本。我们还按预警分布做了时段调度,高风险时段多排敏感坐席,资源用在刀刃上。
情绪识别的难点不在模型,在误报,天天弹客户要投诉了结果都是虚惊,坐席很快就不信了,加置信度分层和复核,只把高确信的推给主管,预警才有人真看。趋势比单句重要,连续下行才告警,别被个别气话误触发。预警必须接处置闭环,只亮红点不接动作等于零。我后来觉得,这类系统的命门是信任,模型准不准是一回事,人愿不愿意信、信了之后有没有动作,才是它能不能活下来的关键。
我们后来把预警数据接进了排班,高风险时段多排敏感坐席,低风险时段让新人练手,资源分配从平均主义变成了看风险。还有一个之前低估的点,是主管接手后的处置话术也开始被沉淀,哪些回应能真正降温、哪些会火上浇油,整理成库反哺坐席,预警只是前半段,后半段怎么接住才是关键。情绪识别系统如果只是亮红灯,那它只是个报警器,真正有价值的是把识别、预警、接住、复盘做成闭环,让每一次险情都变成系统变聪明的养料。我们也踩过趋势窗口设太短的坑,有阵子把窗口调得很灵敏,结果用户随口一句气话就触发预警,主管被骚扰后开始忽略,信任一度崩了,调回合适窗口才恢复。往后看,这类系统的核心指标不是识别准确率多高,而是该预警的预警了、不该预警的没烦人这个平衡,平衡守住了,它才活得久,准确率只是其中一个维度。
我们也把情绪数据脱敏后用于产品改进,哪些环节最容易惹怒用户,反馈给对应团队去改,不只是救火更往前防。客服系统最好的状态,是让自己越来越闲,因为问题在前面就被产品设计消化了,这是我们追求的方向。我们也开始用这些信号反哺产品迭代优先级。