大模型驱动的售后退换货智能审核落地

日期:2026-07-30

一、项目背景

这个项目的客户是一家日均订单数万单的电商企业,售后团队三十多人,退换货申请的人工审核是他们最大的瓶颈。我们进场时看到的场景:审核员每天人均处理两百多单,每单要读申请描述、翻订单信息、逐张看凭证照片,平均处理时长七八分钟;大促后申请量翻三倍,积压最长到过五天,社交平台上"退款拖延"的吐槽直接影响店铺评分。质量问题同样突出——审核标准全凭个人经验,同样的"外包装破损"申请,张三放行李四拒绝;而恶意退货(穿过的衣服剪标退回、用旧件调包新件、职业退货人批量薅运费险)靠肉眼几乎无法识别,财务估算年损失七位数。

客户的目标是:低风险申请自动放行提速,高风险申请精准拦截,标准统一可追溯。我们基于所采用的 AI 私有化部署底座(模型服务化层与 RAG 知识库层)加 XpShop 订单体系的售后模块,搭建了一套智能审核流水线,项目周期约三个月。

二、落地场景

现在一笔退换货申请的流转是这样的:申请提交后,系统先做结构化汇聚——订单信息(商品、金额、物流轨迹)、用户画像(历史退货率、账号信誉)、申请内容(退货原因、文字描述、凭证图片)。大模型读取全部材料输出一份审核意见:原因归类、描述与凭证的一致性判断、风险信号列表、建议动作(放行/拒绝/人工复核)与置信度。凭证图片走多模态理解:判断照片里的商品是否与订单商品一致、破损位置与描述是否吻合、图片是否疑似网图或重复使用(与历史凭证库做相似度比对)。

审核策略引擎在模型意见之上做分级决策:金额低、用户信誉好、模型置信高的申请直接自动放行,退款秒到;风险信号命中(凭证图重复、描述矛盾、高频退货账号)的申请标记风险等级进人工队列,并把模型标注的疑点高亮给审核员——审核员不再从零看起,而是核实疑点;中间地带按金额分层,小额从宽自动过、大额人工把关。所有决策(包括自动放行)全量留痕,模型意见、策略命中、最终动作可追溯,支持事后抽检。

恶意识别是独立的旁路:不依赖单笔申请,而是按账号、收货地址、设备指纹聚合行为模式——同一地址高频退货、退回件与发出件重量差异异常、运费险理赔频次异常等模式规则加模型研判,命中的账号进黑灰名单体系,后续申请自动升级人工审核。

三、关键技术挑战与解决思路

第一个挑战是自动放行的边界划定。业务侧最初希望自动化率越高越好,我们坚持先跑三周"影子模式"——模型全量出意见但不执行,与人工决策比对。数据显示模型与资深审核员的一致率约 93%,但不一致的部分里有一类高危:模型对"新型话术"的申请过于宽容(比如伪造的质检报告截图)。据此我们把自动放行的边界收紧为三个条件同时满足:金额低于阈值、账号历史退货率正常、凭证无任何相似度告警——三条有一条不满足就进人工。宁可自动化率低一点,也不把放行权交给模型独走。

第二个挑战是凭证图片的重复与伪造识别。职业退货人会用同一组破损照片在不同订单反复申请。我们把历史凭证图全部向量化入库(用底座的向量数据库层),新凭证入库前先做近邻检索,相似度超阈值即告警;对疑似网图,用以图搜图特征加 EXIF 缺失、分辨率异常等信号综合打分。上线首月这条旁路就抓出一个用同一组照片在 40 多个订单申请退款的团伙账号群。

第三个挑战是误拒的代价管理。拦错一个正常用户的伤害远大于放过一单恶意退货。我们的原则是:模型和规则永远不直接拒绝,拒绝动作只能由人工做出;自动化只单向用于放行。同时给人工复核队列做了优先级排序——用户等待越久、金额越小的越靠前,保证正常用户即使进了人工队列也不会等太久。误拒申诉通道保留,申诉单独立复核并回流为模型的坏例样本。

案例片段(已脱敏):审核分级策略的核心配置——yaml review_policy:  auto_approve:                 # 三条件同时满足才自动放行    amount_max: 200    user_return_rate_max: 0.15    evidence_alerts: none  risk_route:    - { signal: evidence_dup_sim > 0.92, level: HIGH, queue: fraud }    - { signal: desc_evidence_conflict, level: MID,  queue: manual }    - { signal: account_freq > 5/30d,   level: HIGH, queue: fraud }  reject_by: human_only          # 拒绝权只归人工 shadow_mode:  duration_weeks: 3  agree_rate_baseline: 0.93影子期的一条对比记录(已脱敏):申请描述"收到就是碎的",凭证图与 37 天前另一账号的申请图相似度 0.96,人工初审原本准备放行,模型标注疑点后复核确认是同一组照片,两个账号收货地址相同——这条案例后来成了审核员培训教材。

四、效果数据

上线三个月后的数据(脱敏示意值):审核自动化率约 58%(自动放行占全部申请的比例),平均审核时效从 26 小时压缩到 4 小时以内,自动放行的申请退款平均耗时不到 3 分钟;人工审核员人均日处理量提升约 1.8 倍(疑点高亮让单均处理时长减半);恶意退货拦截金额月均六位数,凭证重复识别贡献了其中约一半;误拒率(申诉成立比例)控制在 0.3% 以下,低于人工时代的抽检口径;大促后的申请积压从最长五天变为当天清零,售后相关的平台评分显著回升。

五、可复用经验总结

第一,智能审核必须先跑影子模式,用一致率数据划定自动化边界,而不是拍脑袋定阈值。第二,自动化只单向用于放行,拒绝权永远留给人工——这一条既是风控原则也是用户体验底线。第三,凭证图向量化加近邻检索是识别职业退货人性价比最高的手段,恶意识别要看账号级模式而不是单笔申请。第四,人工队列要按用户等待与金额排序,自动化提速的同时不能让进人工的正常用户变成二等公民。第五,申诉坏例要回流训练,审核模型是靠真实对抗样本长大的。