AI 网关多模型效果评估与自动路由调优落地

日期:2026-08-07

一、项目背景

我们的 AI 网关后面接了好几个模型,有贵的也有便宜的,有快的也有慢的。最早路由是静态配置写死的,某个意图永远走某个模型。问题来了:新模型上线,我们不知道该把它分给哪类请求;老模型悄悄变差,也没人发现,用户还在被分到它。说白了,路由靠经验,效果好坏全凭感觉,没法量化。

这个项目想在网关的路由层加一套效果评估与自动调优。底层还是网关的智能路由分发能力,我们补上采样评估、权重微调和劣化降级这三块,让路由能自己根据效果调整,而不是人肉搬开关。

二、落地场景

做了四块。在线效果采样与评估,对每类请求按一定比率采样,用业务指标(比如答案采纳率、拒答准确率)给模型打分。路由权重自动微调,评估分高的模型权重往上提,分低的往下压,流量自然倾斜。劣化模型自动降权,某模型指标连续低于阈值,自动降权甚至摘流,不等人发现。人工兜底开关,紧急时运营可以手动锁路由,自动化先让位给人。

我们先挑了一个客服问答场景试点,那里接了三个档位的模型,最适合看效果差异。采样比率控制得小,避免评估本身干扰线上。

三、关键技术挑战与解决思路

第一个挑战是效果怎么量化。模型输出是自由的文本,不能直接比对错。我们用了业务侧能拿到的信号:用户是否采纳、是否追问、是否转人工,把这些当隐式评分,再结合少量人工标注校准,凑出一套可比较的分数,比纯看延迟靠谱。

第二个是自动调优别抖。评估数据有波动,不能今天分低明天就切走。我们做滑动窗口统计,连续多个窗口低于阈值才动作,单次波动不触发,避免路由来回横跳把系统搞晕。

第三个是劣化要快还是慢。太慢用户吃臭,太快可能误杀。我们分两级:轻度劣化先降权观察,重度且持续才摘流,摘流前留人工确认口,防止评估信号本身出错把正常模型误伤。

案例片段(已脱敏): 路由权重配置片段(YAML 示意):route_policy:  intent: "售后咨询"  candidates:    - model: m_large   weight: 0.5   score_window: 0.91    - model: m_mid     weight: 0.3   score_window: 0.86    - model: m_small   weight: 0.2   score_window: 0.78  degrade_if_below: 0.75评估日志一例:m_mid 连续五个窗口采纳率从 0.86 滑到 0.73,触发降权,流量由 0.3 调至 0.15;m_large 升至 0.6,两周后该意图整体采纳率由约 0.84 提到约 0.89。

四、效果数据

客服问答场景跑了一个月自动调优,我们看结果。路由准确率,也就是请求分到合适模型的占比,从静态配置的约 72% 提到约 88%。优质响应率,以采纳率为口径,整体从约 0.84 升到约 0.89,主要是流量更多流向了高分模型。劣化发现时效,从原来靠人周报发现变成小时级自动识别,一次 m_mid 劣化当天就被降权。人工干预率很低,一个月里运营只手动锁过一次,还是因为评估信号源临时故障。

有个实话要说,采样评估依赖业务埋点质量,有段时间采纳率埋点漏报,导致评分失真,路由跟着跑偏了两天。后来把埋点监控单独挂出来,评估源不稳就先停自动调优转静态,这比硬撑强。

五、可复用经验总结

多模型路由不能写死,模型效果会变,静态配置迟早分错流量,我们用采纳率当尺子才看清谁行。自动调优必须扛波动,单次评分掉一点就切会抽风,滑动窗口连续劣化才动是底线。劣化分级处理,轻度降权观察、重度才摘流,摘流前留人确认,防误杀比防慢一拍重要。评估源本身要被监控,埋点挂了还硬跑自动调优,比人工还坑,源不稳就退回静态。

这套评估框架现在往其他意图推广,逻辑通用,只是每个意图的评分口径要单独校准。

附:自动化之外的信任建设

自动调优跑了一个月,运营从将信将疑到真敢放手,关键是我们把每次路由调整都留了痕。哪个模型什么时候升降权、为什么,后台一条时间线清清楚楚,出了偏差能立刻定位是评估信号还是策略问题。我们还做了个开关,评估源异常时自动退回上一版静态路由,不硬撑,这点让运营敢开自动。效果评估这块,不同业务评分口径不一样,客服看采纳率,创作类看通过率,我们给每个意图配独立评分配置,没搞一刀切。路由自动化不是把人踢走,是把人从天天搬开关里解放出来,只在异常时拍板,这个定位讲清楚,推动起来顺多了。

效果评估的采样我们控制得很克制,默认只对小比例请求打分,避免评估本身拖慢线上。人工标注那部分我们做成可选,运营每周抽看一批,用来校准自动评分的偏差。路由自动调优上线前,我们做了两周的影子运行,只观察不动作,确认策略不抽风才切自动。这一步值得,因为自动调优一旦动作就是真流量,影子期能挡掉大部分离谱配置。现在运营已经习惯看路由时间线,哪天模型表现异常,他们自己先去翻一眼谁被降权了,从被动接告警变成主动看趋势。