日期:2026-09-25
某 AI 网关所有请求一股脑打最贵的大模型,不管任务是写个摘要还是做复杂推理,统统走顶级实例。月底账单出来财务找上门,发现大量简单分类任务也在烧高成本算力,钱花得莫名其妙。更难受的是成本归因不清,哪个部门、哪个应用花了多少,谁也说不准,预算超支了才发现。我们进场时,这个网关的成本结构是一笔糊涂账,贵模型被当成了默认选项。
当时团队的逻辑是能力优先,怕小模型答不好就全上大的。结论很清楚,路由不能只看能力不看价,简单活交给小模型,账单和体验能同时好,而且成本得能拆到部门才管得住。这个项目让我明白,成本失控往往不是单笔贵,是大量本该便宜的调用被默认推到了贵的实例。
新方案给网关加了成本画像路由,请求进来先按复杂度分档,简单分类、短摘要这类走小模型实例,复杂推理、长文生成才上大模型。每个应用和部门配了预算配额,配额内正常走,临近上限网关主动告警,超了按策略降级或拦截,不再无脑放行。
成本看板按部门、应用、模型多维拆解,财务和负责人自己就能看到钱花在哪,月底对账不用再找研发掰扯。路由策略可配置,哪类任务走哪档模型,运营在管控台改一下就生效,不用动代码。上线后第一个月,财务第一次在月中就看到了成本趋势,而不是月底被账单吓一跳,预算管理的节奏彻底变了。
复杂度分档最怕分错,把难任务判成简单丢给小模型,答不好反而坏事。我们用一小批标注样本训了个轻量分类器,按输入长度和任务类型粗分,分档错了有兜底,大模型兜一层,不会直接答崩。成本路由和体验要平衡,我们设了可接受的质量红线,低于红线的小模型请求才放行,保证省钱不省到体验上。
配额预算管控难在实时,预算是月度的,但请求是每秒的,我们做滑动窗口的额度计算,临近上限提前告警而不是月底爆雷。成本归因要准,每笔调用的费用必须能拆到部门和应用,Key 绑人和应用是前提,否则看板再好看也算不清账。
路由与配额的关键配置如下,质量红线是省钱不省体验的底线:
cost_routing:
classify: lightweight(task_type + input_len)
tiers:
simple -> small_model
complex -> large_model
quality_floor: on_violation_fallback_to_large # 分档错有大模型兜底
quota:
budget_per: [dept, app]
window: sliding_monthly
on_near_limit: alert
on_over_limit: degrade_or_block综合调用成本下降约四成,简单任务分流到小模型后,贵实例的调用量下来了,账单第一次变得可解释。低成本模型分流比做到六成左右,也就是六成的请求其实不需要大模型,之前全在浪费。预算超支告警数每月稳定触发,负责人提前收到提醒,再没出现过月底爆雷式的超支。
成本归因清晰度从糊涂账变成看板可查,财务第一次能按部门拉出明细,对账时间从几天压到半小时。我们对比过切换前后同业务量的账单,降幅比预期还大,因为分流比我们最初估的更高。跑满一个季度后,小模型实例的利用率被盘活,原先闲置的便宜算力终于派上用场。
我们给每个部门设了成本红黄绿三档看板,绿色随便用、黄色提醒、红色拦截,负责人自己就会在黄色阶段优化调用方式。运营反馈最有用的一招是把小模型能力边界写清楚,大家才知道什么任务真需要大模型,什么任务小模型就够。我们还把成本数据回灌给路由分类器做训练,分档越来越准,误分流的少了一大半。我们复盘时算过,光是几个滥用部门收敛下来的预算,就覆盖了这套网关改造的全部投入,更别说体验还变好了。
我们还做了一次反向教育,把每个部门的成本明细发回去,几个一直喊预算不够的部门发现自己大半花在试错调用上,主动优化了提示词和重试逻辑,整体成本又往下掉了一截。透明本身就是一种管控,账算清楚大家才会自己收敛。我们当时把所有请求默认走大模型,是财务拿着账单来质问才掉头的,现在回头看那笔糊涂账确实荒唐。
路由不能只看能力不看价,简单活交给小模型,账单和体验能同时好,我们一开始也迷信大模型的稳,被账单教做人。分档错了要有兜底,大模型兜一层,别让省钱的动作变成答崩的事故。预算要实时算滑动窗口,月底爆雷式的超支最伤信任,提前告警才是管控。成本归因的前提是 Key 绑人绑应用,否则看板再漂亮也算不清账。我们当时把所有请求默认走大模型,是财务拿着账单来质问才掉头的。下一步想把成本信号反向驱动底座扩缩容,贵实例忙时自动加节点而不是硬扛。
案例片段(已脱敏): 成本路由:请求按复杂度轻量分类分档,简单任务走小模型实例,复杂任务上大模型,分档错有大模型兜底(质量红线约束)。配额按部门/应用配月度预算,滑动窗口实时额度计算,临近上限告警、超限降级拦截。某周期统计:综合调用成本下降约 40%;低成本模型分流比 60%;预算超支告警稳定触发,无月底爆雷;财务对账由数天降至 0.5 小时;小模型实例利用率被盘活。