大模型推理 Token 级成本分摊与部门账单落地

日期:2026-09-04

一、项目背景

集团上了私有化大模型底座之后,调用量三个月涨了五倍,但每个月账单只有一笔总数,IT 不知道哪个部门烧得多,财务不知道该找谁收钱,预算申请全靠拍脑袋。有业务部门甚至把大模型当搜索引擎天天跑长文档摘要,成本悄无声息地堆上去。我们进场时,上个月的算力账单已经突破预期两倍,却没人说得清钱花哪了,财务拿着总数来找 IT 要说法,IT 也只能摊手,两边都在背这个糊涂账。

二、落地场景

我们在网关层给每次模型调用打上部门、应用、用户三维标签,调用完成后把 token 数、耗时、模型类型落进计量表。月底聚合出每个部门的消费明细,自动生成内部账单推给部门负责人。部门能看到自己名下哪个应用最费 token、是哪类请求拉高了成本,从而主动优化。财务拿到的是一份能分摊到部门的清晰账目,不再是糊涂账,预算申报也有了真实依据。对于超预算的部门,系统会在账单里高亮异常应用,方便负责人一眼定位到是哪个脚本在偷偷烧钱。

三、关键技术挑战与解决思路

计量要精准且零侵入。我们在网关的计量层做统一埋点,所有经网关的调用都自动带标签,业务代码不用改。token 统计用模型返回的 usage 字段,避免自己估算误差。难点在归属:一个请求可能来自 A 部门的应用但代表 B 部门用户,我们规定以应用归属部门为主、用户部门为辅做分摊,规则可配。为防成本失控,我们加了预算阈值告警,部门月度额度用到 80% 自动提醒负责人,用到 100% 则暂停非关键调用并上报。计量数据本身也做了防篡改,账单生成后只读存储,谁改过一查便知,财务才敢拿去对账。

四、效果数据

落地约四个月,集团大模型月度总调用量约两千万次,其中可归因到具体部门的占比从原先不到两成提升到 95% 以上。某业务部门看到账单后发现一个调试脚本在循环调用摘要接口,月耗占其总额四成,关停后该部门成本当月降了三成。整体来看,各部门在成本可见后主动优化的请求占比约两成,月度总额增速明显放缓。账单生成从原来的人工三天缩短到月初自动一小时出齐,财务终于不用追着 IT 要明细,两部门的关系都缓和了不少。

五、可复用经验总结

成本治理最先要解决的问题是看得见,看不见就别谈管控。我们最初想直接上限额封顶,被业务强烈反对,后来改成先出账单、让大家看见自己花多少,优化反而自发发生了。标签体系宁早建勿晚建,等调用散了再补追溯基本补不全,这点我们后来接的新业务都要求上线即打标。预算告警比硬封顶更柔和也更有效,给业务留了腾挪空间。计量数据本身也是优化依据,哪类 prompt 费 token,一目了然,比任何汇报都直观,这比开会喊降本口号管用得多,也更容易拿到业务配合。

结语

成本治理这块我们踩过的坑,就是太早上封顶。刚开始想直接给每个部门设硬限额,结果被业务强烈反对,说我们不懂他们的实际节奏,闹得挺不愉快。后来改成先出账单、让大家看见自己花多少,优化的动作反而从被动变主动,业务自己就把浪费砍了。这件事让我后来觉得,治理类项目最忌讳一上来就卡脖子,先透明再约束,顺序错了就推不动。标签体系如果早建,后面能省掉大量补追溯的活,这是另一个我们交过的学费。预算告警上线后,超支基本都在月度内被业务自己兜住了,财务也终于从一笔糊涂账里跳出来,能拿着分摊明细去谈下一年预算,说到底看得见才是管得住的前提。

我们现在也把计量数据反哺给推理侧的 prompt 优化,哪类问法最费 token、哪类可以走缓存一目了然,降本从一句口号变成了能落地的具体动作。财务那边也终于从一笔糊涂账里跳出来,能拿着分摊明细去跟各部门谈下一年预算,话语权都变了,治理类项目最忌讳一上来就卡脖子,先透明再约束,这个顺序我们是用教训换来的。

财务也终于敢拿着分摊明细去跟各部门拍板下一年预算,话语权都变了,降本从一句口号变成了能落地的具体动作,这件事比任何汇报都更有说服力,我们也因此少挨了好几次预算会上的质疑。

案例片段(已脱敏): 网关计量日志样例: 2026-08-12 14:22:03 | app=智能客服 | dept=客户体验部 | user=u_8821 | model=qwen-72b | prompt_tokens=1820 | completion_tokens=340 | cost=0.021元 月底聚合显示该应用当月消耗占客户体验部总额 41%,进一步下钻发现其中 60% 来自会话摘要场景,据此推动该场景接入结果缓存,次月该场景 token 消耗下降约 35%。同期另一部门因调试脚本未关,单日异常消耗被阈值告警拦下,避免月底账单再爆一次,负责人收到告警后当天就关停了脚本,没有演变成预算超支事故。