路由省三成、token 砍半:Databricks 控费法

article_id: cbbc51409127fc34eb701bb4c0b86bb7

title_zh: 路由省三成、token 砍半:Databricks 控费法

source: Databricks 官方博客

published_at: 2026-08-08

AI 编程工具给企业带来的效率提升有目共睹,但当它铺开到整个研发团队,账单却常常以指数级膨胀,甚至有可能超过工具本身创造的价值。Databricks 近期发布长文,结合自家与 Stripe、Coinbase、Uber、Ramp 等公司的一线经验,总结出一套把成本压回可控区间、又不牺牲效率的方法论。

比“最聪明”更重要的是“最划算”

文章提出一个核心概念——“效率前沿”(efficiency frontier)。与追求峰值智力的“智能前沿”不同,效率前沿指的是在给定智力水平下价格最优的那一批模型。日常编程大多不需要证明数学定理或破解全新安全漏洞,真正决定总体开销的,是达到普通软件工程质量门槛的模型单价。Databricks 观察到,效率前沿的推进速度远快于智能前沿,几乎每周都有性价比更高的新模型出现。

成本杠杆的第一招,是果断切换到开源与低成本模型。难点在于公开榜单往往不能反映真实编码表现,因此多家公司自建了更接近内部研发场景的自动评测。Databricks 公布的评测显示,GLM 系列模型性价比突出,已向内部开发者推广。反面案例同样有说服力:Stripe 发现 Opus 4.7 相比 4.6 并没有明显的质量提升,却更贵,于是决定不在内部放开 4.7;Databricks 在对比 Opus 5.0 与 4.8 时也观察到了类似的“成本倒退”。

让请求自动选最便宜的模型

第二大杠杆是动态路由。与其让用户手动挑模型,不如用代理在请求层或任务层自动派单。Databricks 自家的 Unity AI Gateway 中的 Smart Router,能把单个任务的平均成本压低超过 30%,同时质量与最贵模型基本持平。类似思路也出现在 Cursor Router、OpenRouter 的 AutoRouter、Ramp 的 Router 等功能中。在元调度(meta-harness)层面,Omnigent 这类工具把任务按复杂度分派给不同底层模型,既保留模型选择的灵活性,又降低了开发者的切换成本。

用“可见性”替代“硬预算”

第三招是给开发者可见性、预警线和弹性预算。文章指出,简单粗暴地设月度硬上限在每家受访公司都很少作为首选——开发者一旦撞上上限被断供,生产力会瞬间瘫痪;而真正高消耗的用户,往往正是借助 AI 拿到巨大产出的人。更通行的做法是提供实时花费面板、在花费升高时逐步增加摩擦(自助确认提醒、升级到主管审批),以及把用户“降档”到更便宜的模型而非直接停权。

砍掉被浪费的 token

第四招针对被忽视的 token 开销。用户一句简短指令,背后却会被代理拉取大量上下文、调用一堆工具、检索整个代码库——真正由用户显式写出的内容,在喂给模型的数据里只占极小比例。Databricks 通过更频繁地压缩上下文、调低代理的“话痨”程度、精简常用工具的冗余输出、把任务拆小,并对提示词缓存做针对性调优,在不损失质量的前提下让生成 token 数和相关成本下降近 50%。

文中提到的基础设施,Databricks 已以开源或免费软件形式放出:统一管理的 Unity AI Gateway,以及面向开发者的元调度工具 Omnigent。把这套组合拳用起来,企业才有机会同时满足“广泛、低摩擦地开放 AI 工具”与“成本可预测”这两个原本相互拉扯的目标。

来源:Databricks 官方博客《Managing AI Coding Costs at Scale》