Databricks如何把AI编码支出砍掉70%:四个杠杆和一套网关架构

Databricks如何把AI编码支出砍掉70%:四个杠杆和一套网关架构

看完你会发现,你之前的理解可能要更新了。

AI 编码工具带来的效率提升是实打实的--Databricks 的原话是"order-of-magnitude gains in output",产出提升了一个数量级。但账单也是实打实的:成本指数级增长,如果不管,"eventually overtake revenue"--最终会吃掉营收。

这不是某一家公司的问题。Databricks 联合了 Stripe、Coinbase、Uber、Ramp 一起复盘,发现大家踩的是同一个坑:AI 编码工具用得越爽,成本就越失控。

Databricks 在官方博客上分享了他们的解法:不是限制使用,而是通过四个成本杠杆 + 一套 AI Gateway 架构,在保持开发效率不降的前提下,把 AI 编码支出砍掉了约 70%。这篇博客的含金量很高,不是泛泛而谈的"最佳实践",而是有具体数字、有架构图、有踩坑细节的工程复盘。

本文提纲

  1. 核心认知:追效率前沿,不是智能前沿
  2. 杠杆一:换模型--开源和低成本模型是最大赢家
  3. 杠杆二:动态路由--让便宜模型干它能干的活
  4. 杠杆三:可视化+渐进式摩擦--别用硬预算
  5. 杠杆四:砍 Token 开销--用户输入只占冰山一角
  6. AI Gateway:把四个杠杆串起来的中枢架构
  7. 数据复盘和关键启示

核心认知:追效率前沿,不是智能前沿

Databricks 提出了一个关键概念区分:效率前沿(Efficiency Frontier) vs 智能前沿(Intelligence Frontier)

智能前沿是最强的模型--GPT-5、Claude Opus 5.0 这些旗舰。效率前沿是"在给定智能水平下性价比最高的模型"。Databricks 的判断是:效率前沿的推进速度远快于智能前沿。几乎每周都有新模型发布,在同等智能水平下价格更低。

大部分日常编码任务根本不需要前沿级别的智能。重命名一个变量、补全一段 boilerplate、写个单元测试--这些活用轻量模型就够了。只有架构设计、复杂调试这类任务才真正需要旗舰模型。

这个认知是后续所有优化的前提:如果你还在无脑用最贵的模型,后面的杠杆都无从谈起。

杠杆一:换模型--开源和低成本模型是最大赢家

Databricks 把这一条列为"delivered the largest cost wins of any technique"--所有手段里省钱最多的。

听起来简单,做起来有个大坑:公开 benchmark 不能反映真实编码场景的表现。Databricks 和其他公司都发现,公开评测和实际开发任务之间的相关性很差。解法是建自定义的自动化评测--用自己团队的真实编码任务做 benchmark。

几个具体的决策案例:

  • Databricks 发布了一份 benchmark,显示 GLM 系列开源模型在编码任务上有极高的性价比,随后在内部大规模推广
  • Stripe 发现 Opus 4.7 相比 4.6 质量没有实质提升,但成本更高,直接拒绝上线
  • Databricks 比较 Opus 5.0 和 4.8 后也发现了类似的成本倒退,没有升级

这里有个容易被忽略的点:harness 和模型的耦合问题。旗舰模型越来越倾向于和特定 harness(编码工具)配合设计。直接换模型可能导致体验下降。

两种解法:

  1. 让用户切 harness:切换成本高,容易形成事实锁定
  2. 用 meta-harness:上层统一 UX,底层分发到不同 harness。Databricks 用的是 Omnigent 作为默认 meta-harness,也有公司自建了内部的 meta-harness

杠杆二:动态路由--让便宜模型干它能干的活

这是技术含量最高的一环。Databricks 把路由分成三类:

MERMAID_BLOCK_0

请求级路由

一个有状态的 proxy 拦截在客户端和模型之间,把每个请求路由到"能回答这个问题的最低成本模型"。关键细节:要考虑服务端缓存--大上下文负载下,冷缓存命中的成本非常高。

相关产品:Cursor Router、OpenRouter AutoRouter、Ramp Router、Databricks Unity AI Gateway Smart Routing。

任务级路由

在 meta-harness 层面,按任务复杂度分发。"把组件 X 重命名为 Y"这种简单任务给轻量模型,"探索降低延迟的设计方案"这种复杂任务给旗舰模型。

升级/委派模式

两个方向:

  • Claude Advisor Tool 模式:便宜模型跑主循环,遇到搞不定的再升级给贵模型
  • Cognition Devin Fusion 模式:反过来,贵模型跑主循环,把子任务外包给便宜模型

路由效果

Databricks 的 AI Gateway Smart Router 持续降低平均任务成本 超过 30%,而且质量"roughly matching the most expensive model in the working set"--和最贵模型基本持平。其他受访公司也得到了类似结果。

杠杆三:可视化+渐进式摩擦--别用硬预算

这一条反直觉。第一反应是给团队设预算上限,超了就停。但 Databricks 发现硬预算在所有受访公司里都只是"last resort"--最后手段。

原因有两个:

  1. 切断访问会重创生产力:开发者正在用 AI 工具高效产出,突然断了等于停工
  2. 花钱最多的人往往效率提升最大:那些 AI 编码支出最高的开发者,恰恰是工具用得最好、产出最高的。惩罚他们等于自我设限

Databricks 的解法是渐进式摩擦(Progressive Friction),分四级:

MERMAID_BLOCK_1

  1. 可视化:近乎实时的消费反馈,附降费建议,跨所有工具可见
  2. 消费门槛:自清零的门槛作为预警,过了就需要明确预算审批(走管理链)。Databricks 发现自清零门槛对防止"意外或无意识消费"特别有效
  3. 降档:把开发者切到更便宜的模型,而不是停用
  4. 暂停:只作为极端情况,且明确是临时措施,是对话的起点而不是惩罚

这个设计的精髓在于:不阻止花钱,但让花钱的行为变得可见、有意识。大部分超额消费来自无意识的使用--开发者忘了关 session、重复提交相同 prompt、用旗舰模型做简单任务。可视化就能解决一大部分。

杠杆四:砍 Token 开销--用户输入只占冰山一角

这是最容易被忽略的成本来源。

用户手敲的 prompt 只占喂给 AI 的数据的极小一部分。真正吃 token 的是上下文:对话历史、代码库索引、工具返回结果、system prompt。Databricks 的原话:"Costs are dominated by context the user did not explicitly include."

优化手段:

  • 更频繁的上下文压缩:及时 compaction,别让历史无限膨胀
  • 用不那么啰嗦的 harness:或者调参降低 verbosity
  • 审计热门工具:减少输出冗余
  • 拆分任务:鼓励开发者把大任务拆成小单元,减少单次上下文

Prompt Caching 是重头戏。开源和闭源 LLM 都支持 prompt caching,可以调缓存存储时长。写缓存要花钱,但读缓存能大幅降低单次推理成本。这个 trade-off 取决于工作负载--Databricks 通过手动调优默认缓存设置,大幅提升了缓存命中率。

Token 削减效果

Databricks 通过"相对简单的 harness 和缓存设置调优",实现了 接近 50% 的生成 token 数量和成本削减,而且开发者侧没有观察到质量下降。博客还提到"meaningful additional optimization remains possible"--还有进一步优化空间。

AI Gateway:把四个杠杆串起来的中枢架构

四个杠杆单独用都有效果,但要规模化运作,需要一个统一的中枢。Databricks 把这个角色交给了 AI Gateway

MERMAID_BLOCK_2

AI Gateway 承担四个职责:

  1. 容量管理和代理:统一接入闭源和开源模型,开发者不需要关心后端是哪个模型
  2. 预算追踪和执行:包括渐进式摩擦和模型降档机制
  3. 配置管理:强制模型白名单、压缩设置、本地化配置
  4. 会话日志:记录编码 session trace,用于效率分析和 benchmark 构建

Databricks 把 Unity AI Gateway 和 Omnigent 都开源了,"thousands of companies use these components every day"。

这套架构的核心价值在于:它让成本优化变成了一个工程问题,而不是管理问题。开发者不需要关心自己用的是什么模型、花了多少钱--Gateway 在后台处理路由、缓存、预算。管理者不需要逐个审批--Gateway 自动执行渐进式摩擦策略。

数据复盘和关键启示

把四个杠杆的效果汇总一下:

优化杠杆 效果 实现难度
模型替换(开源/低成本) 最大单项节省 中(需自建 benchmark)
智能路由 任务成本降 >30% 高(需 stateful proxy)
渐进式摩擦 防止无意识消费 低(主要是策略设计)
Token 削减 + 缓存 token 量和成本降 ~50% 低(调参为主)

四个杠杆叠加,Databricks 实现了约 70% 的整体成本削减,开发效率没有下降。

几个关键启示值得所有正在大规模采用 AI 编码工具的团队注意:

第一,别追最新模型。 效率前沿比智能前沿移动得快。Opus 4.7 比 4.6 贵但没更好,Opus 5.0 比 4.8 也是成本倒退。每升一级模型前,先用自己的 benchmark 验证值不值。

第二,硬预算是下策。 花钱最多的开发者往往产出最高,切断他们的工具等于自断臂膀。用可视化和渐进式摩擦替代一刀切。

第三,用户输入不是成本大头。 真正花钱的是上下文。Prompt caching 的调优可能是 ROI 最高的单一优化动作。

第四,这四个杠杆需要统一架构才能规模化。 零散地在各个工具里调参不可持续,需要一个 AI Gateway 做中枢。Databricks 把 Unity AI Gateway 开源了,直接拿来用就行。

Databricks 博客最后一句话说得特别好:"The exponential growth of AI coding costs is not an inevitability, it's a solvable engineering and governance problem."--AI 编码成本的指数级增长不是宿命,是一个可解的工程和治理问题。

参考文档与链接

  • Managing AI Coding Costs at Scale - Databricks 官方博客 - 原文,四个杠杆的完整论述,含 Stripe/Coinbase/Uber/Ramp 的实践数据
  • Unity AI Gateway - Databricks 开源组件 - 文中提到的 AI Gateway 实现,支持模型路由、预算追踪、日志审计
  • Omnigent - Meta-Harness 工具 - Databricks 使用的默认 meta-harness,统一 UX 层支持多模型分发
  • OpenRouter AutoRouter - 请求级路由的第三方实现,自动选择最低成本可用模型
  • Cursor Router - Cursor 内置的路由功能,支持自定义模型分发策略
  • Anthropic Prompt Caching 文档 - Prompt caching 的官方实现,含定价和缓存时长配置
  • Claude Advisor Tool - 便宜模型主循环+贵模型升级的委派模式实现
  • GLM 模型 Benchmark - Databricks - Databricks 发布的 GLM 模型编码性价比评测,推动内部大规模采用

你的团队AI编码账单涨了多少?用的什么优化手段?评论区聊聊。觉得有用点个赞让更多人看到。


作者: itech001
来源: 公众号:AI人工智能时代
网站: https://www.theaiera.cn/
每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。