跳到主内容
精选90meng shao技巧与观点

Databricks 四大杠杆控 AI 编码成本

国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「…

原文
推荐理由

做 AI 编码工具或 Agent 成本优化的同学必看,四大杠杆全是可落地的实操,尤其动态路由和 Token 削减有实测数据,赶紧对照你的链路试试。

国内外大厂在疯狂 tokenmaxxing、token 消耗排名的 AI 大跃进后,后来 token 账单暴涨,又纷纷限定 token 额度,甚至有讽刺的说法「高管发现还是人便宜」、「token 不能欠费,但人能」😄

这些怪相都指向一个问题:AI Agent 能力强了,效率上去了,但一旦规模化推开,成本也上去了,甚至会改过效率的提升!

@databricks 团队基于自身实践,以及与 Stripe、Coinbase、Uber、Ramp 等数字化原生企业基础设施负责人的交流,要解决这个“既要又要”的问题,实现"双重使命": · 广泛、低摩擦地向开发者开放 AI 工具; · 把人均总成本控制在相对固定的区间内。

核心概念:效率前沿 ≠ 智能前沿 通常所说的"前沿模型"指的是智能最高水平的模型——能解数学新题、发现新型安全漏洞的那种。前沿实验室的主攻方向也是推高智能上限。 但规模化部署时,真正重要的是另一条曲线——效率前沿:在给定智能水平上,价格最优的那组模型。

关键洞察在于:日常编程工作绝大多数不需要证明数学定理,只需要"够好"的模型。而效率前沿的推进速度远快于智能前沿——几乎每周都有新模型以更高的"智能/价格比"出现。因此,最大的成本杠杆不是谈判降价,是持续把用量迁移到效率更高的新模型上。

DataBricks 提出的四大成本杠杆

杠杆 1:迁移到开源和低成本模型 收益最大的杠杆。效率前沿(同等智能下价格最优)几乎每周都在推进,但公开基准不可信,必须自建贴近内部场景的评测来验证新模型。反面案例同样重要:Stripe 测出 Opus 4.7 质平价升,拒绝上线。配套条件是 harness 与模型解耦——用元 harness(如 Omnigent)统一入口、底层自由切换,避免工具锁定模型。

杠杆 2:动态请求与任务路由 不让用户选模型,让系统选。三个层次:请求级(代理把每个请求发给"够用的最便宜模型",如 Smart Routing)、任务级(按任务复杂度整体派发,如 Omnigent)、升级/委派(便宜模型主导、难题升级,或贵模型主循环、杂活外包)。Databricks 实测:成本降 30%+,质量持平最贵模型。

杠杆 3:可见性、绊线与渐进式摩擦(而非硬预算) 硬预算几乎无人采用——断供伤害生产力,且高消费用户往往正是最高产的人。主流做法是阶梯式:实时花费可见(跨工具统一展示)→ 可自清除的花费闸门(防意外超支)→ 需审批的闸门 → 降档到便宜模型(不中断工作)→ 极限情况才暂停。

杠杆 4:削减 Token 开销 成本大头不是用户输入,而是代理自动收集的上下文。手段:更频繁压缩上下文、选用/调优"话少"的 harness、审计工具输出冗长度、拆小任务、调优提示缓存命中率。Databricks 实测:token 量降近 50%,质量无损。

收口:AI Gateway 设计模式

上面所有技术背后有共同的基础设施需求——集中管理"模型菜单"、跨工具的统一成本可观测性、上下文膨胀的观测与压缩、会话轨迹的日志记录。这些需求催生了一类新的基础设施软件:AI Gateway,它的职责包括: · 底层模型(专有 + 开源)的容量管理与访问代理; · 预算追踪与执行,包括渐进式摩擦、模型降档等复杂策略; · 终端工具的配置管理(模型白名单、压缩设置等); · 编程会话轨迹日志,用于下游效率分析和基准测试。

Databricks 自身重度依赖 Unity AI Gateway 承载这些能力,并已将其与 Omnigent 以开源或免费形式放出。

Omnigent - Github https://github.com/omnigent-ai/omnigent

Unity AI Gateway - Github https://github.com/databricks/ucode

Managing AI Coding Costs at Scale https://www.databricks.com/blog/managing-ai-coding-costs-scale

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近