一个工程师,一个月,API 调用烧掉 4 万美元。老板脸都绿了。
不是段子。这是 2026 年上半年,企业 AI 账单从“随便用”切换到“紧急刹车”时,反复出现的场景。
6 月 23 日,瑞银证券(UBS)证据实验室分析师 Karl Keirstead 团队抛出一份重磅报告——覆盖约 130 家企业的初步调研,结论简单粗暴:60%的企业已经以某种方式限制 AI 开支。
核心手段是给 Token 使用装上护栏。极端案例触目惊心:
AWS Bedrock 上,单用户单月花掉3.5 万美元。
DevOps 团队周 Token 消耗冲到配额的100%~200%。
一家公司在年内预算大块耗尽后,内部 AI 工具从 5 个硬砍到 2 个。
报告在中文财经圈和 X 平台炸开的速度,比 AI 烧钱还快。Rohan Paul 在 X 上的主帖拿下 912 赞、44.6 万浏览、89 条回复。底下一条中文回复更是把纸面数字变成了血肉案例。
Rohan Paul主帖:瑞银报告核心数据,60%企业限制AI开支,模型路由策略,中国开源模型进入企业成本曲线(分段1)Rohan Paul主帖:瑞银报告核心数据,60%企业限制AI开支,模型路由策略,中国开源模型进入企业成本曲线(分段2)Rohan Paul主帖:瑞银报告核心数据,60%企业限制AI开支,模型路由策略,中国开源模型进入企业成本曲线(分段3)
▲ Rohan Paul 在 X 发布瑞银报告摘要:60%企业踩刹车,单用户$3.5 万/月,模型路由成主流应对,中国开源模型被点名。912 赞、44.6 万浏览。
从“随便用”到“踩刹车”,只用了半年
把时钟拨回 2025 年底到 2026 年初。那时候企业 AI 的口号是“尽可能用”——Uber 内部甚至有 AI 使用量排行榜,谁 Token 烧得多谁是高手。
新一代前沿模型扎堆发布:Anthropic Claude Opus 4.5、OpenAI GPT-5.1、Google Gemini 3 Pro。Agentic能力全面上线——AI 开始自己规划、搜索、写代码、调试、重构,不再只是被动问答的聊天工具。
这个转折的后果,比大多数人预想的来得更快、更猛。
AI 不再是你偶尔调用的聊天机器人。它变成了一个持续跑任务的自主代理。Token 消耗从涓涓细流变成了开闸放水。Jellyfish 的数据显示,Agentic 功能驱动下,开发者人均 Token 消耗在 9 个月内暴涨了18.6 倍。
然后,账单来了。
2026 年 4 月,Uber CTO 公开了一组数字:公司整个 2026 年的 AI 编码预算,4 个月就烧光了。此前“尽可能用 AI”的企业文化、内部排行榜,一夜之间变成全员每人每月 1500 美元硬上限。只有特批才能例外。
Priceline的 IT 财务高管说得更狠。Cursor 续约价格涨了 4 到 5 倍,公司被迫给特定群体设 Token 限额。他对 TechCrunch 的原话是:
"It''s like the cocaine epidemic — get you hooked, and now you can''t live without it."
「就像可卡因流行病——先让你上瘾,现在你离不开它。」
TechCrunch深度报道:Token账单全面来临,企业从“tokenmaxxing”转向护栏模式
▲ TechCrunch 6 月 5 日长文《The token bill comes due》首页截图:标题与开头部分聚焦企业在 AI 成本飙升后转向更严格的预算管理。
一家公司 5 个工具砍到 2 个,X 上炸出真实案例
瑞银报告里那个“从 5 砍到 2”的案例,在 X 上找到了活生生的对应。
一位 ID 为 K-Line(@Maddere7)的用户用中文回复 Rohan Paul 的帖子:
“60%这个数字我一点都不意外,我们公司上个月刚把内部 AI 工具从 4 个砍到 2 个。最离谱的是有个 team 光 API 调用一个月烧了快$40K,老板脸都绿了。现在全公司统一用 DeepSeek 跑简单任务,贵模型留给写代码和长文档用。”
X用户@Maddere7中文回复:公司4砍到2,团队月烧$40K,全公司DeepSeek简单任务+高端模型写代码
▲ @Maddere7 的回复几乎完美复刻了瑞银报告的案例模式:工具收缩、极端账单、简单任务切到 DeepSeek。
这段话的信息密度极高。它把瑞银的统计数字变成了一家公司真实的应激反应:先被账单砸晕,然后紧急收缩,最后建立起一套“便宜模型干粗活、贵模型干细活”的分级体系。
这个分级体系,就是瑞银报告中反复强调的核心概念——模型路由(Model Routing)。
模型路由:高端闭源从“默认选项”沦为“奢侈品”
以前企业用 AI 的逻辑很简单:所有任务都扔给最强模型。Claude Opus、GPT-5,什么都能干,为什么不呢?
账单教会了大家“为什么不”。
以 Anthropic 的定价为例:Haiku 4.5 输出约每百万 Token 5 美元,Opus 4.5 约 25 美元,Fable/Mythos 5 冲到 50 美元。价差达到 10 倍。
模型路由的策略随之成型:简单邮件回复、基础总结、代码补全走廉价小模型;复杂推理、多步 Agent 规划、关键业务代码、超长文档分析才上高端模型。
这背后的算账逻辑也变了。以前比的是单次跑分谁最高,现在比的是谁能一次就把事做对——高端模型如果一次就能产出正确结果,可能比廉价模型反复迭代更省钱。但门槛摆在那里:高端模型必须持续证明自己的溢价值这个价。
Palantir 的 AIP Evolve 工具给出了一个惊人案例:帮客户换模型后,Token 成本直降 97%,前三周就有九成用户主动切过去。
97%。这个数字意味着,大部分企业之前在 AI 上的花费,可能有巨大的优化空间。
Uber AI支出限额报道:$1500/月硬上限、仪表盘追踪、4个月烧光全年预算
▲ TechCrunch 报道 Uber 的具体应对:每人每月$1500 上限、内部仪表盘追踪、特批例外机制。
中国开源模型,正在吃掉“够用层”的蛋糕
路由降级不止发生在同一家供应商内部。企业开始把目光投向更远的地方——开源模型,尤其是中国开源模型。
瑞银报告明确点名了阿里 Qwen、DeepSeek、MiniMax、智谱 GLM、Moonshot Kimi。一家大型全球银行已经开始在本地部署 Qwen,用来平衡 Claude 等高端模型的使用量。
本地部署之后,成本结构完全变了:按 Token 付费的模式被替换成按本地硬件容量配置,开多少用多少,同时规避了外部托管中国模型可能面临的合规风险。对企业 CFO 来说,这是一张干净的成本对冲牌。
最关键的是,中国模型已经进了云平台的“标准菜单”。
2026 年 2 月,AWS 正式宣布 Bedrock 支持六款开源权重模型:DeepSeek V3.2、MiniMax M2.1、GLM 4.7/Flash、Kimi K2.5、Qwen3 Coder Next。官方原话是“frontier-class performance at significantly lower inference costs”——前沿级性能,推理成本大幅降低。背后是 Project Mantle 分布式推理引擎,serverless 部署、高默认配额、OpenAI API 兼容。
AWS Bedrock官方公告:正式支持DeepSeek、MiniMax、GLM、Kimi、Qwen等中国开源模型
▲ AWS 官方“What''s New”页面,明确列出六款中国开源模型。“前沿级性能,推理成本大幅降低”。
Azure AI Foundry 也接入了 DeepSeek。微软还在探索将 DeepSeek 或其他开源模型用于 Copilot Cowork 的低成本替代方案。
据中文财经媒体的交叉分析,中国模型 API 均价不到美国同类产品的 20%,但毛利率能与 Anthropic/OpenAI 持平(20%~40%)。德银一份分析指出,前沿专有模型与开源模型之间存在约65 倍的成本鸿沟,而对 90%的日常企业任务来说,表现差异微乎其微。
JPMorgan 的数据从另一个角度印证:2026 年 2 月至 5 月,中国平台 Token 消耗量大幅上升,Kimi、GLM、DeepSeek 位居前列。汇丰、渣打、沙特阿美等金融机构已在测试或部署 DeepSeek 模型。
谁在承压,谁在偷笑?
这波 AI 成本治理的直接冲击,落在几个不同层面。
模型层压力最大。高端前沿模型——Claude Opus、GPT 顶级版本——面临明确的增速压力。Databricks CEO 的原话是:“This is a big speed bump, not a small one.(颠簸不小,是一次大减速。)”
但云平台是结构性赢家。AWS、Azure、Google Cloud 已经是多模型平台。客户从高价模型切到小模型或开源模型,只要推理还跑在云上,算力需求不消失。企业越重视成本管理,越可能把模型选择、部署、安全、计费统一托管到云平台——AWS Bedrock 一口气接六款中国模型,就是这个逻辑的最佳注脚。
软件层存在巨大机会。谁能在 Claude、Qwen、Llama、各类小模型之间做智能调度,按成本-性能权衡动态分配,谁就掌握了新的定价权。Palantir 97%的成本节省已经展示了可能性。
瑞银整体判断值得注意:这次优化的本质是新技术扩散早期的成本治理,跟 2022~2024 年那种成熟云业务的砍预算完全是两码事。Harvey——一家法律 AI 原生公司——Token 消耗从 1 月的 1 万亿暴涨到 5 月的 12~13 万亿,有 ROI 的场景仍在全速扩张。
保守情景下:假设原支出 100、预计数月后到 150,优化后可能落在 120~130。增速放缓,不是需求逆转。
需要补一句保留意见:这份调查仍属初步样本,方法论细节尚未公开,文中的极端账单更像高使用案例,而不是企业平均水平。
AI 进入“算账时代”
瑞银这份报告真正标记了一个拐点。60%这个数字当然抓眼球,但更值得关注的是 AI 正在经历什么性质的阶段转换。
AI 从“先用起来再说”的蛮荒时代,进入了“算清楚账再跑”的工业化阶段。CFO 开始介入,Token 护栏开始搭建,模型选择不再迷信“最强”这个标签——企业开始追问:花这个钱,值不值?
这不是坏事。几乎所有新技术的扩散都遵循这条曲线:先野蛮生长,再财务收紧,然后进入可持续的规模化。云计算走过这条路,SaaS 走过这条路,AI 正在走。
真正值得关注的变化是:“够好层”的护城河正在被商品化填平。对 90%的日常企业任务,顶级闭源模型的边际收益已经撑不住 10 倍的价格差。路由工具加低成本模型组合,让“智能”变成了可采购的效用,而不再是少数几个实验室的专属供货。
中国开源模型——Qwen、DeepSeek、MiniMax、GLM、Kimi——站在这个商品化浪潮的浪尖上。它们不用在每个维度上击败 GPT-5 或 Claude Opus,只要在大多数任务上“够好”且便宜一个数量级,就有企业愿意买单。AWS Bedrock 的官方接入,等于给这条路径盖了章。
而云平台,正在悄悄成为这场算账运动的最大受益者。不管客户最后选了哪家的模型,推理的算力都在它们的机房里跑。


