token 单价一年跌了 75%,你的 AI 账单为什么反而三倍
Published on 2026-09-07
token 单价一年跌了 75%,你的 AI 账单为什么反而三倍 过去一年,大模型 token 的混合报价大概跌了 75%^F01。同时,凡是上了 agentic 工作流的企业,基本都在跟 CFO 解释同一件事:为什么 AI 这一项的预算又超了,模型已经这么便宜。 两个数字都对,问题是没人能在账本上把它们对上。这不是会计的工作没做好,是"按 token 计价"这件事本身,在 agentic 时代已...
token 单价一年跌了 75%,你的 AI 账单为什么反而三倍
过去一年,大模型 token 的混合报价大概跌了 75%1。同时,凡是上了 agentic 工作流的企业,基本都在跟 CFO 解释同一件事:为什么 AI 这一项的预算又超了,模型已经这么便宜。
两个数字都对,问题是没人能在账本上把它们对上。这不是会计的工作没做好,是"按 token 计价"这件事本身,在 agentic 时代已经废了。
同一时期,三种账单走向
把过去七天三支头部工程团队的公开材料摆在一起,故事就清楚了。
Uber: 2026 年 2 月到 8 月,所有员工在所有智能体产品中的周活跃用户增长 7 倍,周智能体请求量增长 9.4 倍,与此同时 AI 总支出自 4 月以来"相对稳定"——固定模型下,每 1000 次模型请求成本较峰值下降近 34%,每会话成本较 6 月峰值下降 52%2。
GitHub Copilot: 在 4 个独立 A/B 实验里,选择性地压缩输出下降 5.5%,去行号前缀下降 3.1%,压缩任务工具提示词下降 2.9%,减少通知往返下降 2.3%3。但同一份博文里,他们明确披露了一个反例:本地压缩 shell 输出的 RTK 工具让单次工具响应更短,端到端任务用得更多 token、更慢、整体更贵3。
Elastic 工程团队: 写出了那个让人坐不住的标题——为什么你的 AI 账单涨了三倍,token 单价却跌了 75%。他们给出的一手审计数字是:某 2026 年覆盖 30 个生产工程团队的样本里,62% 的推理费用花在了"上下文重复传输"上4。
Uber 把账单摁住了。GitHub 一开始摁错,后来摁对了。Elastic 描述的那种失控,是大多数没在七个月里专门搭软件工厂的企业的默认结局。
"省 token"为什么不再等于"省钱"
agentic 工作流吃掉了所有 token 单价红利。聊天是一问一答,一去一回;一个 agent 处理 triage 队列或代码评审,是"计划、调用工具、评估结果、结果稀薄就再来、信心不足就升级"的连续动作。Elastic 援引 Stanford Digital Economy Lab 的研究:agentic coding 任务的 token 消耗,可比单轮代码对话多 1000 倍,而同一项任务的成本在不同运行之间能差出 30 倍5。
数字大不是问题,数字"动"才是。同样的任务,有人 1 块、有人 30 块,这种东西没法预测,只能事后复盘。
而工程团队看不见这件事。a16z 调研显示,81% 的企业在跑三个或更多 AI 模型,88% 在用两个或更多供应商6。成本被打散在各自的账单里,没有共同的计量单位,Elastic 团队一针见血地说"会议室里没人能回答一个简单的问题:一个完成的任务到底多少钱"1。