开源赢了流量,Anthropic 凭什么拿走一半钱
胡新宇
发布于 2026-07-11
7 月 10 日这周,Vercel 和 OpenRouter 同时公开数据:开源模型吃掉三分之一 Token 流量,但前沿模型仍拿走 AI 总支出的一半。AI 商业正分成'应用发现 + 生产部署'两层——开源拿流量,前沿拿钱。本文用 Decagon 90% 自家实践、23 倍 Token 单价差、Anthropic 反超 OpenAI 的 470 亿营收,把双层结构讲透。

开源赢了流量,Anthropic 凭什么拿走一半钱
2026 年 7 月 10 日周一,两件事撞上同一天。
上午,Decagon 创始人 Jesse Zhang 发文:开源模型 Token 量碾压,但企业 AI 市场里,前沿模型仍拿走大部分钱。同一天,Vercel 公开 AI Gateway 仪表盘:DeepSeek 占平台总 Token 流量三分之一,跃居第一;智谱同期冲进第四。但同一张仪表盘告诉你另一件事——Anthropic 仍拿走该平台 AI 总支出的 50% 以上。
流量第一,钱拿走一半。这两件事同时为真。
利润和流量,不在同一张报表上。 7 月 10 日这两组数字,把过去十年的零和假设撕开了一个口子——开源赢了体量,闭源没输掉钱。AI 商业的下一程,不在胜负,在分成。
<!-- 配图:双层蛋糕/双柱视觉(封面用) -->
开源没"输",但闭源也没输掉钱
先把数据摊开。
OpenRouter 平台的最新周报:DeepSeek V4 Flash 每周处理约 5.3 万亿 Token,是目前用量第一的模型;最受欢迎的前沿模型 Opus 4.8,每周处理略高于 2 万亿 Token。流量上看,开源模型是前者的 2.6 倍。
但要看钱,得换一套算账方式。同一组数据显示,Opus 4.8 每百万 Token 平均成本约 1.37 美元,DeepSeek V4 Flash 仅 0.06 美元——前者是后者的 23 倍。
按这个价差推算:尽管 Opus 用量只有 V4 Flash 的三分之一强,它在 OpenRouter 上很可能仍然占据大部分模型支出。Vercel 的仪表盘更直接:Anthropic 占该平台 AI 总支出 50% 以上。
开源没输。它在更多场景里跑起来了。
闭源也没输。它在更贵的场景里继续收钱。
这跟过去十年所有的"开源叙事"都不同。Linux 蚕食服务器操作系统、安卓蚕食手机份额,本质是同一个市场里你多吃一口我就少吃一口。大模型的市场,按 Token 算是一张表,按美元算又是另一张表。
Decagon 的反问:90% 跑在开源,但不是因为成本
Jesse Zhang 抛出一个让所有人没想到的答案——为什么 Decagon 90% 的工作负载在开源模型上?
不是因为成本,也不是因为客户要求。真正的原因是,我们几乎没有其他选择。
他在原文里解释:客服场景要求每轮回复延迟必须短,那种"8 秒才出字"的对话没人愿意用。前沿模型不是不能做客服,是不能在每一次会话里都做客服——它体量太大、推理太贵,跑不起这个调用密度。
另一个更隐蔽的原因:前沿模型实验室基本不允许客户深度微调它们最强的模型。你买得到 API,但买不到"按你业务定制"的版本。客服这种场景,每个公司都有自己的话术、规则、禁用词——你必须能塑造模型,否则它只能给到"通用答案"。
所以 Decagon 的选择不是"开源便宜",而是:前沿模型太贵太大,但又不让你深度定制。开源在这里不是赢,是补位。
这个反问对整个市场都成立。当一个场景对延迟敏感、对定制敏感、对每一条业务规则敏感,闭源前沿模型就自动退出,留出来一整片生产部署层。这片层越来越大,因为能在上面跑的应用越来越多。但入口、第一次判断、决定"这个场景该不该用 AI"的验证阶段——还是要靠最聪明的那个模型。
<!-- 配图:Mermaid 双层模型经济迁移图(应用发现层 → 生产部署层) -->