Token 是怎么造出来的:撕开黄仁勋五层蛋糕的双时钟真相
胡新宇
发布于 2026-08-22
黄仁勋 2026 年 1 月在达沃斯把 AI 基础设施拆成五层蛋糕:能源、芯片、基础设施、模型、应用。但真正决定 Token 价格的不是这五层的简单叠加,而是算法与物理世界以完全不同的速度在跑——3 年降 99.5% 与变压器交付 128 周同时成立。本文从《Token 经济》中提取最有锐度的双时钟真相,给出按任务总成本而非 API 标价做决策的三条参考。

Token 是怎么造出来的:撕开黄仁勋五层蛋糕的双时钟真相
先给一个让你胃疼的数据。
过去三年,同等能力水平的推理成本下降了 99.5%。斯坦福《2026 年 AI 指数报告》(Stanford AI Index 2026)白纸黑字,降到原来的 1/250。
但你的账单变薄了吗?
没有。不但没变薄,还在变厚。企业 AI 预算从试验性质的几十万膨胀到几千万,云厂商资本开支一个季度比一个季度凶猛。更吊诡的是,芯片还是买不到,数据中心排队排到 2028 年之后。
算力在降价,账单在涨价,这两个事实同时成立。
黄仁勋 2026 年 1 月在达沃斯世界经济论坛上,第一次把 AI 基础设施拆成"五层蛋糕"——能源、芯片、基础设施、模型、应用(《Token 经济》,白惠天等,中信出版 2026)。这个框架被他在 CES 和 GTC 反复搬出来。但大多数人只听到了"蛋糕"两个字,没听懂他到底想说什么。
他想说的是:Token 这个东西,看上去像软件,骨子里却越来越像重工业。
我之前也搞错了
我一直有个朴素的直觉:Token 降价 99.5%,说明 AI 越来越便宜,用的人会越来越多,最后变成像短信一样廉价的基础服务。
这个直觉错得离谱。
错在哪?错在把"单 Token 价格"当成了"完成一件事的总成本"。这是三本完全不同的账。
第一本账是生产成本。造一个 Token 出来,电费多少、芯片折旧多少、机房摊销多少。
第二本账是市场报价。厂商给你报的 API 价格,这个价格可以低于成本卖——为了抢市场。
第三本账是任务成本。你让 AI 写完一份报告,一共消耗了多少 Token。模型升级了,单 Token 便宜了,但如果新模型为了变聪明多消耗了五倍 Token,你的总账单一分没少。
这三本账混在一起,就是所有误会的来源。
五层蛋糕,谁在吃你的钱
黄仁勋那五层,逐层剥开看。占比参考 SemiAnalysis 推理 TCO 模型(《Token 经济》转引)和大规模商用推理口径——自建 vs 租用、前沿 vs 经济模型、长上下文 vs 短问答都会改权重。

能源层,占总成本 10% 到 20%。
你以为电费是大头?错了。一个 500 MW 机房一年电费 3 亿美元,按美国工业电价 0.06–0.08 美元/千瓦时算(《Token 经济》),听着吓人,但往总 TCO 里一放,不到五分之一。更要命的不是电费本身,是变电设备、并网排队、电网改造这些"电之外的能源成本"。这是后话。
芯片层,40% 到 55%,最大头。
B200 单卡 3 万到 4 万美元(《Token 经济》转引)。更关键的是 HBM 内存——高端芯片制造成本里,HBM 加先进封装占了大约三分之二。而 HBM 这个市场,全球就三家:SK 海力士拿了 57%,三星 22%,美光 21%(同上)。云厂商资本开支里内存的占比从 2023–2024 年的 8% 飙到了 2026 年的 30%,几乎全是 HBM 贡献的。
芯片层价格没有降,在涨。
基础设施层,15% 到 20%。
机房、液冷、InfiniBand 网络。这层的核心变量不是建设成本,是利用率。利用率 60% 和 80% 的机房,摊到每个 Token 上的成本天差地别(同上)。你的 Token 贵,很可能不是厂商黑心,是他的机房只跑了一半负载。
模型层,10% 到 15%。
这是最软的一层,也是降得最狠的一层。DeepSeek V4 总参数 1.6 万亿,每次推理激活 490 亿,只有 3%(同上)。好比一家 16000 人的咨询公司,每接一个项目只派 500 人精锐小组。蒸馏更狠,小模型复现大模型能力,推理成本只要大模型的 1%。
MoE、注意力优化、推测性解码——这些都不需要换硬件,纯靠算法就把价格打下来一截。
应用层,5% 到 10%。
界面、合规、内容安全,薄薄一层。
