Token 是怎么造出来的:撕开黄仁勋五层蛋糕的双时钟真相
胡新宇
Published on 2026-08-22
黄仁勋 2026 年 1 月在达沃斯把 AI 基础设施拆成五层蛋糕:能源、芯片、基础设施、模型、应用。但真正决定 Token 价格的不是这五层的简单叠加,而是算法与物理世界以完全不同的速度在跑——3 年降 99.5% 与变压器交付 128 周同时成立。本文从《Token 经济》中提取最有锐度的双时钟真相,给出按任务总成本而非 API 标价做决策的三条参考。
Loading...
胡新宇
Published on 2026-08-22
黄仁勋 2026 年 1 月在达沃斯把 AI 基础设施拆成五层蛋糕:能源、芯片、基础设施、模型、应用。但真正决定 Token 价格的不是这五层的简单叠加,而是算法与物理世界以完全不同的速度在跑——3 年降 99.5% 与变压器交付 128 周同时成立。本文从《Token 经济》中提取最有锐度的双时钟真相,给出按任务总成本而非 API 标价做决策的三条参考。

先给一个让你胃疼的数据。
过去三年,同等能力水平的推理成本下降了 99.5%。斯坦福《2026 年 AI 指数报告》(Stanford AI Index 2026)白纸黑字,降到原来的 1/250。
但你的账单变薄了吗?
没有。不但没变薄,还在变厚。企业 AI 预算从试验性质的几十万膨胀到几千万,云厂商资本开支一个季度比一个季度凶猛。更吊诡的是,芯片还是买不到,数据中心排队排到 2028 年之后。
算力在降价,账单在涨价,这两个事实同时成立。
黄仁勋 2026 年 1 月在达沃斯世界经济论坛上,第一次把 AI 基础设施拆成"五层蛋糕"——能源、芯片、基础设施、模型、应用(《Token 经济》,白惠天等,中信出版 2026)。这个框架被他在 CES 和 GTC 反复搬出来。但大多数人只听到了"蛋糕"两个字,没听懂他到底想说什么。
他想说的是:Token 这个东西,看上去像软件,骨子里却越来越像重工业。
我一直有个朴素的直觉:Token 降价 99.5%,说明 AI 越来越便宜,用的人会越来越多,最后变成像短信一样廉价的基础服务。
这个直觉错得离谱。
错在哪?错在把"单 Token 价格"当成了"完成一件事的总成本"。这是三本完全不同的账。
第一本账是生产成本。造一个 Token 出来,电费多少、芯片折旧多少、机房摊销多少。
第二本账是市场报价。厂商给你报的 API 价格,这个价格可以低于成本卖——为了抢市场。
第三本账是任务成本。你让 AI 写完一份报告,一共消耗了多少 Token。模型升级了,单 Token 便宜了,但如果新模型为了变聪明多消耗了五倍 Token,你的总账单一分没少。
这三本账混在一起,就是所有误会的来源。
黄仁勋那五层,逐层剥开看。占比参考 SemiAnalysis 推理 TCO 模型(《Token 经济》转引)和大规模商用推理口径——自建 vs 租用、前沿 vs 经济模型、长上下文 vs 短问答都会改权重。

能源层,占总成本 10% 到 20%。
你以为电费是大头?错了。一个 500 MW 机房一年电费 3 亿美元,按美国工业电价 0.06–0.08 美元/千瓦时算(《Token 经济》),听着吓人,但往总 TCO 里一放,不到五分之一。更要命的不是电费本身,是变电设备、并网排队、电网改造这些"电之外的能源成本"。这是后话。
芯片层,40% 到 55%,最大头。
B200 单卡 3 万到 4 万美元(《Token 经济》转引)。更关键的是 HBM 内存——高端芯片制造成本里,HBM 加先进封装占了大约三分之二。而 HBM 这个市场,全球就三家:SK 海力士拿了 57%,三星 22%,美光 21%(同上)。云厂商资本开支里内存的占比从 2023–2024 年的 8% 飙到了 2026 年的 30%,几乎全是 HBM 贡献的。
芯片层价格没有降,在涨。
基础设施层,15% 到 20%。
机房、液冷、InfiniBand 网络。这层的核心变量不是建设成本,是利用率。利用率 60% 和 80% 的机房,摊到每个 Token 上的成本天差地别(同上)。你的 Token 贵,很可能不是厂商黑心,是他的机房只跑了一半负载。
模型层,10% 到 15%。
这是最软的一层,也是降得最狠的一层。DeepSeek V4 总参数 1.6 万亿,每次推理激活 490 亿,只有 3%(同上)。好比一家 16000 人的咨询公司,每接一个项目只派 500 人精锐小组。蒸馏更狠,小模型复现大模型能力,推理成本只要大模型的 1%。
MoE、注意力优化、推测性解码——这些都不需要换硬件,纯靠算法就把价格打下来一截。
应用层,5% 到 10%。
界面、合规、内容安全,薄薄一层。
所以你看到降价 99.5%,大部分发生在模型层。而芯片层在涨价,能源层在涨价,基础设施层被利用率锁死。
算法把成本打骨折的同时,物理世界在偷偷涨价。 你的账单没变薄,因为便宜的部分被贵的部分吃掉了。
这里有个流传很广的误会,值得单独拎出来说。
很多人把 Token 理解成"电力的转售"——你用电跑模型,电费决定了 Token 成本。这个理解漏洞很大。电费在完全成本里占不到五分之一,就算明天电价腰斩,你的 Token 价格最多降 10%。
反过来想更有意思:同样 1 度电,喂给不同的芯片、放在不同利用率的机房里,造出的 Token 数量天差地别。
新的 B 系列芯片,每代性能提升 2 到 3 倍,功耗增幅不到 50%,折合每 Token 硬件成本每代降 40% 到 60%(《Token 经济》)。听起来很棒。但从架构发布到大规模交付,需要 12 到 18 个月。B200 在 2024 年 3 月发布,2025 年底才大规模铺开。
也就是说,英伟达给你画的降本曲线,和你能实际拿到手的降本曲线之间,隔着一整年的物流、产能爬坡和机房改造。
这一年里,你的账单按旧硬件在跑。
现在可以谈正事了。
Token 这个商品,身上装了两块钟表。
第一块钟走的是算法时间,按月计。 MoE 架构、注意力优化、蒸馏、推测性解码,每一个进展都能在几周内变成产品更新,直接把 API 价格往下砸。
第二块钟走的是物理时间,按年计。 数据中心从规划到建成 18 到 36 个月。美国标准电力变压器的交付周期是 128 周,疫情前只要 6 到 8 周。HBM 产能年增速 30% 到 50%,但 AI 需求在翻倍。全球数据中心电力消耗从 2024 年的 415 TWh 会在五年内翻到 900 TWh(IEA,国际能源署)。高盛预测 2028 年美国面临 45 GW 电力缺口,电网互联排队排到了 2060 GW,中位并网周期接近五年,谷歌部分选址要等 12 年(《Token 经济》转引)。
12 年。够你的模型降多少轮价?

Token 是双时钟商品:算法按月进步,电网和机房按年建设。 这句话值得反复回味。
最极端的案例是 OpenAI 的 Stargate。5000 亿美元的项目,2026 年 4 月因为电网接入排队和变压器延迟,施工暂停。《Token 经济》里那句话很毒:"5000 亿美元买不来物理世界的加速,也买不来社区的同意。"
钱能买算力,买不了变压器。能买芯片,买不了并网许可。能买算法,买不了社区签字。
这就解释了为什么价格战越打越猛,算力却越买越紧。算法的快时钟让厂商手里的 Token 成本骤降,他们有空间打价格战;但物理的慢时钟同时在收紧供给,让云厂商不敢停下来。
左手在降价抢客户,右手在加价抢变压器。 这是 2026 年 AI 行业最精分的现场。
把上面这些串起来,我的判断是:未来 AI 行业的竞争不是"谁更会写代码",而是谁能把能源、芯片和模型组织得更高效。组织效率才是胜负手。
至于你现在该怎么做,三条参考。
第一,别拿 API 标价当决策依据。按"完成一个任务的总 Token 消耗 × 单价"来算。新模型单价砍半但消耗翻五倍,你选它就是在付智商税。
第二,自建还是租用,先把利用率算清楚。你的负载如果喂不满 60%,自建机房就是在给自己挖坑。利用率才是硬道理。
第三,长上下文不是免费午餐。Token 单价看似便宜了,但长上下文把 Token 消耗量顶上去,总成本可能翻着跟头涨。
最后说一句透底的话。
我们不能一边享受算法红利的快感,一边假装物理约束不存在。AI 的账,从来都不只是软件账。 黄仁勋在那张蛋糕图里早就画出来了,只是没人愿意往下挖。