坐拥十万张 GPU 却赚不到钱?AI 算力正在重演「钢铁厂覆灭史」
Site Owner
发布于 2026-07-20
商汤在 WAIC 宣布国产异构混推集群跑通盈利,单卡有效利用率提升 152%,年底 Token 产量目标 10 万亿/日。从军备竞赛到工厂时代,AI 算力的竞争单位正从堆 GPU 变成端到端控制权。
坐拥十万张 GPU 却赚不到钱?AI 算力正在重演「钢铁厂覆灭史」
商汤在 WAIC 上扔了颗炸弹。
他们宣布自己的国产算力集群跑通了「可盈利」——收入覆盖折旧、摊销、机柜租赁、电费和人员服务费之后,利润率为正。
这三个字,比任何技术突破都扎眼。去年这时候大家还在炫自己囤了多少张卡,今年风向突变:有人兜里揣着十万张 H100 签长租协议,账上亏得不敢细算;商汤搞国产卡混搭方案,反倒先把账做平了。
这背后藏着一个更残酷的判断——
AI 推理这场仗,竞争单位正在从"单张卡的性能"变成"整条流水线的控制权"。
<!-- 配图:军备竞赛 → 工厂时代 范式切换 -->
你买的不是算力,是「五个老板管一条流水线」
聊个细节。商汤联合创始人杨帆在论坛上说了句大实话:现在很多智算中心,干的就是金融生意——帮大厂代持机器、签长租约,赚的是租金差价。
我管这个叫「五个老板管一条流水线」。
想象一下,你建了个工厂,机器是英伟达的,网络调度是阿里云那套,KV Cache 管理层用开源方案凑的,电力跟着市电走,客户需求靠天吃饭。每个环节都找了最好的供应商,但拼在一起就是跑不顺。
为什么?
因为这五个环节各管各的,没人对最终的 Token 质量负责。
KV Cache 满了没人提前扩容,电力峰值没做预测调度,某个客户的突发请求把整个 Decode 队列打爆——每个老板都说自己那摊事没问题,但最终产线卡死了。
商汤这次能跑通盈利,核心不是卡便宜,是他们把五个老板踢走了四个,自己当了厂长。
他们把推理拆成 Prefill 和 Decode 两道工序——Prefill 相当于读题,适合通用国产卡并行处理;Decode 是逐字答题,得用高端卡保证时延。纯英伟达方案下 4 个 Prefill 节点配 1 个 Decode 节点就够了,国产方案因为单卡能力弱,需要 30 对 1 的配比。
这难度相当于同时调度 31 台设备不出错。商汤把系统可靠性做到 99.9%,才敢切进大规模商用。
<!-- 配图:异构混推流水线,Prefill/调度/Decode 分工 -->
GPU 多等于赢?那是 2024 年的童话
2025 年的故事完全反过来。
英伟达高端卡进不来,这已经不用猜了。需求端却在爆炸——密歇根大学和斯坦福联合测算,现在一个编码 Agent 每生成 1 个输出 Token,背后要吞掉约 154 个输入 Token。推理不再是问一句答一句,而是在吃上下文。
行业共识是,2026 年的 AI 推理算力需求是去年的 5 到 10 倍。
供给卡死,需求狂飙,中间的机会在哪?
商汤给了个答案:MFU(有效利用率)才是最性感的财务指标。
他们单卡 MFU 比原厂方案平均提了一倍,最高飙到 +152%。配上异构混推方案,同样花一块钱买算力,Token 产量放大 2.5 倍。
这个数据怎么来的?他们自研了一套推理引擎,把算子调度、内存分配、KV Cache 管理全攥在自己手里。不是英伟达给的默认方案不好用——是默认方案根本不知道你的卡里有七成国产货。
默认方案默认你全是顶配,默认供电稳定,默认 KV Cache 爱存多久存多久。
商汤把每个细节都自己管起来之后,Token 量从年初日均 4000 亿,干到 7 月底预计 2.42 万亿,年底目标 10 万亿。
规模当然是增长的,但增长方式跟囤卡时代的逻辑彻底不同——原来是卡多 Token 就多,现在是 “拧毛巾拧出来的增量”。
<!-- 配图:Token 增长三阶段数据图(4000亿 → 2.42万亿 → 10万亿)-->