5 万块国产芯片 + 700 万 API 用户:智谱把 token 卖成了一门好生意
胡新宇
Published on 2026-08-12
晚点独家披露智谱 API 用户近 700 万、启用 5 万块国产算力芯片。智谱靠 Infra 优化把 token 卖成了一门好生意,毛利率 50%-60%。

5 万块国产芯片 + 700 万 API 用户:智谱把 token 卖成了一门好生意
700 万。这是 2026 年 8 月 10 日《晚点 LatePost》披露的智谱 MaaS 平台 API 注册用户数,相比七月初整整涨了 200 万。同期,智谱悄悄启用了超过 5 万块国产算力芯片,建成了 1GW 的国产 AI 算力基础设施。
两个数字挨在一起,行业里的人才会意识到:中国的大模型生意,第一次跑通了。

不是模型跑通——GLM-5 在 2 月发布时就进了全球第四。也不是融资跑通——智谱 7 月的港股配售一下午就收完 300 亿港元,认购者还要排队。
跑通的是卖 token 这门生意。ARR 今年涨 15 倍,自有算力上的毛利率能到 50%-60%,注册用户人均每月在智谱花 160 块,Coding Plan 从 20 元涨到 118 元还有人买。
这件事的关键不在数字本身,而在它的反面:中国大模型公司一直被骂的两件事——算力被卡脖子、卖 token 不赚钱——智谱第一次同时给出了答案。
卡脖子的算力,和另一条没人走的路
"5 万块国产芯片"这个数字,被很多媒体一笔带过。但在 Infra 圈,它的真实含义是:智谱是第一家把"国产算力规模化部署到推理生产环境"这条路跑通的中国大模型公司。
中国不缺算力——缺的是能立刻调用的、能稳定支撑每日百亿 token 的、不会被出口管制一夜砍断的算力。智谱在 7 月完成了对中科加禾的收购(双方之前已经联合办公数月),加上自建 1GW 机房,构成了一个事实上的"算力门槛"。
但这条门槛不是用钱堆出来的。物理硬件扩展有物理极限——光刻机、晶圆厂、HBM 内存,全部卡在海外。智谱的工程师们转而走了一条更窄、更难、但更可控的路:在已有硬件上把每一卡每一秒的 token 产出榨干。
一个 Agent 干活时平均要往模型里塞 7 万多 token 的上下文,远超日常聊天内容。
长上下文是编程场景的标配,也是推理成本的最大头。智谱和中科加禾的研究成果:把 KV 缓存分拆,可以把单个推理服务的吞吐随长程任务增长最高提升 132%。另一项叫 ZCube 的网络架构改造,让整个生产集群吞吐量提升 15%,同时把交换机和光模块需求砍掉三分之一。
132% 和 15%——这两个数字看起来不大。放大到 1GW 机房、每天百亿 token 的规模,每提升 1% 都是天文数字。一位投资人告诉《晚点 LatePost》:1% 的效率提升放在大规模部署的算力设备中,节省下来的钱也是天文数字。
这就是智谱的第一条防线:硬件难扩时,工程师红利。
高速版 API:把"不够快"变成"够快"
5 月下旬,智谱推出了高速版 API,每秒生成 token 数达到 400,相比常规 API 服务速度提升约 8 倍。这个数字在 Anthropic、OpenAI 面前不算炸裂——但它的含义不一样:
即使是高速版 API 的 400 tokens/s,按照 8 卡 H200 服务器的内存带宽计算,也只用到硬件理论能力上限的四成。
四成。意思是——留给 Infra 优化的空间还有一半以上。一位行业人士估算,大模型 Infra 每轮优化仍有 15% 到 30% 的效率提升空间。对智谱来说就更是如此,它本来就不以 Infra 优化见长。
TileRT 团队(来自和 TileLang 同源的清华系)把 MiMo-V2.5-Pro 这个 1 万亿参数的模型速度推到了 1000 token/s。同一个团队也给智谱的高速版 API 提供了底层支持——梁文锋那份广为流传的内部讲话里,TileLang 被认为有潜力打破英伟达的 CUDA 垄断。这不是巧合:中国大模型公司在编译器层面的追赶速度,比硬件层面的追赶速度快一个数量级。
GLM-5.2 的架构改动几乎都围绕推理成本设计。公开的技术报告显示,IndexShare 通过复用稀疏注意力层的索引器,把百万 token 场景下单位 token 的计算量降低 2.9 倍;改进后的 MTP 草稿层接受长度提升 20%,生成速度随之快约两成。后训练阶段重新采用 PPO,配套的 SAO 异步方法让训练步数从行业普遍崩溃的 160 步稳定跑到 1000 步;自研框架 slime 能在约两天里把十几个专家模型合并成一个。
