5 万块国产芯片 + 700 万 API 用户:智谱把 token 卖成了一门好生意
Published on 2026-08-12
晚点独家披露智谱 API 用户近 700 万、启用 5 万块国产算力芯片。智谱靠 Infra 优化把 token 卖成了一门好生意,毛利率 50%-60%。

5 万块国产芯片 + 700 万 API 用户:智谱把 token 卖成了一门好生意
700 万。这是 2026 年 8 月 10 日《晚点 LatePost》披露的智谱 MaaS 平台 API 注册用户数,相比七月初整整涨了 200 万。同期,智谱悄悄启用了超过 5 万块国产算力芯片,建成了 1GW 的国产 AI 算力基础设施。
两个数字挨在一起,行业里的人才会意识到:中国的大模型生意,第一次跑通了。

不是模型跑通——GLM-5 在 2 月发布时就进了全球第四。也不是融资跑通——智谱 7 月的港股配售一下午就收完 300 亿港元,认购者还要排队。
跑通的是卖 token 这门生意。ARR 今年涨 15 倍,自有算力上的毛利率能到 50%-60%,注册用户人均每月在智谱花 160 块,Coding Plan 从 20 元涨到 118 元还有人买。
这件事的关键不在数字本身,而在它的反面:中国大模型公司一直被骂的两件事——算力被卡脖子、卖 token 不赚钱——智谱第一次同时给出了答案。
卡脖子的算力,和另一条没人走的路
"5 万块国产芯片"这个数字,被很多媒体一笔带过。但在 Infra 圈,它的真实含义是:智谱是第一家把"国产算力规模化部署到推理生产环境"这条路跑通的中国大模型公司。
中国不缺算力——缺的是能立刻调用的、能稳定支撑每日百亿 token 的、不会被出口管制一夜砍断的算力。智谱在 7 月完成了对中科加禾的收购(双方之前已经联合办公数月),加上自建 1GW 机房,构成了一个事实上的"算力门槛"。
但这条门槛不是用钱堆出来的。物理硬件扩展有物理极限——光刻机、晶圆厂、HBM 内存,全部卡在海外。智谱的工程师们转而走了一条更窄、更难、但更可控的路:在已有硬件上把每一卡每一秒的 token 产出榨干。
一个 Agent 干活时平均要往模型里塞 7 万多 token 的上下文,远超日常聊天内容。
长上下文是编程场景的标配,也是推理成本的最大头。智谱和中科加禾的研究成果:把 KV 缓存分拆,可以把单个推理服务的吞吐随长程任务增长最高提升 132%。另一项叫 ZCube 的网络架构改造,让整个生产集群吞吐量提升 15%,同时把交换机和光模块需求砍掉三分之一。
132% 和 15%——这两个数字看起来不大。放大到 1GW 机房、每天百亿 token 的规模,每提升 1% 都是天文数字。一位投资人告诉《晚点 LatePost》:1% 的效率提升放在大规模部署的算力设备中,节省下来的钱也是天文数字。
这就是智谱的第一条防线:硬件难扩时,工程师红利。
高速版 API:把"不够快"变成"够快"
5 月下旬,智谱推出了高速版 API,每秒生成 token 数达到 400,相比常规 API 服务速度提升约 8 倍。这个数字在 Anthropic、OpenAI 面前不算炸裂——但它的含义不一样:
即使是高速版 API 的 400 tokens/s,按照 8 卡 H200 服务器的内存带宽计算,也只用到硬件理论能力上限的四成。
四成。意思是——留给 Infra 优化的空间还有一半以上。一位行业人士估算,大模型 Infra 每轮优化仍有 15% 到 30% 的效率提升空间。对智谱来说就更是如此,它本来就不以 Infra 优化见长。
TileRT 团队(来自和 TileLang 同源的清华系)把 MiMo-V2.5-Pro 这个 1 万亿参数的模型速度推到了 1000 token/s。同一个团队也给智谱的高速版 API 提供了底层支持——梁文锋那份广为流传的内部讲话里,TileLang 被认为有潜力打破英伟达的 CUDA 垄断。这不是巧合:中国大模型公司在编译器层面的追赶速度,比硬件层面的追赶速度快一个数量级。
GLM-5.2 的架构改动几乎都围绕推理成本设计。公开的技术报告显示,IndexShare 通过复用稀疏注意力层的索引器,把百万 token 场景下单位 token 的计算量降低 2.9 倍;改进后的 MTP 草稿层接受长度提升 20%,生成速度随之快约两成。后训练阶段重新采用 PPO,配套的 SAO 异步方法让训练步数从行业普遍崩溃的 160 步稳定跑到 1000 步;自研框架 slime 能在约两天里把十几个专家模型合并成一个。
模型、编译器、硬件开始重新耦合。 这是 TileRT 在与智谱合作的博客上写下的下一阶段任务。三件事以前各干各的,现在必须一起调,才能跑出极致效率。
毛利率 50%-60%:卖 token 第一次是好生意
把这些优化结果换算成商业语言:
| 厂商 | API 静态毛利率 | 备注 |
|---|---|---|
| Anthropic | > 80% | SemiAnalysis 估算 |
| DeepSeek | 70%-80% | The Information 独家 |
| 智谱 | 50%-60% | 晚点 LatePost 了解,理想状况 + 自有算力 |
把这张表展开成更直观的视角——

注意——智谱的数字是**"理想状况下,于自有算力设施上运转时"**才达到的。如果算力外采,毛利率直接腰斩。这就是智谱宁愿花数亿港元收购中科加禾、自建 1GW 机房的真实原因:不是为了炫技,是为了把毛利率的命根子捏在自己手里。
账是这样算的:智谱 API 混合价格约 8.8 元/百万 token(按输入:缓存命中:输出 = 7:2:1 计算),显著低于美国同性能模型。Kimi 更激进,K3 的输出价 15 美元/百万 token,与 Claude Sonnet 5 标准定价一模一样。但 Kimi 不卖得便宜——它卖得"和最贵的一样贵"。这是窗口期的另一个信号:模型领先才有定价权。
智谱 2025 年报披露过一个反直觉数据:定价提高一倍,调用量反而涨八倍。 与海外前沿模型的价差也在逐渐缩小。这不是价格战,是定价权——只有当你的模型足够好、你的 Infra 足够省时,你才有底气一边涨价一边涨量。
窗口期,和它的另一面
但故事讲到这儿,不能只讲一半。
大模型的机会正在重新回到创业公司手里——半年多前这一切还难以想象。 智谱估值破万亿港元,相当于两个小米、四个百度。Kimi 估值徘徊在 30 亿美元左右,阿里发布 Qwen3.8-Max 后港股当天涨 7%,市值重回 2.4 万亿港元。
窗口期来自编程。Coding 浪潮把按 token 计费的需求真正引爆,算账的方式彻底改变了。智谱比所有人都早看出来这点——它的 MaaS 开放平台域名 bigmodel.cn 早在 2022 年 ChatGPT 发布之前就注册了,是中国最早喊出"模型即服务"的公司。
但智谱失误的地方也在于没有在更早以更合适的价格锁定更多算力。 哪怕拿不出最先进的模型,仅仅有能立刻使用的算力,转租出去同样是好生意。马斯克就是这么做的。
窗口期的另一面是大厂的缺位。在长达半年的时间里,BAT 拿不出一个第一梯队的 coding 模型——2 月时,人们津津乐道的叙事甚至还是春节红包大战。而字节已经宣布不做蒸馏,等于亲手放弃了短期内快速追赶前沿模型的机会。
但窗口期不会一直敞开。 对没有历史包袱的独立模型公司来说,更容易跟上新技术是优势,但这是一场关于速度的一遍遍重复的竞赛。大厂只要赢一次,整个叙事就可能重新改写——字节在视频模型上已经拿出了 SOTA 成果,如今它们对 Coding 的投入已肉眼可见地坚定。
C 端的战场看上去更是早已与独立模型厂商无关:豆包砸出了国民级的用户量,但字节每天都在以千万计地亏钱。免费换规模的移动互联网打法,在大模型时代找不到盈利闭环。
卖 token 的下半场
回到开头那两个数字:700 万 API 用户、5 万块国产算力芯片。它们挨在一起出现,恰好说明了一个拐点:中国的大模型公司,第一次把"算力-模型-商业"三个环节同时打通了。
不是模型最强——GLM-5 全球第四,前面还有 Claude 和 GPT-5.2。 不是算力最多——1GW 机房在英伟达面前是个零头。 不是融资最大——智谱的市值只是字节的零头。
但智谱是**第一家把"算力紧缺"这个硬约束变成"卖 token 是一门好生意"**的中国公司。它的优势不是某一项领先,是 Infra 优化、自有算力、模型领先、定价权这四件事同时咬合——任何一件单独拿出来都不够硬,四件一起咬住,就有了抵抗大厂碾压的厚度。
投资人会问:这套打法能撑多久?答案藏在两个数据里——
7 月中旬 Kimi 发布 K3 时,智谱 API 用户增长情况几乎没有受到影响,ARR 增速也没有放缓。当下的时间点,每一个模型厂商的增长都不是以别家的萎缩为代价。
一位投资人透露,智谱年底预期 ARR 来到 20 亿美元,但智谱官方已经否认,接近公司的人表示,实际数字应该更高。
Token 是一个纯粹的增量市场。前提是:模型领先、Infra 够快、算力在自己手里。
这三件事,智谱都做到了。
参考资料:
- 《晚点独家丨智谱 API 用户数近 700 万,新启用超 5 万块国产算力芯片》,晚点 LatePost,2026-08-10
- 《智谱的算力野望浮出水面:自建 1GW 机房、数亿收购中科系 Infra 企业、布局自研芯片》
- 智谱 GLM-5.2 技术报告,https://z.ai/blog/glm-5.2
- 中国首个十万卡集群落成,全国产算力支撑"十万卡时代"
- SemiAnalysis 估算 / The Information 独家报道(Anthropic、DeepSeek 毛利率)