万亿参数是行业走过的弯路——唐杰这番话,撕开了 Scaling Law 的另一面
胡新宇
Published on 2026-08-21
智谱唐杰公开承认万亿参数是行业弯路,GLM-5.3 用同架构+一个月后训练取得显著提升。这是 Scaling Law 真正的拐点。
Loading...
胡新宇
Published on 2026-08-21
智谱唐杰公开承认万亿参数是行业弯路,GLM-5.3 用同架构+一个月后训练取得显著提升。这是 Scaling Law 真正的拐点。

2026 年 8 月 19 日下午,智谱首席科学家唐杰在 X 平台发了一篇长文,核心只有一句:万亿参数,是整个行业一起走过、又一起折返的弯路。
同一天,智谱把 GLM-5.3 的训练方法摆上桌面——模型架构和参数量与 5.2 完全一致,只用一个月扩大长程任务环境与强化学习训练,"得到的提升不是小幅改进"。
这是 2026 年大模型圈第一份带产品对照的反共识判决书。
2020 年,Kaplan 等人拟合出一条扩展规律:参数规模应以 0.73 的指数增长,数据规模以 0.27 的指数增长。换句话说,参数先跑,数据跟上。
GPT-3、Gopher、MT-NLG,全部按这条曲线往万亿参数冲。整个 2020 到 2022,行业把"参数量"当成头号指标。
2022 年,Hoffmann 团队重新跑了 400 个模型,给出 Chinchilla 结论:每个参数对应 20 个 token 是计算最优配置。当时参数量与数据量的最优增速应该接近,不是拉开差距。
唐杰把这件事写进反思里:"早期拟合中的误差,会随着计算量每提高一个数量级继续放大。那一代规模最大的模型,也成为计算资源分配最不合理的模型。"(来源:智东西 2026-08-19 编译唐杰 X 原文)
错三年,比错三个月成本大得多——这就是大模型的"机会成本"。

Chinchilla 只优化了训练阶段。模型只训练一次、然后被评估,这套假设在 2022 年成立。
2026 年不成立。一个模型每天被调用几十亿次,推理成本压过训练成本,变成主要支出项。
Llama-2-7B 每个参数平均对应 290 个训练 token,Gemma-2-9B 是 889 个,都远超 Chinchilla 的 20:1 比例(来源:智东西 2026-08-19 编译)。
这不是"违规",是有意为之的过度训练。把模型调小,让同一个参数被反复蹂躏——你以为是模型变小了,其实是模型变"胖"了。
这条路还有另一个名字,叫 Inference-aware Scaling。训练时间翻倍、参数量减半,整体生命周期成本反而下降。
MoE(混合专家)模型普及后,"参数量"这个词需要拆成两个看:
稠密模型里"每个参数 20 个 token"的比例,套不到 MoE 上。
Roberts 等人在 2025 年的研究给出一个反直觉结论:Token 参数比不变的情况下,继续增加总参数量反而可能削弱推理能力;而增加每次激活的专家数量,能更稳定地改善推理表现(来源:智东西 2026-08-19 编译)。
记忆和推理不是一回事。你记不住整个图书馆,但你可以推导出勾股定理。
GLM-5.3 的实验方向,正是把资源从"我能装多少"挪到"我能想多深"——这和"加参数堆知识"是完全不同的两条路。

唐杰公布的数据很克制:模型架构不变、总参数量不变、激活参数量不变,仅用一个月扩大长程任务环境与强化学习训练。
"得到的提升不是小幅改进"——这是他对结果的描述(来源:智东西 2026-08-19)。
对照样本同样出自 8 月 19 日:快手财报披露可灵 AI 二季度营收 8.5 亿元、同比增长 200%(来源:https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&mid=2652808895&idx=3&sn=5ca53143f4802a6e3a2d7f8b21a9c75e)。
参数堆到 1.8 万亿的还在算训练成本,视频模型已经在算 ARR。这两条曲线在同一天发车,分叉看得清清楚楚。
回头看,押注万亿参数的不只是技术选择,也是商业选择。把"参数量"写进 PR 通稿、把"模型大小"塞进路演 PPT,整条产业链——算力供应商、GPU 厂商、CDN 服务商——都吃到过规模扩张的红利。
2026 年,行业开始承认"这条路走完了"——或者说,这条路的边际收益开始低于新路线。
得物、Vercel、Cursor 都已经不靠"我的模型更大"打市场,开始靠"我的工程链路更短"卖货。这不是技术问题,是商业判断先到位了。
Scaling Law 没有死,"参数唯一论"该埋了。
下一个万亿参数的故事,可能要等下一代模型才能讲出来。但 Scaling 的故事,才刚刚开始讲更多。
局限说明:本文核心论据来自智谱一家的公开发言与产品选边,属于行业观点而非行业共识。Kaplan、Hoffmann、Roberts 三组数据已注明原始来源,未引用具体 OpenAI/Anthropic 官方表态——他们没公开认账,但 Llama-2/Gemma 的过度训练路线已经隐含承认。