万亿参数是行业走过的弯路——唐杰这番话,撕开了 Scaling Law 的另一面
胡新宇
发布于 2026-08-21
智谱唐杰公开承认万亿参数是行业弯路,GLM-5.3 用同架构+一个月后训练取得显著提升。这是 Scaling Law 真正的拐点。

万亿参数是行业走过的弯路——唐杰这番话,撕开了 Scaling Law 的另一面
2026 年 8 月 19 日下午,智谱首席科学家唐杰在 X 平台发了一篇长文,核心只有一句:万亿参数,是整个行业一起走过、又一起折返的弯路。
同一天,智谱把 GLM-5.3 的训练方法摆上桌面——模型架构和参数量与 5.2 完全一致,只用一个月扩大长程任务环境与强化学习训练,"得到的提升不是小幅改进"。
这是 2026 年大模型圈第一份带产品对照的反共识判决书。
一、万亿参数,三年弯路
2020 年,Kaplan 等人拟合出一条扩展规律:参数规模应以 0.73 的指数增长,数据规模以 0.27 的指数增长。换句话说,参数先跑,数据跟上。
GPT-3、Gopher、MT-NLG,全部按这条曲线往万亿参数冲。整个 2020 到 2022,行业把"参数量"当成头号指标。
2022 年,Hoffmann 团队重新跑了 400 个模型,给出 Chinchilla 结论:每个参数对应 20 个 token 是计算最优配置。当时参数量与数据量的最优增速应该接近,不是拉开差距。
唐杰把这件事写进反思里:"早期拟合中的误差,会随着计算量每提高一个数量级继续放大。那一代规模最大的模型,也成为计算资源分配最不合理的模型。"(来源:智东西 2026-08-19 编译唐杰 X 原文)
错三年,比错三个月成本大得多——这就是大模型的"机会成本"。

二、Chinchilla 不是终点
Chinchilla 只优化了训练阶段。模型只训练一次、然后被评估,这套假设在 2022 年成立。
2026 年不成立。一个模型每天被调用几十亿次,推理成本压过训练成本,变成主要支出项。
Llama-2-7B 每个参数平均对应 290 个训练 token,Gemma-2-9B 是 889 个,都远超 Chinchilla 的 20:1 比例(来源:智东西 2026-08-19 编译)。
这不是"违规",是有意为之的过度训练。把模型调小,让同一个参数被反复蹂躏——你以为是模型变小了,其实是模型变"胖"了。
这条路还有另一个名字,叫 Inference-aware Scaling。训练时间翻倍、参数量减半,整体生命周期成本反而下降。
三、MoE 撕开了"双指标"陷阱
MoE(混合专家)模型普及后,"参数量"这个词需要拆成两个看:
- 总参数量:决定模型能装多少知识——包括事实信息和长尾内容
- 激活参数量 + 有效计算深度:决定模型能完成多长的推理链
稠密模型里"每个参数 20 个 token"的比例,套不到 MoE 上。
Roberts 等人在 2025 年的研究给出一个反直觉结论:Token 参数比不变的情况下,继续增加总参数量反而可能削弱推理能力;而增加每次激活的专家数量,能更稳定地改善推理表现(来源:智东西 2026-08-19 编译)。
记忆和推理不是一回事。你记不住整个图书馆,但你可以推导出勾股定理。
GLM-5.3 的实验方向,正是把资源从"我能装多少"挪到"我能想多深"——这和"加参数堆知识"是完全不同的两条路。
