强化学习之父亲自拆台:大模型路线,正卡在"出生那一刻"
发布于 2026-08-28
强化学习之父、图灵奖得主 Rich Sutton 在红杉访谈里把自己写的《苦涩的教训》拿来打脸——他认为今天的大模型可能被「训练—冻结—上线」这条范式卡死,行业已陷入局部最优。Sutton 和学生 Khurram Javed 创办的 Oak Lab 想做的,是模型上线以后还能继续学习的 AI。
强化学习之父亲自拆台:大模型路线,正卡在"出生那一刻"
Rich Sutton 在红杉访谈里,把自己写的《苦涩的教训》拿来打自家脸。下一种 AI 不是更大的模型——是能持续学习的智能体。但 OpenAI 和 Anthropic 已经不敢跟。
2026 年 8 月,强化学习之父、图灵奖得主 Rich Sutton 在红杉资本的一次访谈里,扔出一句让整个 AI 圈都会愣一下的话(来源:硅基君报道 2026-08-27):
大语言模型既可能是《苦涩的教训》最成功的案例,也可能同时是它的反面案例。
《苦涩的教训》是谁写的?Sutton 自己。2019 年那篇著名短文的核心一句话:别往机器里塞人类的聪明,多花点时间找能跟着计算规模一起扩展的学习方法。过去几十年的 AI 历史几乎全在为这句话站台——AlphaGo、深度学习、大语言模型,每一波都赢了那些"专家规则派"。
现在 Sutton 本人站到台前,反过来给今天的 LLM 路线挑刺。他不是否定 LLM 的成功——他强调这是"惊人的科学突破"。他否定的是另一件事:"训练—冻结—上线"这条范式本身可能已经走到局部最优。
大模型的毕业典礼,把学习者也封死了
Sutton 把今天的大模型比作一个"刚毕业就被冻结的大脑"。训练阶段疯狂学;训练一结束,核心权重就被锁死。它之后能给用户提供几年的服务,靠的不是再学习,而是翻当年的毕业笔记——Context 窗口塞一塞、Memory 里翻一翻、RAG 里查一查。
这和真正的人不一样。一个医生做了 1000 台手术之后,他看片子的方式、他对并发症的直觉、他判断是否该开刀的阈值,全都因为这件事变了。一个司机开了 10 年车,他甚至不需要刻意思考,就知道旁边那辆车可能要加塞。经验变成结构、结构留在身体里。今天的大模型,结构留在参数里没动,用户和它聊一亿次,结构基本还是老样子。
Sutton 给出的判断很直接:他认为今天的大模型行业可能陷入了局部最优。继续堆 GPU、做 Scaling,性能还能涨,所以头部实验室越来越难转向一条短期表现可能更差的新路线。
这就把一件行业里大家不愿意说破的事摆到台面:今天 AI 公司的整个商业模式都建立在"训练完就发货"上面。你能想象 OpenAI 在 ChatGPT 后台每天偷偷更新一次权重吗?不能——不是不能,是因为动了权重,第二天五亿用户里只要有一个小孩发现"昨天能做的事今天做不了",就是公关事故。
合成数据救不了 Scaling,因为瓶颈还是人
"互联网高质量数据快耗尽了怎么办?"这是 2025 年以来所有大模型公司最焦虑的问题之一。流行的答案是合成数据——让模型自己生成训练数据。
Sutton 的评价非常不客气:"这会是一个大错误。甚至可能成为下一条'苦涩的教训'。"
他讲的是一个很朴素的道理:合成数据看起来摆脱了真实数据的限制,但背后藏着一个人类瓶颈——谁决定什么数据值得生成?谁判断什么问题重要?谁定义奖励? 绕一圈,决策权还是回到人手里。只要合成数据的"生成清单"仍然需要人类决定,这条路线的扩展速度就依然受制于人类知识。
Sutton 背后支撑这个判断的是 Big World Hypothesis(大世界假说):现实世界比任何一个智能体复杂。它比互联网大,比人类语言大,比任何人记录过的所有数据都大。AlphaGo 之所以下棋赢了,因为围棋规则已经被定义清楚。开放世界里一架无人机真正飞起来会遇到的风、摩擦、马达误差、障碍物,是模拟器里没出现过的细节。这些东西不可能在模型上线前全部写进训练集。
续学习为什么这么难?毁掉旧能力,1 次更新就够
既然持续学习这么符合直觉,为什么不让大模型每天更新一次权重?
Sutton 知道这条路:这就是 Continual Learning 学术界研究了多年的灾难性遗忘(Catastrophic Forgetting)。
打个比方。今天你告诉模型:"我们公司的内部项目 X,以后统一叫 Apollo。"模型根据这一条数据更新权重。看起来没问题。但神经网络里的知识不是一行行独立写的——一个权重变化,会同时影响很多过去已经学好的能力。结果 Apollo 记住了,"猫"的某条隐含规则可能被搞坏。