大模型真正缺的不是参数——Macaron-V1 走通了「持续学习」最难的一步
Published on 2026-07-24
Mind Lab 用 Mixture-of-LoRA 把持续学习这条路走通了:在万亿基座上跑 LoRA 强化学习,算力只要全参数的十分之一;198 个小模块投票让数学基准准确率从 36.4% 涨到 48.7%。下一代模型的胜负手,不再是基座能堆多大,是经验能不能便宜地写回参数。

大模型真正缺的不是参数——Macaron-V1 走通了「持续学习」最难的一步
2026 年 7 月 23 日,Mindverse 旗下研究实验室 Mind Lab 开源了 Macaron-V1。表面看,这又是一份「国产团队又发了个大模型」的新闻稿。但读完技术博客后你会意识到,这件事真正的分量不在参数,而在它解决了一个困扰整个行业好几年的问题:大模型部署上线之后,怎么把新的经验低成本地写回参数里。
梁文锋前阵子内部交流说过一句话:「AI 现在不缺品味和直觉,缺的是持续学习的能力,能让模型持续学习才算得上下一代模型。」Macaron-V1 是目前公开材料里,把这条路走得最远的一次。
持续学习为什么是真痛点
任何用过 LLM 的人都熟悉这种挫败感:你纠正一个助手十次「别用『此外』开头」,第十一次它又回来了。你告诉智能体一个流程,它在同一个步骤上反复栽跟头,而这些失败永远不会自然变成它的新本事。
根源在于,大模型一旦训练完成、部署上线,参数基本就定格了。它每天处理海量真实请求,可这些请求里蕴含的新经验、纠正、偏好,几乎不会回流到模型本身。模型像一个记性很好的厨师,但你每次点同一道菜,他都要从头尝一遍咸淡——因为他从来没把「上次偏咸」这条便签贴到厨房墙上。
补这条短板,过去能走两条路。
一条不动参数,把经验放进上下文:提示词、记忆、检索、外部技能都算。这条路胜在灵活,代价是经验始终存在模型之外,每次用都要重新读一遍,越攒越贵。而且放进上下文不等于学会,模型的天花板没动。
另一条是写进参数。代价最高,但理论上最彻底:让模型直接内化经验,下一次遇到相似任务不必重读全部历史。
问题在于,千亿、万亿参数的全量重训成本高到基本没法经常做。这是过去几年「持续学习」始终停留在论文阶段、从未真正落地的根本原因。
**LoRA 早期被当成「省显存的妥协」,是没钱做全量微调时的廉价替代品,能力要打折扣。**这个印象在很多团队脑子里留到今天。但 Macaron-V1 这条路线,把 LoRA 重新定义成了一块承载个性的持久状态——一个会随交互不断演化的记忆。这是它故事真正开始的地方。
过去为什么做不到:成本门槛
要让大模型在部署后持续学习,至少要同时满足三件事:训练成本要低到可以经常做;写新经验不能把旧能力覆盖掉;配套工程要能管住大规模小模块的版本、评估、回滚。
前两件事,过去几年卡住了整个学界。
LoRA(Low-Rank Adaptation)最早是给监督微调用的省显存技巧:把一个庞大的权重矩阵拆成两个低秩小矩阵,只训小矩阵,主参数冻住。它的能力上限一直有争议——很多团队试过,发现只更新一小块参数,模型表现会出现明显的折扣。
更关键的问题是:LoRA 能不能扛住强化学习这种更复杂的训练?监督微调是「喂数据」,强化学习是「边试边学」,对参数扰动的容忍度完全不一样。这个问题的科学结论,直到 2025 年才由 Thinking Machines Lab 给出:只要 LoRA 覆盖到包含前馈层和专家层在内的所有层、且不超过它的容量,它在监督微调和强化学习上都能追平全参数微调;强化学习对秩的要求还更低。
Mind Lab 把这件事推到了万亿规模。
他们在 Kimi K2(总参约 1.04 万亿、单次激活约 326 亿)上端到端跑通了 LoRA 强化学习,算力开销约为全参数强化学习的十分之一,训练曲线平稳上升,没有出现灾难性发散。还配套把训练框架的补丁并入几个主流开源训练项目的上游,基础设施部分以 verl-mint 的名字开源。
**「十分之一」这个数字,比 Macaron-V1 本身的模型更要紧。**它意味着「把一次新经验写回参数」这件事,从一件偶尔为之的重活,变成了可以经常做的常规操作。门槛被一脚踹掉之后,剩下的事才有戏。
Macaron-V1 怎么把这事做出来
Macaron-V1 是上面这套思路的直接落地。它的架构叫 Mixture-of-LoRA:在冻结的 744B GLM-5.2 基座上,挂四个各 10 亿参数的 LoRA 专家,分别管理不同环节——

