1.91 分:自回归模型的 Agent 护城河,刚刚被一个能"回头改字"的模型填平了
发布于 2026-07-28
LLaDA2.2-flash 是 InclusionAI 开源的 100B MoE 扩散语言模型,在 7 个 Agent 基准上以 53.83 vs 55.74 接近自回归对照 Ling-2.6-flash,BF16 吞吐 1.64×。三层创新(莱文斯坦编辑 + L-EBPO + 块路由)让非自回归路线第一次拿到 Agent 时代的入场券。

1.91 分:自回归模型的 Agent 护城河,刚刚被一个能"回头改字"的模型填平了

你写代码的时候,自回归模型像一支只能往前写的笔。写错一个字,它要么涂掉重来,要么硬着头皮把错字当路标,继续往下编。
扩散语言模型不一样。它看见整段话,觉得第三句不通顺、第五句缺个主语,可以直接把第三句擦掉,在第五句前面补上一行。
三天前,InclusionAI 开源了 LLaDA2.2-flash,一个 100B 参数的 MoE 扩散语言模型。它在 7 个 Agent 基准上平均拿下 53.83 分,对标自回归模型 Ling-2.6-flash 的 55.74 分——差距仅 1.91 分。
非自回归模型做 Agent,第一次跑到了跟自回归模型几乎平起平坐的位置。
而它的 BF16 解码吞吐量,是对照模型的 1.64 倍。
不是追平,是"能编辑"在 Agent 场景里终于管用了
扩散语言模型不是新鲜概念。过去两年,它的画风一直是"文本生成能并行、速度快,但质量追不上自回归"。到 Agent 任务上,这个短板被放得更大——工具调用格式错一个括号,整个任务链条就断了。
LLaDA2.2 没去把扩散模型重新训成自回归。它干了一件更聪明的事:让模型学会编辑自己生成的草稿。

这就是他们塞进去的 莱文斯坦编辑。
上一代 LLaDA2.1 只能在固定位置替换 Token——相当于给你一本格子笔记本,你只能在已有格子里覆盖写字。LLaDA2.2 多了两个动作:DELETE 和 INSERT。看见冗余的整段删掉,发现缺东西的地方当场补上。
拿同一个基座模型做消融实验,只开关莱文斯坦编辑这一个变量:SWE-bench Verified 解决率从 35.8 跳到 44.4,绝对增益 8.6 个百分点。
这意味着什么?以前扩散模型生成 Agent 执行轨迹,一步走偏后面全歪。现在它能回头改——"刚才那个工具调用的参数给错了,删掉重新写"。
跟 ICML 2026 那篇《The Flexibility Trap》的工作刚好形成对照。那篇的思路是把容易走岔的路线收窄,让模型少犯错。LLaDA2.2 走的是另一条路:让你犯错,但给你一支能擦能改的铅笔。
