「会不会被封」成了模型选型的第一指标
胡新宇
Published on 2026-08-11
美团把竞品的封号记录写进了自家技术文档。当谷歌和 Anthropic 相继收紧第三方调用,模型选型的第一指标正从跑分转向可用性。

「会不会被封」成了模型选型的第一指标
美团在自家技术博客里,记了一笔竞争对手的账。谷歌以「恶意使用」为由,大规模封禁通过 OpenClaw 路由 Gemini token 的账号;Anthropic 随后更新使用条款,禁止开发者通过第三方工具调用 Claude 的 OAuth token(来源:美团技术团队 tech.meituan.com/2026/03/09/LongCat-OpenClaw.html)。
这两句话写在一篇讲模型提速的文章开头。速度只是引子,美团在推销的是另一件事。他们卖的是「你的账号明天还在」。
封号记录被写进了对手的产品文档
厂商文案里出现竞品的封号细节,说明供应稳定性已经从运维话题变成了销售话题。
OpenClaw 在 GitHub 上拿到 23 万多 Stars(来源:美团技术团队博客)。这批用户里有相当一部分,把第三方订阅当成了长期基础设施来用——脚本挂在 CI 里,交付时间已经报给客户。谷歌和 Anthropic 的两次动作,把这些人的工作流一次性打回原形。
被封的人损失的不是那几十美元订阅费。是排期。
模型能力可以替换,工作流被中断的成本不能。
跑分这张牌,美团只打了一半
LongCat-2.0 的参数表摆出来是唬人的:总参数 1.6T,每个 token 激活约 48B,原生支持 1M 上下文,最大输出 128K(来源:美团龙猫团队发布,2026-06-30)。
按国内发布会的惯例,接下来该贴满 SOTA 柱状图了。美团没这么干。
第三方实测把差距写得很直白:IFEval、GPQA-diamond 这类通用能力和知识推理项目,LongCat-2.0 落后于 Gemini 3.1 Pro 与 GPT-5.5;换到 Terminal-Bench 2.1 和 SWE-bench Pro 这类编程任务,它基本追平 Gemini 3.1 Pro;FORTE 通用 Agent 任务上,与 Claude Opus 4.6 五五开(来源:AI 沃茨实测,2026-07-01)。
一个肯承认自己通用能力落后的团队,往往对自己的位置想得更清楚。LongCat-2.0 的战场在 Agent 任务,不在聊天窗口。

图里右下角那块,是今天多数团队的处境:手上的模型够强,但供应方随时能改规则。美团选择去左上角,用能力上的让步换供应上的确定性。
1M 上下文是为 Agent 铺的路
长上下文这个卖点已经被喊烂了,值钱的是它在 Agent 任务里怎么用。Agent 干活要读代码库、翻文档、记住前面十几步操作,还要继续调工具。上下文一旦装不下,模型就得靠检索和摘要打补丁,错误在多步任务里逐层累积。
LongCat-2.0 为此改了注意力机制。LSA(LongCat Sparse Attention)由 Streaming-aware Indexing、Cross-Layer Indexing 和 Hierarchical Indexing 三个组件构成,分别处理连续访存、跨层复用和由粗到细的候选筛选,目标是压掉长上下文里的 indexer 开销(来源:美团龙猫团队发布)。1M 上下文的价值,在于能把代码库、文档、日志和历史交互塞进同一轮任务。
后训练阶段的拆法也是冲着 Agent 去的:Agent Experts 负责工具调用、API 参数解析和自我纠错,Reasoning Experts 强化数学与多跳推理,Interaction Experts 管指令跟随和幻觉抑制,最后用 MOPD 把这些能力融合回一个模型(来源:同上)。
这套结构解释了为什么它在 Terminal-Bench 上追得上,在 GPQA-diamond 上追不上。能力是照着使用场景挑出来的,不是均匀长出来的。
分量在五万卡那一行
难复制的数字在训练日志里:五万卡国产算力集群,连续训练一个多月,吃掉超过 35 万亿 tokens,全程无回滚,没有一次不可恢复的 loss 突刺(来源:AI 沃茨实测,2026-07-01)。
