CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环
胡新宇
发布于 2026-08-11
CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环 2026 年 7 月 28 日,美团 LongCat 团队发布了 CatPaw —— 一个号称"全场景 AI Agent 平台"的产品。 大多数媒体的标题立刻打上了"搭载 LongCat 2.0 万亿参数模型"、"五万张国产算力卡全流程训练"这些标签。朋友圈里转发的画风,跟你过去两年见过的每一个大模型发布会差不多:参数大、能力强...

CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环
2026 年 7 月 28 日,美团 LongCat 团队发布了 CatPaw —— 一个号称"全场景 AI Agent 平台"的产品。
大多数媒体的标题立刻打上了**"搭载 LongCat 2.0 万亿参数模型"、"五万张国产算力卡全流程训练"**这些标签。朋友圈里转发的画风,跟你过去两年见过的每一个大模型发布会差不多:参数大、能力强、生态开放。
但我想聊点不一样的。
如果你只盯着 LongCat 2.0 的 1.6T 参数去看 CatPaw,你会错过美团这盘棋里最关键的那颗子。
9 万员工、3 万个 Agent,藏着什么秘密?

先看两组实数:CatPaw 已经覆盖美团内部 9 万员工,平台上搭建的 Agent 数量突破 3 万个(来源:美团技术博客 2026-07-28《CatPaw 发布》)。
9 万员工什么概念?这不是一个部门试点,不是几百人的灰度测试。这是接近全公司铺开的规模。
3 万个 Agent 又意味着什么?意味着每天有大量非技术背景的业务人员 —— 运营、客服、BD、供应链 —— 在拖拽配置、描述需求、上线数字员工。这不是技术部门自嗨的工具,是业务部门在拿它干活。
这里藏着一个绝大多数 AI 公司不敢面对的问题:Agent 不是"做出来就行",是"放出去之后还能不能活着"。
一个 Agent 在开发环境里表现完美,到了真实业务场景直接翻车 —— 这种事我见过太多次了。文件格式换了、API 接口超时了、用户问话的方式换了种说法,Agent 就开始抽风。更可怕的是,你根本不知道它什么时候会抽风,也不知道为什么抽风。
美团的解法,藏在他们 8 月 7 日发布的另一篇文章里 —— 《Agent 评测漫谈》。
两篇文章发布时间相差 10 天。CatPaw 告诉你"我们能做 Agent",评测文章告诉你"我们能保证 Agent 不乱来"。后者才是企业级 AI 落地的真正门槛。
评测四层框架,为什么比模型参数重要一百倍?
美团 Agent 评测团队提出的四层框架很直接:结果层、过程层、效率层、风险层(来源:美团技术博客 2026-08-07《Agent 评测漫谈》)。

绝大多数 AI 公司评估 Agent 只看结果层 —— 任务完成了没有,答案对不对。但美团的团队看得更细:
- 过程层:你完成任务的方式对不对?是不是绕了弯路?调用了不该调用的工具?多花了不该花的钱?
- 效率层:耗时多少?Token 消耗多少?在 7×24 小时不间断运行的场景下,慢一秒和快一秒,对成本和用户体验的影响是指数级的。
- 风险层:有没有泄露数据?有没有误操作?在沙箱隔离的环境里,有没有试图越权?
这才是 ToB 场景下真正的"能不能用"。
我举个具体的例子。一个外卖客服 Agent,它的任务是帮用户处理退款。最终结果是"退款成功",结果层看起来完美。
但如果过程层显示,这个 Agent 在拿到退款请求后,先是查了三遍订单状态(因为前两次没理解接口返回的数据格式),然后误调用了骑手定位接口,最后才正确触发了退款流程 —— 这个 Agent 就不能上线。
原因很简单:你额外消耗的算力成本、响应延迟、对无关系统的无效调用,在日均百万订单的量级下会被放大到无法承受。
"看不见的问题,几乎不可能被稳定解决。" 这是美团评测团队的原话,我觉得这是 2026 年到目前为止,AI 工程化领域最值得被打印出来贴在墙上的句子之一。
评测闭环,才是规模化 Agent 的燃料
美团提出的 Agent 研发公式是:观测 + 评测 = 持续迭代。
听起来很简单对吧?但执行起来重量完全不同。

CatPaw 平台上 3 万个 Agent,每一个都在产生行为日志。9 万员工的每一次交互、Agent 的每一次工具调用、每一个任务链路,都在被观测。观测到的数据回流到评测体系,评测结果指导模型优化和 Agent 策略调整。
这是一个闭环。不是"做一次评测报告,然后束之高阁"的那种假闭环,是每天、每小时、每分钟都在运转的真闭环。
我测算一下这个数据飞轮的规模(保守估计):3 万个 Agent,假设平均每天每个 Agent 执行 50 次任务,一天就是 150 万次 Agent 任务执行。每一次执行都在同时产出四层数据 —— 结果正确性、过程合理性、效率指标、风险标记。
150 万个真实的、来自业务一线的、被完整观测的 Agent 执行案例。每天。
全中国还有哪家公司有这个数据量?字节可能接近,阿里可能在做,但美团现在的先发优势是实打实的。
LongCat 2.0 的真正价值是什么?
回到 LongCat 2.0。1.6T 总参数、动态激活 33B-56B、原生 1M 上下文、五万张国产算力卡全流程训练(来源:美团 LongCat 2.0 开源公告)—— 这些数字当然重要。
但 LongCat 2.0 的真正价值不是"模型很强",而是它在 CatPaw 的评测闭环里被持续调优。
一个万亿参数模型,如果只是"训完就发布",它的上限就是训练数据的上限。但如果它接入了一个 9 万员工、3 万 Agent 的实时反馈系统,它的进化速度就完全不同。
评测闭环发现的"过程层问题"会反哺到模型微调,风险层的异常案例会进入安全对齐训练,效率层的瓶颈会驱动推理框架优化。这才是 LongCat 2.0 相比 GPT 类闭源模型的差异化优势 —— 不是架构更先进,是它跑在自己的数据飞轮上。
这也能解释为什么美团愿意公开 LoHoSearch 基准 —— 一个基于 762 万维基实体知识图谱、544 道人工核验题目的评测工具(来源:美团 LongCat LoHoSearch 文章 2026-07-24)。他们在文章里直接写:"已评测模型中,GPT-5.5 准确率仅 34.74%。"
这不是在炫耀自己比别人强,是在告诉外界:我们有办法精确地测量"差距在哪儿"。 而精确测量差距的能力,本身就是天花板。
这个局,别家用嘴,美团用手
CatPaw 发布了之后,很多人说"这不就是美团的 Agent 搭建平台吗,跟 Coze、Dify 差不多"。
我觉得这种类比完全搞错了重点。
Coze、Dify 解决的是"让 Agent 搭起来更容易"。CatPaw 解决的是"让 Agent 搭完之后,不会在生产环境里炸掉"。
这是两个完全不同的产品逻辑。前者追求的是降低创建门槛,后者追求的是建立运维保障。前者面向 Demo 和 PoC,后者面向真实业务。
评测闭环才是 CatPaw 最难被复制的东西。 因为评测闭环的核心不是技术架构,不是算法论文,不是开源代码 —— 是 9 万人用出来的行为数据、业务场景中的真实边界、在真实风险中交过的学费。
你可以花钱买五万张国产算力卡,但你现在花钱也买不到 3 万个 Agent 跑两年沉淀下来的评测元数据。
模型会成为基础设施,但"在真实场景中稳定交付 Agent"的能力,才是定价权。
这才是美团 CatPaw 这盘棋里的真正落子。评测闭环开源不了 —— 它要靠真实业务喂两年。