CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环
发布于 2026-08-11
CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环 2026 年 7 月 28 日,美团 LongCat 团队发布了 CatPaw —— 一个号称"全场景 AI Agent 平台"的产品。 大多数媒体的标题立刻打上了"搭载 LongCat 2.0 万亿参数模型"、"五万张国产算力卡全流程训练"这些标签。朋友圈里转发的画风,跟你过去两年见过的每一个大模型发布会差不多:参数大、能力强...

CatPaw 看着像 Agent 平台,但美团真正的护城河是评测闭环
2026 年 7 月 28 日,美团 LongCat 团队发布了 CatPaw —— 一个号称"全场景 AI Agent 平台"的产品。
大多数媒体的标题立刻打上了**"搭载 LongCat 2.0 万亿参数模型"、"五万张国产算力卡全流程训练"**这些标签。朋友圈里转发的画风,跟你过去两年见过的每一个大模型发布会差不多:参数大、能力强、生态开放。
但我想聊点不一样的。
如果你只盯着 LongCat 2.0 的 1.6T 参数去看 CatPaw,你会错过美团这盘棋里最关键的那颗子。
9 万员工、3 万个 Agent,藏着什么秘密?

先看两组实数:CatPaw 已经覆盖美团内部 9 万员工,平台上搭建的 Agent 数量突破 3 万个(来源:美团技术博客 2026-07-28《CatPaw 发布》)。
9 万员工什么概念?这不是一个部门试点,不是几百人的灰度测试。这是接近全公司铺开的规模。
3 万个 Agent 又意味着什么?意味着每天有大量非技术背景的业务人员 —— 运营、客服、BD、供应链 —— 在拖拽配置、描述需求、上线数字员工。这不是技术部门自嗨的工具,是业务部门在拿它干活。
这里藏着一个绝大多数 AI 公司不敢面对的问题:Agent 不是"做出来就行",是"放出去之后还能不能活着"。
一个 Agent 在开发环境里表现完美,到了真实业务场景直接翻车 —— 这种事我见过太多次了。文件格式换了、API 接口超时了、用户问话的方式换了种说法,Agent 就开始抽风。更可怕的是,你根本不知道它什么时候会抽风,也不知道为什么抽风。
美团的解法,藏在他们 8 月 7 日发布的另一篇文章里 —— 《Agent 评测漫谈》。
两篇文章发布时间相差 10 天。CatPaw 告诉你"我们能做 Agent",评测文章告诉你"我们能保证 Agent 不乱来"。后者才是企业级 AI 落地的真正门槛。
评测四层框架,为什么比模型参数重要一百倍?
美团 Agent 评测团队提出的四层框架很直接:结果层、过程层、效率层、风险层(来源:美团技术博客 2026-08-07《Agent 评测漫谈》)。

绝大多数 AI 公司评估 Agent 只看结果层 —— 任务完成了没有,答案对不对。但美团的团队看得更细:
- 过程层:你完成任务的方式对不对?是不是绕了弯路?调用了不该调用的工具?多花了不该花的钱?
- 效率层:耗时多少?Token 消耗多少?在 7×24 小时不间断运行的场景下,慢一秒和快一秒,对成本和用户体验的影响是指数级的。
- 风险层:有没有泄露数据?有没有误操作?在沙箱隔离的环境里,有没有试图越权?
这才是 ToB 场景下真正的"能不能用"。
我举个具体的例子。一个外卖客服 Agent,它的任务是帮用户处理退款。最终结果是"退款成功",结果层看起来完美。
但如果过程层显示,这个 Agent 在拿到退款请求后,先是查了三遍订单状态(因为前两次没理解接口返回的数据格式),然后误调用了骑手定位接口,最后才正确触发了退款流程 —— 这个 Agent 就不能上线。
原因很简单:你额外消耗的算力成本、响应延迟、对无关系统的无效调用,在日均百万订单的量级下会被放大到无法承受。
"看不见的问题,几乎不可能被稳定解决。" 这是美团评测团队的原话,我觉得这是 2026 年到目前为止,AI 工程化领域最值得被打印出来贴在墙上的句子之一。
