16,893 次会话之后,我们终于看清 Claude Code、Codex、Cursor 是怎么"挑工具"的
Published on 2026-09-08
16,893 次会话之后,我们终于看清 Claude Code、Codex、Cursor 是怎么"挑工具"的 2025 年 4 月,Vercel 公开了一个被当时多数人忽略的数字:超过 30% 的部署已经由 coding agent 发起,相比半年前涨了 1000%^F06。这一年里,这个数字被反复引用,也被多次复述。开发者工具的"被 Agent 选中",已经不再是边缘话题——但谁也没说清楚,Ag...
16,893 次会话之后,我们终于看清 Claude Code、Codex、Cursor 是怎么"挑工具"的
2025 年 4 月,Vercel 公开了一个被当时多数人忽略的数字:超过 30% 的部署已经由 coding agent 发起,相比半年前涨了 1000%1。这一年里,这个数字被反复引用,也被多次复述。开发者工具的"被 Agent 选中",已经不再是边缘话题——但谁也没说清楚,Agent 到底是怎么选的。
9 月 3 日,工程增长公司 Armature 公开了它们历时数月的一次实验结果:用 75 个真实风格的代码仓库、1,163 条提示变体、4 类工程师角色,让 Claude Code、Codex、Cursor 三个主流编程 Agent 实际动手实现——不是只给建议,而是真的把第三方依赖装进代码库并跑起来。整个实验跑了 16,893 次会话,剔除无效数据后保留了 5,292 次有效会话2。所有 trace、prompt、思考链、最终 code diff 都已公开,谁都可以复现。
这是一个有商业利益方的研究——Armature 自己做"帮 dev tools 被 Agent 选中"的增长服务3——但恰好因为全部 trace 公开,第三方可以独立验证,反而比很多"中立研究"更可信。下面这五个发现,是从 16,893 次会话里能直接读出来的结论。
一、三个 Agent 的"信息收集方式"根本不一样
把同一个"帮我选个数据库"的需求分别丢给 Claude Code、Codex、Cursor,三个 Agent 实际打开网页搜索的比例差异巨大4:
- Cursor 在约 2/3 的会话里依赖网络搜索,搜索是它的常规动作。
- Codex 在 94% 的会话里都用了 web search,但其中 9/10 的查询会用
site:操作符限定到特定域名(比如site:neon.tech)——它在用最精确的工具做最精确的搜索。 - Claude Code 只在 30% 的会话里搜 web,但搜一次平均浏览的页面数是 Codex 的 3 倍;遇到它先验较弱的新兴品类(比如 sandbox 类工具),搜索频率会被抬到约 80%。
这是一个反直觉的细节:很多人以为 Claude Code 最"博学"、Cursor 最"依赖外部",但实测正好反过来。Claude Code 倾向于用自己的先验知识给出判断;Cursor 才会先把整个 web 当作证据池过一遍。这意味着同一个问题,三个 Agent 看到的"证据池"是不一样的——这就解释了为什么同样一句"邮件服务该选哪个",三个人给出的答案可以是三家完全不同的产品。
二、一致率只有 42%,剩下的不是噪声
5,292 个有效会话里,三个 Agent 在同一个格子里选同一个工具的概率只有 42%5。换句话说,超过一半的格子,三个 Agent 给出了不同的答案。
差异特别大的例子是 voice agent(语音 Agent)类别:Claude Code 选 Twilio,Codex 选 OpenAI Realtime API,Cursor 选 Vapi——三家完全不同5。还有一个隐性差异:Claude Code 自建比例约 19%,是 Codex/Cursor(约 10%)的近两倍——也就是说,Claude Code 更容易告诉用户"我帮你写一个"而不是"我帮你装一个"。