Agent 时代我们为什么都在做 CLI——从食材、预制菜到菜谱的三层能力栈
胡新宇
Published on 2026-07-07
过去 12 个月所有主流 AI 编程助手都把交互入口收回命令行。CLI 复兴不是审美复古,是结构性必然:CLI/MCP/SKILL 三层能力栈 + 可调用/可理解/可组合/可恢复的 AI 友好四要素。2026 是 Agent First 的 2010——先把 CLI 暴露出去的产品,会先吃到 Agent 生态的第一波红利。
Agent 时代我们为什么都在做 CLI——从食材、预制菜到菜谱的三层能力栈
过去 12 个月,所有主流 AI 编程助手都做了同一件事:把交互入口收回命令行。Cursor 出了 CLI,Anthropic 的 Claude Code 是一开始就 CLI first,连 OpenAI 的 Codex 都悄悄把 CLI 摆到 IDE 前面。
看起来像一次"复古回归"。但任何把这件事当怀旧的人,都错过了真正的问题。
2026 年 7 月 6 日,腾讯工程师郭小成写了一篇刷屏文《为什么 Agent 时代,大家都在做 CLI 》。他的核心判断只有一句——当软件的操作者从人扩展到 Agent,CLI 不再只是给工程师用的老工具,它成了 Agent 调用数字世界的高效入口。
同一天,百度网盘主端 FE 团队公开了一组数据:他们每月 2000 次 Code Review,其中 55.87% 的代码已经是 AI 写的;传统人工 Review 效果锐减,于是搞了一套多 Agent 多角色 AI 审查链路。
也是同一天,JetBrains 在博客发了一个反直觉的实测——有个叫 Caveman 的插件号称"让 AI 说原始人话"能省 65% token,JetBrains 把它扔进 SkillsBench 跑 86 个任务,实测只省 8.5%,任务质量没有显著差异。
三件事拼在一起,2026 年 Agent 时代的轮廓清晰了:CLI 复兴不是审美复古,是结构性必然。
为什么是 CLI,不是 GUI
计算机的界面进化,过去四十年一直是从 CLI 到 GUI。从文字到图标,从键盘到触屏,对人越来越友好。Agent 时代方向反过来了——软件的用户变成了 AI Agent。
LLM 和终端说同一种语言。LLM 是 text-in、text-out 的机器,终端是 text-in、text-out 的界面。让 AI 操作 GUI 就绕远了:得截图、用视觉模型识别按钮在哪、再模拟鼠标去点,一行命令能搞定的事拆成四步,每步都可能出错。对 AI 来说,CLI 就是最短路径。
这背后是四个结构性优势,每一个都对应 Agent 工作的真实痛点。
天然同构:上面已经说了,text-in/text-out 是 LLM 的母语,CLI 是它的母语。让 AI 操作 GUI 是逼它学外语。
自描述:这是 CLI 相对 API 最被低估的优势。AI 碰到一个陌生的 CLI,敲一下 --help 就知道有哪些能力、怎么用、参数怎么填。CLI 自带说明书。API 不行——AI 得先拿到文档、弄清端点、搞懂认证方式,才能动手。工具本身就是文档,这种"自描述性"让 CLI 成为对 AI 最友好的接口。
Unix 哲学:管道和组合,是 AI Agent 最需要的执行模型。antwork calendar agenda --next-week | grep "张三" | wc -l 一行命令查出下周和张三有几个会。MCP 更适合预定义的标准操作,而 CLI 可以靠管道组合出没预设过的操作——这种"即兴编排"能力是 CLI 独有的。
并行是原生的:CLI 命令本质上是无状态、可序列化的,一个字符串就是一个完整的操作指令。Agent 可以批量生成命令、并行分发到多个进程、独立重试,不需要维护 session 状态。当你的工作从"一个人写代码"变成"指挥一群 Agent 干活",CLI 的无状态特性让并行调度水到渠成。
JetBrains 那个 8.5% 的反例正好佐证了这一点——他们测的"原始人话"省 token 失败,正是因为 Agent 的输出大部分是代码、diff、工具调用、错误字符串,这些不能压缩。CLI 之所以适合 Agent,是因为 Agent 真正消耗的 token 本来就是结构化的文本,而不是自然语言。

三层能力栈:食材、预制菜、菜谱
CLI 和 MCP 放在一起看,不是二选一,是 Agent 能力栈的不同层级。加上越来越多人讨论的 SKILL,三者构成一个从底到顶的分层结构。
