Skill 终于有 CI 了——阿里开源 skill-up,让 Agent Skill 可评测可回归
Site Owner
Published on 2026-07-25
Skill 写好不等于 Skill 跑好——阿里 7 月 23 日开源 skill-up,把 Agent Skill 评测拉回 CI 时代:声明式 YAML 用例、expect + judge 分层判定、跨引擎回放、退出码接入 PR 门禁。1200 行手搓脚本被替换为 ~40 行 YAML。

Skill 终于有 CI 了——阿里开源 skill-up,让 Agent Skill 可评测可回归
2026 年 7 月 23 日,阿里开源了一个叫 skill-up 的东西。
一个命令行评测框架。专门给 Agent Skill 用的。GitHub 地址:github.com/alibaba/skill-up。
(来源:微信公众号"AI 前线"原创文章《阿里开源 skill-up:让 Agent Skill 可评测可回归》,2026-07-23)
Skill 写得好不好,以后不用靠人肉判断了。跑一遍 skill-up,YAML 定义用例,框架自动回放、判定、出报告,最后甩一个退出码——Pass 还是 Fail,清清楚楚。
<!-- 配图:skill-up 命令行运行截图,显示测试用例执行结果和退出码 -->
Skill 写好不等于 Skill 跑好——这是 skill-up 团队的开场白,也是过去一年 Agent Skill 圈子一直没解决的硬伤。
过去一年,Agent Skill 彻底火了。一段 SKILL.md、几个脚本、一套工具声明,就是一个 Skill。门槛低到离谱,我上个周末手搓一个“代码工程升级 Skill”只花了半天。社区里各种 Skill 满天飞,质量参差不齐,但至少能用。
问题是:你怎么知道一个 Skill 好不好用?
答案一直很模糊。大部分团队的做法是——跑了再说。跑对了就是好,跑错了就改改 prompt 再跑。改到什么程度算合格?不知道。改完之后会不会把之前对的东西弄坏?也不知道。
换句话说,Skill 是代码,但 Skill 的世界没有 CI。
传统软件工程里,单元测试、集成测试、PR 门禁是标配。你提一个 PR,CI 自动跑一遍测试,红了就别想合并。Skill 呢?全靠开发者的记忆和直觉。今天改了工具调用策略,昨天正常的数据分析 Skill 突然乱套了——没人提醒你,等业务方找上门来,你已经改过三个版本了。
靠人肉和记忆维护的东西,本质上没有质量。
skill-up 干的事情,就是把 Skill 拉回 CI 时代。它有三条核心设计,我一条一条说。
声明式评测集
不用手搓 Shell 脚本,不用写复杂的 CI 编排。一个 YAML 文件,定义输入、预期行为、判定规则。像这样:
case:
name: "数据质量分析覆盖四维度"
messages:
- "分析昨天各业务线的质量数据"
post_condition:
- type: expect
check: output_contains_all ["完整性","准确性","及时性","一致性"]
- type: judge
<!-- 配图:expect 和 judge 分层判定的流程图 -->
<!-- 配图:手搓脚本 vs skill-up YAML 的代码量对比图 -->
