一个 Skill 让 DeepSeek V4 Pro 超过 Fable 5?——Agent Harness 神话这次真的塌了
胡新宇
Published on 2026-08-20
J-Space Cognition Suite 翻车撕开 Agent Skill 评测乱象:V4 Pro 实测 77.5% vs 自报 87.1%、Token 翻 4 倍。Harness 真实痛点是长任务状态管理,Model-Native vs 通用 Harness 已经在分家。

一个 Skill 让 DeepSeek V4 Pro 超过 Fable 5?——Agent Harness 神话这次真的塌了
2026 年 8 月 19 日,机器之心和 InfoQ 在同一天发文,锤爆了一个叫 J-Space Cognition Suite V3.6 的开源项目。项目方声称:只要在 Agent 环境里挂一个 Skill,DeepSeek V4 Pro 就能在 Terminal-Bench、NL2Repo、DeepSWE 等多个基准上大幅提升,"甚至超过 Fable 5"。一周之内,社区复测结果打满了原作者的脸——独立开发者 Jyleaves 用 8 张 H20 跑 89 道题,模型通过 69 道,最终得分 77.5%,而 J-Space 自报 87.1%;失败任务重跑 3 次仍未达报告数字(GitHub Issue #26)。容易讲的故事,往往是最容易骗人的故事。
更刺眼的不是分数,而是 Token:另一位开发者用 V4 Flash 跑 A/B 测试,PI + J-Space 的成本大约是基线的 2~4 倍,DSH + J-Space 高约 50%。号称"速度翻倍、Token 效率翻倍"的项目,跑起来反而更贵、更慢(机器之心,2026-08-19)。
这一巴掌打在了所有 Agent Skill 卖家脸上。

Harness 真的重要,但不是出在 J-Space 想的那种地方
J-Space 的故事能传开,是因为它踩中了一个真实存在的痛点:DeepSeek V4 Pro 对外部运行环境敏感得过分。
有人在正式版发布当晚用相似提示两次测试 3D 直升机游戏。凌晨 0 点 50 分,模型生成的项目还非常粗糙;不到 4 小时,它却交出了一个完整得多的项目。模型没变,提示相近,差出来的是 Harness(机器之心)。
把视角放大,Project2 工程任务里同样如此:同一个 V4 Pro,DeepSeek Harness Standard 模式 91 分,PTC 模式 92 分,工具更少的 Minimal 模式两次分别达到 99 分和 96 分。模型和任务没动,换套件就能差出 8 分。这才给了 J-Space 起手式的想象空间——既然有这么大的浮动空间,"灌一套 Skill" 当然也能跳一档。
Harness 是引擎调教,不是外挂翅膀。 同一台 V8 引擎换不同 ECU 调校,圈速能差一两秒;但没人会相信一套外挂套件能让民用引擎跑出 F1 圈速。J-Space 把"调校空间"偷换成了"外挂翻倍",再把"自测里的进步"包装成"超过 Fable 5"——这是它把读者卖掉的全过程。
Harness 确实在变得越来越重要,但落点根本不在"Skill 插件"这条路上。
Harness 已经进入"补短板"阶段,但它补的是别的东西
行业现在被反复讨论的痛点,是 LongHorizon-Harness 论文里直接命名的那句话——"task-state management problem"。长任务跑着跑着,Agent 越来越容易忘记自己到底在做什么:忘记此前的关键上下文、重复已经完成的工作、验证没做就宣布任务完成、在工具调用失败后不保留诊断信息就再跑一遍。这些问题在 Long-Horizon-Terminal-Bench 的评测里表现得很具体:17 个前沿模型平均每项任务消耗约 980 万 Token、跑 239 个回合、耗时 88.9 分钟(InfoQ,2026-08-19)。
围绕这些真问题,主流厂商正在做的事情是:
长任务状态外置。 J-Space 引入了类似 Kanban 的外部账本,把关键目标、已验证信息、未解决问题写进模型之外的持久结构。思路本身没问题——即使一轮推理跑偏,外部状态还能把 Agent 拉回原轨道。但这只是其中一个组件。
Compaction 压缩。 上下文不外迁,Agent 会越来越臃肿;压缩又会带来新风险。OpenCode 今年的一项 Issue 报告:原本被定义为只读的 Explore Agent,在触发 Compaction 后可能丢失原有权限约束,开始修改文件。Compaction 必须保留原 Agent 的工具和权限限制——这件事 OpenCode 是被现实教训之后才补的。
Verification 拆出。 当 Agent 学会"做事",更难的是它没法判断"什么时候算真做完"。越来越多 Harness 开始把验证和停止条件从模型自己的语言判断里拆出来。DSH 干脆把 agent/turn-stopping 设计为一个独立扩展节点,插件可以在模型准备结束任务时继续介入。
LongHorizon 论文与 StateM 研究 给出了量化结果:StateM 通过持久状态、阶段化上下文、经过检查的状态转移和可恢复 Runbook,把 V4 Flash 在 Terminal-Bench 2.1 上的成绩从 82.7% 提到 88.1%(arxiv 2608.15089)。这是同一类问题——长任务状态管理——但走的是学术论文 + 公开方法学的路,而不是 J-Space 那种"一个 Skill 包治百病"的路。

行业正在分裂:通用 Harness vs Model-Native Harness
第二个值得标记的分化,是社区和模型厂商开始选择不同的路线。
OpenCode 走的是通用路线。它把 Build、Plan、General、Explore、Scout 等 Agent 拆成不同权限和职责,让 Subagent 之间分工协作,再通过 Permission 体系限制文件编辑和 Shell 操作。但多 Agent 也让权限管理变复杂——今年 4 月有人报告父 Agent 禁止写文件,却能通过调用拥有写权限的 Subagent 绕过限制。后续修复开始把父 Session 中的 deny 规则和外部目录权限传递给子 Agent。
模型厂商正在选另一条:更深地理解自己的模型行为,然后围绕这些特性设计 Harness。
OpenAI 4 月升级 Agents SDK 时,明确提出"model-native harness"概念——把 Memory、文件与 Shell 工具、Skills、Compaction 等能力集成进 Agent Loop,同时把 Harness 与真正执行模型生成代码的 Sandbox 拆成两层以提高隔离性、持久性和扩展能力。DeepSeek 8 月 17 日发布官方 DSH,统一了 Model Adapter、Agent Loop、Session、Sandbox、Approval Policy,把整套能力塞进统一插件架构。两次发版的更新条目都很相似:长会话状态修复、max-token 截断后能否继续、Persistent Bash 卡顿、推理成本控制——都在做"补短板",而不是"灌新外挂"。
Harness 该适配模型,还是模型适配 Harness?目前没有标准答案,但行业开始分家了。

真功夫需要对应的真评测
J-Space 翻车撕开的最后一个口子,是 Agent Skill 评测标准根本还没建起来。
Skill 这个名词从 2026 年 7 月开始爆火。阿里开源 skill-up,让 Agent Skill 可评测、可回归;得物发布 EP-Harness,从个人 AI Coding 升级到团队级 Agent 工作流;微软推出 Skill Recorder,录一次操作生成可复用 Agent Skill;JetBrains 把 Agent Skills 集成进 IntelliJ IDEA、WebStorm、DataGrip、Rider、PyCharm 全家桶。每个动作都在说同一件事:Skill 是新赛道。
但所有人都没解决一个前置问题:Skill 怎么评? Skill 跑在模型外面,效果受 Prompt、工具权限、推理强度、停止条件、验证策略一堆变量影响,结果数据全靠项目方自报就成了普遍现象。J-Space 不是第一个,也不会是最后一个。
判断一个 Skill 是不是真有价值,至少要满足三条:
- 第三方独立复现报告——项目方自己跑出来的数字不算数,盲评得分更低的情况在 J-Space 的复测里就出现过(对照组 8.30 vs J-Space 7.87)
- A/B 测试 + 完整流程公开——Prompt、工具权限、推理强度、测试环境全部保持一致,只换 Harness;在自家任务集上跑,而不是只跑项目方挑的基准
- Token 成本带证据——任何"提升 X%、速度翻倍"的说法都要带 Token 消耗对比,J-Space 自报翻倍,真实场景翻了 4 倍
阿里 skill-up 指向的"可评测、可回归"方向、StateM 论文的"持久状态 + 阶段化上下文"方法、LongHorizon-Terminal-Bench 的 980 万 Token / 239 回合基线,是当下少数能对照的客观锚点。能被复现的提升才叫提升,拿不出过程的结果,数字越惊人,越应该先打一个问号。

行动清单
如果你正在做 Agent 开发,下一步要做三件事:
第一,下次看到"X% 提升、超越某知名模型"的 Skill 自报,先去它的 GitHub Issue 区找"复现"两个字,找不到就把这条新闻关掉。
第二,要用 Skill,先在自有任务集上跑 A/B 比对。不要拿项目方公布的基准当你的基准——Prompt、工具权限、推理强度全都不一样。Token 成本和独立盲评必须同时记录。
第三,关注评测基建而不是套件外挂。阿里 skill-up、StateM 论文、LongHorizon-Terminal-Bench、HuggingFace 的 AgentEval,这些"评 Skill 的工具"比下一个"万能 Skill"更值得花时间。
J-Space 翻车只是 2026 年 Agent Skill 泡沫化时代的第一个响指。决定 Agent Harness 走向的,不是谁写了最炫的 Skill,而是谁把评测标准先立起来。 模型厂商已经在用 SDK 发声,这一轮话语权不会留在社区插件手里。