一个 Skill 让 DeepSeek V4 Pro 超过 Fable 5?——Agent Harness 神话这次真的塌了
胡新宇
发布于 2026-08-20
J-Space Cognition Suite 翻车撕开 Agent Skill 评测乱象:V4 Pro 实测 77.5% vs 自报 87.1%、Token 翻 4 倍。Harness 真实痛点是长任务状态管理,Model-Native vs 通用 Harness 已经在分家。

一个 Skill 让 DeepSeek V4 Pro 超过 Fable 5?——Agent Harness 神话这次真的塌了
2026 年 8 月 19 日,机器之心和 InfoQ 在同一天发文,锤爆了一个叫 J-Space Cognition Suite V3.6 的开源项目。项目方声称:只要在 Agent 环境里挂一个 Skill,DeepSeek V4 Pro 就能在 Terminal-Bench、NL2Repo、DeepSWE 等多个基准上大幅提升,"甚至超过 Fable 5"。一周之内,社区复测结果打满了原作者的脸——独立开发者 Jyleaves 用 8 张 H20 跑 89 道题,模型通过 69 道,最终得分 77.5%,而 J-Space 自报 87.1%;失败任务重跑 3 次仍未达报告数字(GitHub Issue #26)。容易讲的故事,往往是最容易骗人的故事。
更刺眼的不是分数,而是 Token:另一位开发者用 V4 Flash 跑 A/B 测试,PI + J-Space 的成本大约是基线的 2~4 倍,DSH + J-Space 高约 50%。号称"速度翻倍、Token 效率翻倍"的项目,跑起来反而更贵、更慢(机器之心,2026-08-19)。
这一巴掌打在了所有 Agent Skill 卖家脸上。

Harness 真的重要,但不是出在 J-Space 想的那种地方
J-Space 的故事能传开,是因为它踩中了一个真实存在的痛点:DeepSeek V4 Pro 对外部运行环境敏感得过分。
有人在正式版发布当晚用相似提示两次测试 3D 直升机游戏。凌晨 0 点 50 分,模型生成的项目还非常粗糙;不到 4 小时,它却交出了一个完整得多的项目。模型没变,提示相近,差出来的是 Harness(机器之心)。
把视角放大,Project2 工程任务里同样如此:同一个 V4 Pro,DeepSeek Harness Standard 模式 91 分,PTC 模式 92 分,工具更少的 Minimal 模式两次分别达到 99 分和 96 分。模型和任务没动,换套件就能差出 8 分。这才给了 J-Space 起手式的想象空间——既然有这么大的浮动空间,"灌一套 Skill" 当然也能跳一档。
Harness 是引擎调教,不是外挂翅膀。 同一台 V8 引擎换不同 ECU 调校,圈速能差一两秒;但没人会相信一套外挂套件能让民用引擎跑出 F1 圈速。J-Space 把"调校空间"偷换成了"外挂翻倍",再把"自测里的进步"包装成"超过 Fable 5"——这是它把读者卖掉的全过程。
Harness 确实在变得越来越重要,但落点根本不在"Skill 插件"这条路上。
Harness 已经进入"补短板"阶段,但它补的是别的东西
行业现在被反复讨论的痛点,是 LongHorizon-Harness 论文里直接命名的那句话——"task-state management problem"。长任务跑着跑着,Agent 越来越容易忘记自己到底在做什么:忘记此前的关键上下文、重复已经完成的工作、验证没做就宣布任务完成、在工具调用失败后不保留诊断信息就再跑一遍。这些问题在 Long-Horizon-Terminal-Bench 的评测里表现得很具体:17 个前沿模型平均每项任务消耗约 980 万 Token、跑 239 个回合、耗时 88.9 分钟(InfoQ,2026-08-19)。
围绕这些真问题,主流厂商正在做的事情是:
长任务状态外置。 J-Space 引入了类似 Kanban 的外部账本,把关键目标、已验证信息、未解决问题写进模型之外的持久结构。思路本身没问题——即使一轮推理跑偏,外部状态还能把 Agent 拉回原轨道。但这只是其中一个组件。
Compaction 压缩。 上下文不外迁,Agent 会越来越臃肿;压缩又会带来新风险。OpenCode 今年的一项 Issue 报告:原本被定义为只读的 Explore Agent,在触发 Compaction 后可能丢失原有权限约束,开始修改文件。Compaction 必须保留原 Agent 的工具和权限限制——这件事 OpenCode 是被现实教训之后才补的。
Verification 拆出。 当 Agent 学会"做事",更难的是它没法判断"什么时候算真做完"。越来越多 Harness 开始把验证和停止条件从模型自己的语言判断里拆出来。DSH 干脆把 agent/turn-stopping 设计为一个独立扩展节点,插件可以在模型准备结束任务时继续介入。


