GLM-5.3 击败 GPT-5.6-Sol 的那天,国产 Coding Agent 才真正能交付
胡新宇
发布于 2026-08-15
用 Datawhale 在 8 月 15 日做的同题实测切片,论证国产开源模型(GLM-5.3)+ 国产 Agent 运行时(DeepSeek Harness)首次在生产级任务里,工程细节反超 GPT-5.6-Sol。这是一个被官方宣传词掩盖的工程拐点。

GLM-5.3 击败 GPT-5.6-Sol 的那天,国产 Coding Agent 才真正能交付
8 月 13 日 DeepSeek Harness 公测。8 月 14 日智谱甩出 GLM-5.3,Z.ai Code Bench 编程能力暴涨 50%,顺手在国内外项目里挖出 2404 个漏洞。8 月 15 日,Datawhale 拿这套组合跟 GPT-5.6-Sol 跑同一道生产级抠图 Web app——核心功能打平,工程细节反超。

官方通稿铺天盖地讲"50%"和"2404"。这俩数字我不会否认真实性,但我要说句难听的:榜单分数和漏洞猎杀,都不是这场发布真正值得你关心的东西。
真正的大事是:国产开源模型第一次在生产级任务里,工程交付能力超过了 GPT-5.6-Sol。这事发生在 8 月 15 日,之前从没发生过。
同基座榨出 50%,后训练干的事比你想的脏
GLM-5.3 没有换基座,没有扩参数,没有重新预训练。智谱的工程师只是在 GLM-5.2 的基座上做后训练,就把编程能力拉高了 50 个点。
这意味着什么?基座里的能力本来就在那里,只是没被激发。 后训练不是灌输新知识,是把模型已经在潜伏的东西逼出来。像给一个会弹琴但没上过台的人做突击排练,台上突然稳了。
智谱联合国内安全团队做的白盒审查也值得提。发布前两周,GLM-5.3 在国内外项目里定位出 2404 个潜在漏洞,1088 个中高危。最早的风险可以追溯到 40 多年前——DNS 协议、邮件传输、操作系统底层的陈年旧账。
这不是"AI 抓 bug"的玩具 demo。一个有 40 年跨度的代码库安全检查,即使对人类专家来说也是地狱级任务。GLM-5.3 做这件事的方式,是深入到协议实现和内存管理层面,不是给代码拍 X 光片,是在翻一座旧宅的承重墙。
但注意,漏洞发现能力跟"工程交付能力"是两码事。能找出 40 年前的 bug,不代表能写出 40 年后还能维护的代码。 前者是诊断,后者是建造。真正的考验在三天后的 Datawhale 实测里。
没有 Harness,GLM-5.3 只是一块好芯片
如果你用 Codex 类产品的思路看 DeepSeek Harness,你会完全搞错重点。它不是一个"DeepSeek 牌 VS Code",也不是国产 Claude Code。
DSH 是一个 Agent 运行时。 给它换个类比的话,它是 Agent 世界的 Linux 内核,不是又一个发行版。
Everything is a plugin——模型适配器是插件,策略是插件,提示词模板是插件,存储方案是插件,UI 是插件,上下文压缩策略也是插件。你拿一组插件拼出一个属于自己的 Coding Agent,跟拿 syscall 组装出一个操作系统变体一样自由。

公测几天内 300 个插件冒出来。注意,这不是 VS Code 插件市场那种"给你的编辑器加个主题包"。DSH 的插件切到 Agent 的大脑、工具箱、规则引擎、交互界面——是神经外科手术刀,不是贴纸。
对 GLM-5.3 来说,Harness 的价值很具体:它把模型从"能写好代码"推到"能交付可上线的活"。 光有模型,你只能在聊天框里让它生成一个抠图函数。接进 Harness,你让它跑通一个完整的 Web 应用——账号体系、异常处理、部署文档、安全响应头,全都有地方落地。
Datawhale 做的就是这件事。他们把 GLM-5.3 接进 DeepSeek Harness,跟 GPT-5.6-Sol 跑同一道题。GPT-5.6-Sol 用的什么环境?大概率是 OpenAI 自家最顺手的那个。你猜结果怎么着。