千问打败 Claude Cowork 排第一,但 Work 赛道的真正赢家中美不一样
胡新宇
发布于 2026-08-26
8月19日华尔街杰富瑞实测 8 款 Agent,千问办公综合第一;8月24日字节豆包工作独立 + TRAE 并入。中美 Work Agent 赛道同时进入决战,但模型层阿里守不住,真正的胜负手是 Harness 工程——指令、上下文、工具调用、纠错、治理。中美路径分叉:美国靠模型 + 通用 Agent 入口,中国靠 Harness + 办公套件生态卡位。模型层会越来越平,工程层会越来越陡。
千问打败 Claude Cowork 排第一,但 Work 赛道的真正赢家中美不一样
8 月 19 日,华尔街投行杰富瑞对全球 8 款主流 AI Agent 做了真实办公任务实测——多文件年报摘要、桌面浏览器操作、英文 PPT 制作、营销海报生成 5 项。综合排名:阿里千问办公第一,超过了 Claude Cowork 和 OpenAI Codex。
5 天后的 8 月 24 日,字节把 TRAE、扣子(Coze)两个团队整体并入豆包体系,正式推出独立品牌「豆包工作」(来源:TechWeb)。
一个第一名 + 一个组织级调整,同一周撞上。这不是巧合,是 Work 类 Agent 赛道在中美同时进入决战阶段 的信号。

但故事的反转在另一头。
千问的模型,已经守不住了
「千问办公」的底座是 Qwen 3.8 Max。这台发动机现在被前后夹击:开源侧 Kimi、GLM、DeepSeek 在中文场景持续蚕食份额(来源:微信公众号「AI产品黄叔」2026-08-25 花叔观察),闭源侧 Claude 与 GPT-5 在英文和代码场景优势明显。
「Qwen 原本是几家大厂里文本和 coding 模型做得最好的。但现在模型的优势被 Kimi、GLM、DeepSeek 几家开源模型拿走了。」——这是花叔 8 月 25 日文章的判断。
阿里在「模型层」这场战争里,不是赢,是守不住。
但杰富瑞的报告偏偏把阿里排到了第一。
Harness 才是胜负手
杰富瑞把 Agent 能力拆成两个维度:模型(大脑)+ Harness(整车工程)。Harness 是围绕模型跑起来的那一整套机制——指令解析、上下文管理、工具调用、边界控制、反馈纠错、治理。
「按照杰富瑞的测算,千问办公的隐含 Harness 分位居此次测试产品首位,高于 Claude Cowork 和 Codex 等七款国内外主流 Agent 产品。这也是唯一一个在所有测评维度中均获得 90 分以上的 Agent 产品。」(来源:量子位 2026-08-20)
全维度 90 分以上——意思是千问没在任何一个任务里掉链子。
这是 Harness 的价值。模型决定上限,Harness 决定下限。

模型可以开源、可以蒸馏、可以 API 化。但 Harness 是把模型「稳定地变成可用产品」的工程能力——这个能力很难开源,也很难复制。
类比:模型是发动机,Harness 是变速箱
燃油车时代,宝马的直列六缸发动机从来不是最强的,奔驰 M276、本田 K20 都有同级对手。但宝马的 ZF 8 速变速箱和它发动机的匹配度,长期是行业标杆。
Agent 时代也是一回事。Qwen 3.8 Max 不是最强模型,Claude 4.5 Opus、GPT-5 在绝对智力上很可能压它一头。但 「Qwen + 千问 Harness + 钉钉上下文」这套组合的整车调校,在真实办公任务里反超了 Claude Cowork。
另一层类比:模型层像算法题答案,Harness 是考场策略。能不能拿满分,看的不只是你会做哪些题,还有你会不会跳题、会不会取舍、会不会检查。