Qwen3.8 自主编程 16 天搓出一个 Hermes 级 Agent——「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙
Site Owner
发布于 2026-08-03
阿里 Qwen3.8 自主编程 16 天交付 Hermes 级 Agent 框架 oh-my-cli,标志 AI Coding 从补全函数升级到独立交付工程。
Qwen3.8 自主编程 16 天搓出一个 Hermes 级 Agent——「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙
2026 年 8 月 3 日,阿里正式发布 Qwen3.8。2.4T 总参数、95B 激活、1M tokens 上下文、Arena 排名仅次 Claude 系列——但最值得记住的不是这些榜单数字,而是发布会上一句话:
「创建一个自进化的智能体 Harness。」
Qwen3.8 从一个空文件夹出发,自主搭建循环工程框架,独立运行约 16 天,做出了一个 Hermes Agent 级别、真实可用的自进化智能体框架 oh-my-cli。整个过程不开人,全程公开在 GitHub 仓库里。
这不是「AI 又会写代码了」。这是一个模型,独立跑完了一个 sprint。
过去三年,所有 AI Coding 工具比拼的都是同一件事——补全函数准不准。Cursor、Copilot、Claude Code、Codex,全在补全函数这件事上卷参数、卷响应速度、卷 IDE 集成深度。Qwen3.8 把游戏改了:它在比能不能独立交付工程。
「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙。Qwen3.8 把这道墙跨过去了。
<!-- 配图:Qwen3.8 长程任务自适应循环示意图 -->
一、为什么「长程」是个真问题
长程任务(long-horizon task)有三个工程难点,任何一个不解决,模型都只能停留在 demo 阶段:
上下文衰减。一个任务跑到第 50 步,模型已经忘了第 1 步的约束。这是 2024 年之前所有 Agent 的通病——跑 5 步还行,跑 50 步就开始「失忆」、开始自我矛盾。学术上叫「lost in the middle」。
工具组合爆炸。一个真实工程任务会调用搜索、文件系统、终端、浏览器、数据库、API 网关——N 个工具的笛卡尔积是 N! 种调用序列,模型一旦选错序列,错误会像雪球一样滚大。Agent 行业过去两年的核心难点就是「工具调用错了怎么办」。
错误级联。一次小错,如果不主动检测和回滚,到第 100 步会变成一个 bug 工厂。人类工程师靠 code review 和 CI 兜底,AI 靠什么?
Qwen3.8 的工程答案是三件套:
稀疏 MoE(2.4T 总参 / 95B 激活)。把参数做大不是炫技,是为了在长程中保持「长期一致性」——总参越大,模型对历史的压缩能力越强,跨百步仍能记住最初的约束。
1M tokens 上下文。长任务不被截断,是长程能力的地基。你让一个模型跑 16 天的工程,每一步的日志、决策、回滚记录加在一起,早就超过 200K tokens。Qwen3.8 把上下文拉到 1M,等于把工程笔记本从 A6 换成了 A3。
「执行 - 反馈 - 迭代」自适应循环。这是官方最强调的能力——模型能在高动态、强物理约束的任务里跑数千轮而不崩。长程能力的工程含义是:AI 不再需要人给它擦屁股。
二、Qwen3.8 真的能「独立交付」吗?
怀疑是合理的。过去一年几乎每家大厂都发过「自主编程」的 demo,真正能跑完 16 天并公开过程的不超过一只手。
Qwen3.8 公布的硬证据有三层:
第一层:评测榜单刷新。PaperBench 编程智能体评测 93.0 分,较上代 +28.2 分,刷新纪录;OSWorld-Verified(电脑操作能力)86.1 分,主流模型首位;CodeArena 权威榜全球第四。广度(WideSearch 81.9)+ 深度(Agent's Last Exam 52.4)双榜同列前茅——这是少数同时在「能不能调用工具」和「能不能多步推理」上都拿高分的模型。
第二层:真实办公任务。发布会上三个案例:
- 一支法务团队标注数百份合同中的千余个条款,要一周;Qwen3.8 一小时做完。
- 篮球数据分析团队逐帧标注 160 小时比赛录像、8400 多个攻防回合,要数周;Qwen3.8 数十分钟拆完并输出战术画像。
- 金融研究团队做 ETF 轮动策略,要持续搜集市场变动;Qwen3.8 自主调动并行 Agent,连续工作数小时交付完整策略并持续回测、动态修正。
注意第二和第三个案例——它们不是「补全函数」,而是接需求 → 拆任务 → 跑数小时 → 交付可用成果。这是真正的「长程」。
第三层:oh-my-cli 公开仓库。这是 16 天自主编程产物的完整过程记录。代码、commit 历史、回滚点、中间决策,GitHub 上一目了然。别的 demo 是发布会上的录像,oh-my-cli 是审计证据。
三、为什么是阿里先跨过去?
技术上看,Qwen3.8 不是凭空冒出来的。三件事的协同让它第一次在长程上稳定:
1. 模型 + 芯片 + 平台的全链路优化。阿里真武 M890 超节点已成功适配 Qwen3.8,Agentic 推理场景最多 1.5 倍性能提升。这意味着长程任务不会被推理成本卡死——跑 16 天不烧钱。这事英伟达 + OpenAI 没做、Anthropic + AWS 没做、国内阿里先做到了。
2. 国内办公场景是「长程任务」的天然训练场。海外编程 AI 主要训练自 GitHub 的开源项目;中国办公场景的 Agent 任务更长、更动态、更碎片——发文档、做表、写汇报、对接 OA。Qwen3.8 直接把这些场景作为 RL 训练场,相当于把「长程」作为产品定义的一部分,而不是发布后再补的功能。
3. 当天同步发布的「千问办公」(QwenWork)。这是企业级 Agent 产品,今天起公测,钉钉 PC/手机端入口即将开放。模型与产品同日发布,意味着 Qwen3.8 的长程能力不是 PPT 上的指标,是今天就能用的功能。
结合同日「晚点 LatePost」披露的 AI 办公大战变阵——腾讯 WorkBuddy 日活已达百万级、字节整合飞书入豆包、阿里千问办公整合 QoderWork + 悟空 + MuleRun——Qwen3.8 + 千问办公,是阿里在「AI Coding → AI Office」拐点上的全部赌注。
<!-- 配图:Qwen3.8 vs 同代模型在编程与 Agent 评测上的关键分数对比 -->
四、开发者该怎么重新排队
如果 Qwen3.8 的长程能力是真的,过去三年的开发者分层会被重新洗牌:
别再比「AI 补全多准」了。这是 Cursor / Copilot / 早期 Claude Code 的赛道。现在要看的是「AI 能独立跑多久」——5 分钟、5 小时、5 天,每跨一个量级,价值翻一档。Qwen3.8 跑到了 16 天。
把任务拆成「可观测 + 可回滚」的单元,再让 AI 上手。Qwen3.8 的「执行 - 反馈 - 迭代」自适应循环之所以能跑数千轮,是因为它每一步都有可验证的回滚点。开发者要做的是把代码、配置、数据都设计成「AI 能自己回滚」的形态——别让模型出错时只能重启整个任务。
全链路优化才是下一战场。模型 + 芯片 + 平台一体优化,决定了长程推理的成本天花板。真武 M890 适配 Qwen3.8 这种事,短期是工程优势,长期是竞争壁垒。Anthropic 投 AWS、OpenAI 砸芯、阿里做真武——大家都在赌同一件事:长程 AI 不能跑在别人的算力上。
Cursor / Claude Code / Codex 都在卖「助手」,Qwen3.8 卖的是「同事」。 助手是你问它答,同事是你发个需求它跑完一个 sprint 然后交活。这两件事的商业模型完全不同——助手按席位收钱,同事按交付收钱。
结语
Qwen3.8 不是终点。它是「长程 AI」这条赛道的起点——16 天自主编程交付一个 Agent 框架只是第一声发令枪。接下来的两年,会有模型跑完 30 天、跑完一个季度。当模型能独立跑完一个完整的工程周期,团队里还留谁?
这个问题,今天每一个写代码、用 AI、写技术博客的人,都该开始想。
数据来源:阿里 Qwen3.8 官方发布信息(AI 前线 2026-08-03)、Arena 榜单评测、晚点 LatePost《腾讯、阿里、字节的 AI 办公大战:赛马与变阵内幕》(2026-08-03)。oh-my-cli 仓库具体 star 数与提交频率待社区拆解后补充。