Qwen3.8 自主编程 16 天搓出一个 Hermes 级 Agent——「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙
Published on 2026-08-03
阿里 Qwen3.8 自主编程 16 天交付 Hermes 级 Agent 框架 oh-my-cli,标志 AI Coding 从补全函数升级到独立交付工程。
Qwen3.8 自主编程 16 天搓出一个 Hermes 级 Agent——「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙
2026 年 8 月 3 日,阿里正式发布 Qwen3.8。2.4T 总参数、95B 激活、1M tokens 上下文、Arena 排名仅次 Claude 系列——但最值得记住的不是这些榜单数字,而是发布会上一句话:
「创建一个自进化的智能体 Harness。」
Qwen3.8 从一个空文件夹出发,自主搭建循环工程框架,独立运行约 16 天,做出了一个 Hermes Agent 级别、真实可用的自进化智能体框架 oh-my-cli。整个过程不开人,全程公开在 GitHub 仓库里。
这不是「AI 又会写代码了」。这是一个模型,独立跑完了一个 sprint。
过去三年,所有 AI Coding 工具比拼的都是同一件事——补全函数准不准。Cursor、Copilot、Claude Code、Codex,全在补全函数这件事上卷参数、卷响应速度、卷 IDE 集成深度。Qwen3.8 把游戏改了:它在比能不能独立交付工程。
「补全函数」和「交付工程」之间,隔着一道叫「长程」的墙。Qwen3.8 把这道墙跨过去了。
<!-- 配图:Qwen3.8 长程任务自适应循环示意图 -->
一、为什么「长程」是个真问题
长程任务(long-horizon task)有三个工程难点,任何一个不解决,模型都只能停留在 demo 阶段:
上下文衰减。一个任务跑到第 50 步,模型已经忘了第 1 步的约束。这是 2024 年之前所有 Agent 的通病——跑 5 步还行,跑 50 步就开始「失忆」、开始自我矛盾。学术上叫「lost in the middle」。
工具组合爆炸。一个真实工程任务会调用搜索、文件系统、终端、浏览器、数据库、API 网关——N 个工具的笛卡尔积是 N! 种调用序列,模型一旦选错序列,错误会像雪球一样滚大。Agent 行业过去两年的核心难点就是「工具调用错了怎么办」。
错误级联。一次小错,如果不主动检测和回滚,到第 100 步会变成一个 bug 工厂。人类工程师靠 code review 和 CI 兜底,AI 靠什么?
Qwen3.8 的工程答案是三件套:
稀疏 MoE(2.4T 总参 / 95B 激活)。把参数做大不是炫技,是为了在长程中保持「长期一致性」——总参越大,模型对历史的压缩能力越强,跨百步仍能记住最初的约束。
1M tokens 上下文。长任务不被截断,是长程能力的地基。你让一个模型跑 16 天的工程,每一步的日志、决策、回滚记录加在一起,早就超过 200K tokens。Qwen3.8 把上下文拉到 1M,等于把工程笔记本从 A6 换成了 A3。
「执行 - 反馈 - 迭代」自适应循环。这是官方最强调的能力——模型能在高动态、强物理约束的任务里跑数千轮而不崩。长程能力的工程含义是:AI 不再需要人给它擦屁股。
二、Qwen3.8 真的能「独立交付」吗?
怀疑是合理的。过去一年几乎每家大厂都发过「自主编程」的 demo,真正能跑完 16 天并公开过程的不超过一只手。
<!-- 配图:Qwen3.8 vs 同代模型在编程与 Agent 评测上的关键分数对比 -->