Qwen3.8 登顶英伟达算子榜:AI 开始优化自己的算力账单
Site Owner
Published on 2026-07-23
Qwen3.8 在 NVIDIA GPU 算子榜登顶。本文拆解 AI 如何通过真实硬件反馈迭代 kernel、降低每任务成本,以及榜单防作弊和跨硬件迁移的边界。

Qwen3.8 登顶英伟达算子榜:AI 开始优化自己的算力账单
2026 年 7 月 22 日,Qwen3.8 预览版登上 NVIDIA SOL-ExecBench 的 FlashInfer-Bench 子榜首位。
这张榜不考聊天,也不考网页生成。它让模型写 GPU kernel,再放到真实 B200 上运行,看代码离芯片理论极限还有多远。(来源:NVIDIA SOL-ExecBench、智东西报道)
AI 开始动手削减自己的算力税。
榜首的含金量,在测试方法里
GPU kernel 可以理解成数据中心的排产表。同一座厂房,同一批机器,排产差一点,工人就会等料;排得好,流水线才会贴近设计产能。
大模型的注意力、归一化、MoE 路由,最后都要落成 kernel。代码能运行,只代表厂门开了。访存、线程布局或算子融合没处理好,大量计算单元仍会站着等数据。
传统性能评测常问:“比某份参考实现快多少?”这个问题有个漏洞:参考实现若很慢,候选代码看起来就很强。
SOL-ExecBench 换了一把尺。它根据 B200 的峰值算力和 HBM 带宽计算理论 roofline,再用 SOL-Score 衡量候选 kernel 离上限还有多远。官方评估锁定 B200 的 SM 时钟为 1500 MHz,同时检查数值正确性与多种 reward hacking;运行结果允许约 5% 的波动。(来源:NVIDIA 官方 README)
这张榜把跑道极限当终点,参考实现只是一块路牌。
中文报道披露,完整套件包含 235 项任务,取自 124 个模型。Qwen3.8 夺冠的 FlashInfer-Bench 子集包含 26 个问题,每题覆盖 7—48 个动态 shape。相关数字由媒体转述官方材料,当前没有独立复现。(来源:智东西报道)
模型终于拿到不会客气的反馈
普通代码生成有个老毛病:反馈太软。
代码看着顺眼,测试也可能通过,性能却只能靠工程师继续 profile。模型很容易写出“像答案的代码”,很难知道哪次内存访问浪费了带宽。
Kernel 优化的反馈很硬:编译成功或失败,结果正确或错误,延迟是多少,离 roofline 还有多远。GPU 不会因为回答写得流畅,就多给半分。

千问团队向媒体披露,其训练环境让模型反复经历编译、执行和性能测量,用真实硬件结果作为奖励信号。在本次评测中,模型平均完成 29,354 轮工具调用。这个数字属于厂商披露,尚待第三方验证。(来源:智东西报道)
把它想成一个厨师守着灶台:每炒一锅就计时,检查熟度,改刀工,再炒下一锅。近三万轮之后,它优化的已经不只是一份菜谱,还包括炉火和锅之间的配合。
阿里开源的 Atrex Kernel Agent 展示了这类系统的工程骨架:输入 PyTorch 逻辑或现有 kernel,Agent 负责实现、分析、profiling 和迭代优化。(来源:alibaba/atrex-kernel-agent)
配套的 Atrex-Bench 又设了三关:编译、数值正确、性能。官方仓库列出 30 个主要来自生产 trace 的 operator,支持 Triton、Gluon、FlyDSL、CuteDSL,也覆盖 AMD 与 NVIDIA GPU。(来源:alibaba/atrex-bench、)
