千问进了苹果,5 万张国产卡跑了万亿模型,Qwen3.8 登顶英伟达榜单——为什么 2026 年 7 月中旬这一周,比一年都重要
Site Owner
Published on 2026-07-22
2026 年 7 月中旬这一周,国产 AI 在云端(LongCat-2.0 5 万张国产卡训出 1.6 万亿参数)、端侧(千问进苹果、MinCPM 进三星)、工具链(Qwen3.8 在英伟达 CUDA 榜单登顶)三层同时打穿,分水岭事件。

千问进了苹果,5 万张国产卡跑了万亿模型,Qwen3.8 登顶英伟达榜单——为什么 2026 年 7 月中旬这一周,比一年都重要

7 月 22 日,阿里千问 Qwen3.8 预览版在英伟达自家 SOL-ExecBench FlashInfer-Bench 榜单上登顶,把第二名腾讯混元 Hyra、第四名人类开发者 Amir M. Mir、第六名美国 AI 创企 doubleAI、第十名 AI 编程独角兽 Cursor 全部压在身后(来源:智东西 2026-07-22)。
七天前的 7 月 15 日,国家互联网信息办公室一份公告,把 Apple 智能、三星盖乐世 AI、华为小艺、OPPO AndesGPT、vivo 蓝心、小米澎湃 AI、努比亚豆包手机大模型七款端侧大模型服务同时塞进同一份备案。苹果把千问装进 iPhone 的「AI 大脑」,三星把面壁智能 MiniCPM 系列装进 Galaxy(来源:极客早知道 2026-07-16、爱范儿 2026-07-20)。
再往前倒十天,7 月 5 日,美团开源 LongCat-2.0——1.6 万亿参数的 MoE 大模型,33 至 56B 动态激活,全程在国产卡上跑训练和推理,峰值动用了 5 万张国产卡,0 回滚(来源:金色传说大聪明 2026-07-05)。
三件事在同一周内同时落地。不是单一模型的胜利,是「云端训练 → 端侧落地 → 工具链反超」三层同时打穿。 把这三件事分开看是新闻,串起来看是分水岭。
LongCat-2.0:5 万张国产卡怎么把万亿模型抠出来的
LongCat-2.0 的工程难度不在「训出 1.6 万亿参数」——这件事 H100 集群早就干过——难在用国产卡把它训出来。
国产卡的硬件限制是三个具体的工程枷锁:HBM 大约 64GB,比 H800 的 80GB 小一圈;跨卡通信带宽比 NVLink 慢一截;最要命的是确定性计算——训练大模型时,梯度计算需要「同样的输入每次算出同样的结果」,CUDA 生态有现成的,但国产卡的「确定性算子」一开,就退化成单核顺序执行,比正常速度慢很多倍(来源:金色传说大聪明 2026-07-05)。
LongCat 团队的选择是自己写一个。自研高性能确定性算子,把性能损失压到极低。这个动作在 H100 集群上根本不需要做,但 LongCat 团队从 LongCat-Flash(2025 年 9 月发布的 560B MoE)开始就一直在写——当时藏在论文里,不说用的是啥卡。这次 2.0 干脆不藏了,README 直接写明训练和部署都在 AI ASIC superpods 上面。
为了把通信延迟藏进计算时间,他们搞了个叫 ScMoE 的架构——让 Dense FFN 的计算跟 MoE 通信并行跑,理论上能把推理延迟降一半。动态激活的玩法更精细:传统 MoE 每个 token 激活同样多的专家,标点符号和递归推导花一样的算力。LongCat-2.0 的做法是 K 不变,干活的专家数变——每层 768 个正常 FFN 专家之外,放了 128 个空专家。空专家不做计算,进什么出什么,工位占着,活不干。路由器每次照旧选 12 个,简单 token 多分到空专家,实际激活 33B;复杂 token 拉满 56B。
加上这些优化,训练的稳态日吞吐做到了 1T tokens。这个数字放在英伟达集群上不稀奇,放在国产卡集群上,就是 5 万张卡的实战验证。

1.6 万亿参数不是关键,0 回滚训练才是关键。 5 万张国产卡、1.6 万亿参数、零回滚训练——这是工程意义上的「能商用」。