黄仁勋说别被淘汰的 4 件事,本质是英伟达给自己开的药方
发布于 2026-08-12
黄仁勋说别被淘汰的 4 件事,看完一周内英伟达、Cursor、智谱的连续动作才发现:算力霸权正在被同时拆掉,他的方法论其实是给自己开的药方。

黄仁勋说别被淘汰的 4 件事,本质是英伟达给自己开的药方
2026 年 8 月 6 日,黄仁勋在 YC Startup School 上讲了一段访谈,被中文媒体整理成"不想被淘汰,马上做 4 件事"。四天后,8 月 10 日,英伟达同意向一家电力公司投 20 亿美元,后续可能再加 10 亿。
同一天,Cursor 开源了 MoK,让 MoE 训练里一次通信延迟从 103μs 降到 18μs——5.7 倍。同一天,《晚点 LatePost》独家披露智谱 API 用户接近 700 万、启用超 5 万块国产算力芯片。
三件事都发生在同一周。这不是巧合,而是同一道题的三个答案。
算力霸权正在被同时拆掉。
<!-- 配图:算力霸权的四面围攻 -->
第一个裂痕:电
卖 GPU 的公司,开始买电。
这笔钱投给的是 Lancium——一家总部在德州的"AI 电力基础设施开发商"。它的本事不是建电厂,而是提前在变电站和输电线路附近"圈地":找到有剩余电力容量的位置,把这块地签下来、给电网公司交接入费,然后等 AI 数据中心客户来用。
Lancium 已经在德州电网锁定并开发 4 GW 电力容量,另外还有 15 GW 的"带电力接入条件的土地"在等审批(来源:The Information,2026-08-10)。其中 1.2 GW 供 Abilene 的 Oracle + OpenAI Stargate 园区用。Crusoe 还在 Childress 建设项目再签 1 GW。
英伟达花 20 亿美元(后续追加 10 亿),拿下 Lancium 约 20% 股权,最终可能持股 30%。对应估值 100 亿美元。
Lancium 不是孤例。截至 2026 年 4 月这一个财季,英伟达向私营企业和基础设施基金投入了 186 亿美元——超过此前一整年。仅这一年里,英伟达就分别向 CoreWeave、Nebius 各投 20 亿,给网络设备公司 Lumentum、Coherent 各 20 亿,给 Marvell 也是 20 亿。
英伟达从"卖铲子"的公司,变成"买铲子"的公司——而且买的不是更多的铲子,是铲子能用的电。
更直接的信号是 8 月 10 日同一天:德州州长 Greg Abbott 下令暂停新的数据中心电网接入申请。算力扩张第一次被电力公司"卡脖子"。英伟达提前三年买电网容量,本质是给自己买一份保险:等同行发现没电可用时,货已经在仓库里了。
第二个裂痕:应用层
黄仁勋说"硬件堆到顶,软件接着改"。Cursor 用 MoK 给这句话交了实操样本。
Cursor 不是芯片公司,是给开发者做 AI 编辑器的创业公司。8 月 7 日,他们开源了一个叫 Mixture-of-Kittens(MoK)的内核。它干的事情非常简单——把 MoE 训练里的 token 调度、跨 GPU 通信、专家计算三件原本串行的事,塞进同一个 GPU kernel 里。
5.7 倍加速。
这件事为什么重要?因为它揭穿了一个尴尬的事实:NVIDIA GB300 NVL72 整机架 NVLink 峰值带宽达到 130 TB/s,按这个规格看,GPU 之间传数据已经足够快了。可在大规模 MoE 训练里,通信依然拖住专家计算。
原因藏在 MoE 的工作流里:Router 每一步都重新决定 token 去哪个专家,专家分散在不同 GPU 上。一个"通信"阶段里其实混着数据搬运、布局生成、同步和负载失衡几件事,130 TB/s 是峰值带宽,不是每次动态零碎的 MoE 通信都能把这些链路同时跑满。
传统做法用多 CUDA Stream 让通信和计算并发,却很难保证两边都拿到恰到好处的 GPU 资源。MoK 的设计是直接让通信和计算同时占用 GPU 的 SM 单元,不再分开排队。
<!-- 配图:MoE 通信税 vs MoK 的同 kernel 解法 -->
硅星人那篇报道里有一句很到位的话:"硬件跑得再快,也救不了低效的软件编排。"
这句话是 Cursor 的宣言,也是给英伟达的备忘录:当客户开始重写你的 GPU 怎么用,你就不再是唯一的算力定义者。
<!-- 配图:四类应对法 quadrant -->