英伟达最深的那道护城河,被几万台 Mac mini 撬开了
Published on 2026-09-01
OpenAI/Anthropic 用脚投票:几万 Mac mini 进了 AI 数据中心。统一内存架构绕开 H100 显存瓶颈,正在重塑 AI 训练的最底层。
英伟达最深的那道护城河,被几万台 Mac mini 撬开了
2026 年 8 月,The Information 曝出一个看起来很不真实的故事:OpenAI 悄悄扫走几万台 Mac mini 和 Mac Studio,不是办公用,是塞进 AI 数据中心做强化学习。Anthropic 紧跟其后,在 AWS 上大批量租用 Mac mini。
这家全球最烧钱的 AI 公司,把"消费电子"拉进了它最核心的生产线。
一、不是预训练那块,是强化学习这块
外界第一反应是"苹果终于杀进 AI 服务器市场了"——这是误读。Mac 没有摸英伟达的蛋糕。它摸的是另一块。
AI 训练其实分三段:
- 预训练 (Pretraining):把万亿 token 灌进去,让模型学语言、世界、物理。这段需要的算力密度和互联带宽极高,英伟达 H100/B200 + NVLink 几乎垄断,Google TPU 是少数例外。Mac 在这里没戏,显存太小、互联太弱。
- 强化学习 (RL):模型每跑一次就让评分器打分,根据分数调整策略。这段要的不是算力峰值,而是反复读上下文、生成答案、回传评分、再调整。模型规模相对小(base model 的 7B–70B,对比预训练的万亿),但循环频率极高。
- 推理 (Inference):训练完了给用户用。这段又是另一场战——A100/H100/Mac/AMD 各有份额。
OpenAI 用 Mac 跑的是中间这段。
为什么要用 Mac?因为 RL 这个 workload 的特征,跟"GPU 大卡车"的设计假设是反的。
<!-- 配图:RL workload 卸载决策:预训练走 H100、RL 走 Mac、inference 多家分 -->二、统一内存:绕开 H100 的最大瓶颈
英伟达 GPU 的设计哲学是把计算做得极猛,让数据搬运退居其次。代价是显存(HBM)和系统内存(DDR)严格分开,中间靠 PCIe 来回倒。在预训练那种"几千亿参数稳坐显存不动"的场景,这个架构很合理。
但 RL 不是这种场景。
强化学习的训练循环是这样的:读 prompt → 让模型想 → 生成答案 → 评分器打分 → 把分数传回去调整策略 → 下一轮。每一步都要:
- 把"读出来的环境状态"塞进模型上下文(context window 通常 32K–200K token)
- 让模型在上下文里反复推演
- 评分器读懂输出,给出 0–1 分
- 分数塞回去,再来一轮
上下文一长,数据就在"显存"和"系统内存"之间疯狂来回倒。H100 那种 80GB HBM 根本装不下 200K token 的多模态上下文,必须 spill 到系统内存。每 spill 一次,PCIe 带宽就是瓶颈。
M 系列芯片的统一内存架构(Unified Memory Architecture)跳过这个问题:CPU 和 GPU 共享同一块物理内存池,地址空间连通,根本不存在"搬运"这一步。
<!-- 配图:左,传统 GPU 显存与内存分离靠 PCIe 来回倒;右,M 系列 UMA CPU/GPU 共享同一块内存 -->这不是理论推测,这是 The Information 报道里点名的核心原因:苹果的统一内存 + Mac mini/Studio 的散热设计,让它可以在 RL 这种 workload 上"连续跑几天不降频"。
预训练是搬砖——一次性把砖头从 A 搬到 B,谁力气大谁赢。强化学习是装修——砖头在客厅和厨房之间来回搬几百次,谁少跑路谁赢。
英伟达的 H100 是福特 F-150,强化学习里你需要的不是卡车,是一台能不停车往复搬运的电动三轮车。
三、英伟达的反应是真的慢了
苹果的财报无意中承认了这个趋势:2026 Q3(4–6 月)Mac 销售同比 +29%,达到 103 亿美元,增速超过 iPhone、iPad、穿戴——Mac 成了苹果增长最快的产品线。(来源:apple.com/newsroom/2026/07)