GPU 在等数据——存储拿到 G3.5 这一层编号,意味着什么
胡新宇
Published on 2026-08-14
NVIDIA 给存储划出独立架构层 G3.5,AI SSD 三条路线(群联/江波龙/寅谱×联芸)正在分流。Agent 推理的新瓶颈,是让 GPU 不再为数据等待。

GPU 在等数据——存储拿到 G3.5 这一层编号,意味着什么
NVIDIA 在 GPU 显存和通用共享存储之间,单独立出来一个编号为 G3.5 的层级,由 BlueField-4 数据处理单元和 NVMe 闪存共同承载,专门装可复用的推理上下文。这是存储在 AI 推理架构里第一次拥有独立编号(来源:Z Potentials 2026-08-13 公众号)。
听起来像是一次产品发布,实际上是一次权限升级——从"配套"升成"独立层级"。这一变化的重量,要等到 Agent 推理把 GPU 算力推过拐点,才会被人真正听出响来。
一张 H100,每秒都在烧钱等数据
老的推理服务节奏简单:一次请求,一次推理,一次输出。模型权重加载进显存,算完出 token,存储从头到尾只在任务两端露个面。
Agent 完全不是这条路。一次任务可能跨越几十次模型调用、几路并行节点,中间伴随着持续的规划、检索、工具调用、验证与状态写入。KV Cache、向量索引、MoE 专家权重、用户长期记忆,在几十毫秒到几秒的尺度上被反复、交替、动态访问。系统还能不能持续吐出有效 token,越来越取决于这些数据是不是按时到了 GPU 跟前。
一张 H100 的卡价按小时算已是五位数美元量级(行业披露)。任何一次因为数据没就绪而中断的计算窗口,都在白烧钱。
而更难的是访问模式的分裂。模型权重和大段 KV Cache 喜欢高吞吐顺序读——能跑满带宽;向量查询、图遍历、稀疏专家命中是海量极小的随机访问,要的是高并发与低延迟。两种截然不同的口味在同一段推理里交替出场,只顾一头另一头一定塌房。
所以现在的问题,已经不是"要不要给推理配更好的存储",而是"整条数据路径都要重新设计"。

从内存到闪存,AI 推理的传送带正在被分层重建
NVIDIA 这次干的事不是单点优化,而是把传送带直接分层。每一层各管一段确定的行为,再把数据流串起来。
看内存层。CXL 用缓存一致性和内存语义把外部内存挂进处理器地址空间,把那批"还在活跃但塞不进 HBM"的温数据——长上下文 KV、Adapter 池、检索缓存——从单机的物理内存墙里捞出来,能跟着任务动态分配和回收。
看上下文层。这次新立的 G3.5 是这条路径上第一个围绕推理上下文设计的独立层级。它用 BlueField-4 加 NVMe 闪存在多个 GPU 节点之间建一个共享的上下文池,把费算力才生成出来的 KV Cache 沉淀下来——别让 GPU 下次重算。这样存储花的钱,就可以直接用重算减少量、GPU 利用率提升、每 token 成本下降来量化。
看传输层。cuFile 通过 GPUDirect Storage 拉一条绕开 CPU 的存储直通路,专搬模型权重和长 KV 段;SCADA 让 GPU 线程自己发起并控制存储操作,把 CPU 从控制路径和数据路径都踢出去,专门对付 Agent 场景里小于 4KB 的海量并行访问。两条线一粗一细,刚好把上面那一层吞吞吐吐的活干完。
这一层给的不是容量,是 GPU 看得见的时间。
但所有这些架构和协议的炫技,最终都要落到 SSD 这个物理设备上。垃圾回收的时候 P99 延迟抖一下,上面预取策略精心对齐的计算窗口就直接作废。这一公里,是真正的分歧点。
AI SSD 的三条路线,谁来定义数据行为是分水岭
行业聊 AI SSD 时,各家嘴里说的往往是完全不同的东西。真正的分歧早就脱离了容量和带宽的简单内卷,落在一个更底层的问题上:SSD 的数据行为——何时预取、如何冷热分层、颗粒上怎么物理摆——到底该由谁说了算?
现在能看出一条清晰的分水岭:存储厂商努力向上读懂计算逻辑,计算团队跨界向下定义存储行为。
群联选了一个"中间层"方案。在 SSD 上面架一层专属中间件,把整盘当成 GPU 显存之外的高容量缓存来用。产品边界清晰,客户不用从零搭数据管道,落地比较快。
江波龙走得更深。直接把智能化逻辑塞进主控固件——SPU 负责存储控制、缓存、压缩和数据搬运,iSA 感知推理负载并自己定冷热分层和预取策略。这样 SSD 不再只是被动等着主机提交 I/O,而是在设备自己内部就能动脑子。
寅谱和联芸的组合则是另一条路。寅谱从推理芯片和近存计算走过来,天然知道模型执行序列长什么样;联芸有从 SSD 主控到 NAND 适配再到模组量产的产业基础。两家把"计算侧对模型执行顺序的理解"和"存储侧的主控固件介质"在协议层和指令集层对齐,针对 KV Cache、MoE 专家、不同精度数据做切分、冷热管理和预测式预取。
三条路线各有适配场景。但如果推理真正的瓶颈是"数据行为能不能贴合模型执行节奏",那由计算侧提供语义、存储侧做确定性执行的组合,更容易把收益摊在 GPU 利用率和每 token 成本这两根看得见的尺子上。最终谁跑得通,取决于谁能把这套打法真正变成可量产、可被客户采购算账的具体产品——而不是停留在架构图里。
老问题问的是谁更大,新问题问的是谁更懂模型。

从单盘到节点,再到数据治理
无论数据行为归谁定义,AI SSD 的产品形态本身已经悄悄变了。
CMX 已经把这层东西以"存储节点"的方式拉进推理集群——一个节点维护跨多个 GPU 共享的 KV 目录和 Prefix 缓存,承载 Adapter 和模型镜像,并在靠近介质的位置执行预取、压缩、加密和租户隔离。开源的 Mooncake 早就在做类似的事:把 CPU、DRAM、SSD 和网络组织到统一控制面下做一个分布式缓存池,把原本各管各的存储资源变成可调度的数据层(来源:Mooncake 开源仓库设计文档)。客户下单的角度也跟着变了——从单盘容量和带宽,转到有效上下文容量、缓存命中率、跨节点共享能力、数据治理成本。
Agent 持续吐出的状态把治理需求撑爆了:模型上下文、工具调用轨迹、记忆对象、证据链——每一条都要找得到、删得掉、有版本、有 TTL;每一次 I/O 都可能涉及租户权限校验和身份绑定。这些事已经超出了传统块设备的能耐边界。设备不必理解完整模型,但必须按上层给的语义去动手做放置、回收和生命周期管理。功能越往 Agent 那边靠,语义边界就越得划清,执行也得能审计。
后果是:未来存储产品的竞争不止跑在硬件规格表上,还要延伸到控制面软件、Runtime 适配和长期 SLA 承诺。
编号只是入场券,竞争标尺已经换成每 token 成本
存储拿到了 G3.5 这个层级编号,正式进入 AI 推理的核心架构图。但——这只是一张入场券。
上一轮竞争,存储厂商比拼的是颗粒密度、主控速度和固件稳定度。这些硬功夫不会过时,但正在从胜负手降维成基本功。
Agent 推理场景下,客户评估存储的尺子已经换了:有效上下文容量、缓存命中率、GPU 利用率、P99 延迟的稳定性、每 token 成本、每瓦 token 产出。这些指标衡量的不再是存储硬件的绝对物理性能,而是它对系统有效 token 产出的实际贡献。
训练数据吞吐、模型文件存放这种老场景里,传统大容量通用存储的价值不会消亡。但在 Agent 推理这条全新的数据路径上,竞争的尺子正在从每 TB 成本转向每 token 成本。
存储厂商要修的下一层壁垒,可能不只是介质和主控的物理跃迁,更是把模型到底怎么跑这件事吃透。对中国厂商来说,机会不在追美光的颗粒密度,而在能不能在 G3.5 这一层抢先做出"按模型节拍动手"的存储节点。
谁能把一张 GPU 卡每天的有效 token 抬高一截,谁就是下一个十年的存储霸主。
至于存储厂商会不会再往上一格,自己下场做 Agent 推理调度——这才是未来两年值得盯着看的真问题。