GPU 在等数据——存储拿到 G3.5 这一层编号,意味着什么
胡新宇
发布于 2026-08-14
NVIDIA 给存储划出独立架构层 G3.5,AI SSD 三条路线(群联/江波龙/寅谱×联芸)正在分流。Agent 推理的新瓶颈,是让 GPU 不再为数据等待。

GPU 在等数据——存储拿到 G3.5 这一层编号,意味着什么
NVIDIA 在 GPU 显存和通用共享存储之间,单独立出来一个编号为 G3.5 的层级,由 BlueField-4 数据处理单元和 NVMe 闪存共同承载,专门装可复用的推理上下文。这是存储在 AI 推理架构里第一次拥有独立编号(来源:Z Potentials 2026-08-13 公众号)。
听起来像是一次产品发布,实际上是一次权限升级——从"配套"升成"独立层级"。这一变化的重量,要等到 Agent 推理把 GPU 算力推过拐点,才会被人真正听出响来。
一张 H100,每秒都在烧钱等数据
老的推理服务节奏简单:一次请求,一次推理,一次输出。模型权重加载进显存,算完出 token,存储从头到尾只在任务两端露个面。
Agent 完全不是这条路。一次任务可能跨越几十次模型调用、几路并行节点,中间伴随着持续的规划、检索、工具调用、验证与状态写入。KV Cache、向量索引、MoE 专家权重、用户长期记忆,在几十毫秒到几秒的尺度上被反复、交替、动态访问。系统还能不能持续吐出有效 token,越来越取决于这些数据是不是按时到了 GPU 跟前。
一张 H100 的卡价按小时算已是五位数美元量级(行业披露)。任何一次因为数据没就绪而中断的计算窗口,都在白烧钱。
而更难的是访问模式的分裂。模型权重和大段 KV Cache 喜欢高吞吐顺序读——能跑满带宽;向量查询、图遍历、稀疏专家命中是海量极小的随机访问,要的是高并发与低延迟。两种截然不同的口味在同一段推理里交替出场,只顾一头另一头一定塌房。
所以现在的问题,已经不是"要不要给推理配更好的存储",而是"整条数据路径都要重新设计"。

从内存到闪存,AI 推理的传送带正在被分层重建
NVIDIA 这次干的事不是单点优化,而是把传送带直接分层。每一层各管一段确定的行为,再把数据流串起来。
看内存层。CXL 用缓存一致性和内存语义把外部内存挂进处理器地址空间,把那批"还在活跃但塞不进 HBM"的温数据——长上下文 KV、Adapter 池、检索缓存——从单机的物理内存墙里捞出来,能跟着任务动态分配和回收。
看上下文层。这次新立的 G3.5 是这条路径上第一个围绕推理上下文设计的独立层级。它用 BlueField-4 加 NVMe 闪存在多个 GPU 节点之间建一个共享的上下文池,把费算力才生成出来的 KV Cache 沉淀下来——别让 GPU 下次重算。这样存储花的钱,就可以直接用重算减少量、GPU 利用率提升、每 token 成本下降来量化。
看传输层。cuFile 通过 GPUDirect Storage 拉一条绕开 CPU 的存储直通路,专搬模型权重和长 KV 段;SCADA 让 GPU 线程自己发起并控制存储操作,把 CPU 从控制路径和数据路径都踢出去,专门对付 Agent 场景里小于 4KB 的海量并行访问。两条线一粗一细,刚好把上面那一层吞吞吐吐的活干完。
这一层给的不是容量,是 GPU 看得见的时间。
但所有这些架构和协议的炫技,最终都要落到 SSD 这个物理设备上。垃圾回收的时候 P99 延迟抖一下,上面预取策略精心对齐的计算窗口就直接作废。这一公里,是真正的分歧点。
AI SSD 的三条路线,谁来定义数据行为是分水岭
行业聊 AI SSD 时,各家嘴里说的往往是完全不同的东西。真正的分歧早就脱离了容量和带宽的简单内卷,落在一个更底层的问题上:SSD 的数据行为——何时预取、如何冷热分层、颗粒上怎么物理摆——到底该由谁说了算?
现在能看出一条清晰的分水岭:存储厂商努力向上读懂计算逻辑,计算团队跨界向下定义存储行为。
群联选了一个"中间层"方案。在 SSD 上面架一层专属中间件,把整盘当成 GPU 显存之外的高容量缓存来用。产品边界清晰,客户不用从零搭数据管道,落地比较快。
江波龙走得更深。直接把智能化逻辑塞进主控固件——SPU 负责存储控制、缓存、压缩和数据搬运,iSA 感知推理负载并自己定冷热分层和预取策略。这样 SSD 不再只是被动等着主机提交 I/O,而是在设备自己内部就能动脑子。
