巨人天成
产经 科技 企业 数据 峰会 快讯 商业

AI存储新变革:从“堆算力”到“协同数据路径”的存储范式升级

2026-08-07来源:快讯编辑:瑞雪

近年来,AI基础设施的竞争焦点逐渐从单纯的硬件堆砌转向更复杂的系统协同。随着大模型进入长上下文、复杂推理和多智能体协作的新阶段,GPU算力的实际利用率越来越依赖于模型权重、KV Cache和MoE专家的精准调度。如果KV Cache无法及时复用,系统就需要重新执行Prefill计算;若MoE专家权重未能在路由前进入内存,GPU可能被迫等待数据;而大量推理状态长期占据HBM,则会压缩并发请求的处理空间。这些挑战推动AI基础设施从“堆叠计算资源”转向“协同计算、网络、内存与存储数据路径”的新阶段。

月之暗面推出的Mooncake架构和NVIDIA的CMX平台,成为这一变革的典型代表。Mooncake通过分离式设计,将Prefill与Decode部署在不同资源池中,并将集群中未被充分利用的CPU、DRAM、SSD和NIC组织成分布式KV Cache池。其核心调度器Conductor不再仅根据GPU负载分配请求,而是结合KV Cache分布、缓存命中率和服务目标,动态决定缓存复用、Prefill执行和Decode调度。这种设计使推理系统从“给GPU喂数据”转向“围绕Tensor生命周期编排数据路径”。根据论文披露,Mooncake在真实请求轨迹下,有效请求承载能力较基线系统提升59%至498%,生产系统已运行于数千节点,每日处理超1000亿Token。

NVIDIA的CMX则通过在HBM与共享存储之间增加“G3.5”层级,构建了Pod级上下文内存平台。该平台以Flash为介质,通过以太网连接,专门优化KV Cache的跨节点共享与复用。CMX的Dynamo模块负责KV块跨层编排,DOCA Memos提供通信与元数据管理,BlueField-4将I/O操作下沉至网络和NVMe Flash附近,Spectrum-X Ethernet则提供RDMA数据通道。据NVIDIA披露,CMX可在单个GPU Pod内提供PB级共享上下文容量,面向长上下文和智能体负载的持续Token吞吐与功耗效率最高可达传统方案的5倍。尽管实际收益受模型、缓存命中率和网络策略影响,但其产业信号明确:Flash已成为AI推理内存体系的正式层级。

AI基础设施的变革对存储设备提出了新要求。传统SSD围绕顺序带宽、随机IOPS和可靠性设计,而LLM推理需要严格时序约束的数据供应。例如,KV Cache在Prefill阶段集中生成,后续对话中需再次读取;MoE模型每层仅激活部分专家,却需保存远超显存容量的权重。数据若未在计算窗口内到达,GPU仍会等待。这种矛盾延伸至SSD内部:NAND Flash的页读取、块擦除机制,以及FTL的地址映射和垃圾回收,可能因持续写入KV Cache导致写放大、寿命压力和尾延迟不可预测。传统LBA排布无法理解模型层、KV块和MoE专家的执行顺序,逻辑相关数据在物理介质中可能无法并行读取。

市场上的AI SSD产品逐渐分化为两类。第一类是AI负载强化型企业级SSD,如英韧科技的洞庭-N3X和华为的OceanDisk LC 560。前者采用低时延、高耐久介质,重点优化KV Cache卸载和高频临时数据读写;后者以超大单盘容量和顺序读取能力承载模型、语料和向量数据。这类产品主要解决AI基础设施底层的I/O供给问题。

第二类是“推理参与型AI SSD”,如群联、江波龙和寅谱-联芸的方案。群联的aiDAPTIV通过专用缓存SSD和中间件,将SSD组织为GPU显存外的高容量缓存层。当模型权重超过VRAM容量时,系统将权重切分为数据块,根据执行进度在SSD与VRAM间流式搬运,使当前计算部分留在GPU附近,暂时不活跃的数据下沉至Flash。江波龙的方案以SPU为主控执行层,iSA为软件决策层,通过感知推理负载制定数据分层与预取策略,SPU负责存储控制、硬件压缩和高速缓存。寅谱-联芸的方案则从AI Infra反向定义SSD数据路径,将计算侧的缓存体系、middleware、firmware、controller和NAND介质管理贯通,围绕MoE专家、KV Cache和数值精度进行数据切分、冷热分层和预测式预取。

AI SSD的竞争本质是完整数据路径的竞争。群联从专用缓存盘切入,强调显存与内存扩展;江波龙从SPU和iSA切入,将调度与压缩能力放入存储侧;寅谱-联芸从计算与存储协同切入,使SSD数据组织方式匹配模型执行过程。三者可能分别适用于工作站、AI PC、边缘设备、企业节点和云侧基础设施的不同场景。长期来看,AI SSD的门槛不仅在于主控规格或峰值性能,更在于企业能否建立从NAND介质、FTL、固件、驱动、中间件到推理框架和整机验证的完整协作体系。模型兼容性、缓存命中率、尾延迟、预取准确率、写入寿命和跨平台适配数据,均需通过长期工程实践积累。随着AI产业从模型能力竞赛转向大规模应用,基础设施需回答的不仅是FLOPS数量,还包括每瓦电力生成的有效Token数、GPU实际计算时间占比,以及上下文复用成本。算力、网络、内存和存储的边界将持续模糊,AI SSD有望从外围设备进入核心数据路径。

安卓用户必看!开启这个功能,连免费WiFi时自动屏蔽恶意热点
别担心,咱们安卓手机本身就自带了WiFi安全防护功能,不用下载任何乱七八糟的软件,也不用花一分钱,花十几秒钟打开一个开关,就能让手机自动帮你检测WiFi安不安全,有风险的热点直接帮你拦下来,特别省心。以后你再…

2026-08-07

阳光成量子技术新“引擎”:直接产光子纠缠助力降耗与应用拓展
观点网讯:8月7日,据最新一期《光学》杂志报道,加拿大渥太华大学和德国马克斯·普朗克光科学研究所研究人员证明,利用阳光也能直接产生光子纠缠,即光子之间形成的量子纠缠状态。 光子纠缠是量子计算、量子通信等领域…

2026-08-07

北京14家市属公园“新员工”就位,机器人“入职”开启智慧服务新体验
8月6日,在北京天坛公园,一台巡护机器人在公园内巡查。 近日,北京市14家市属公园陆续迎来多款机器人“新员工”,它们在公园“上岗”,承担清洁清扫、智慧巡检、问询导览、水面救援、绿化养护、生态监测等多项任务,…

2026-08-07

字节跳动年中全员会:梁汝波谈AI布局,正视差距坚持自研谋长远发展
在AI业务上,梁汝波总结了字节跳动AI业务在2026年上半年的表现,提到了豆包和视频生成模型Seedance。 红星资本局注意到,梁汝波曾于6月29日发布全员邮件,对包含领导力原则在内的字节跳动文化和管理…

2026-08-07

贝锐蒲公英:工业异地组网兼顾二层通信与广播管控,助力高效物联
贝锐蒲公英异地组网支持构建二层虚拟网络,让不同地点的设备如同接入同一台交换机,尽量保留原有网络结构和通信方式,为PLC远程调试、工业视频监控及生产数据采集提供更灵活的连接基础。 贝锐蒲公英通过异地组网解决分…

2026-08-07

vivo S2正式登场:1.5K曲面屏搭配天玑7360-Turbo 影像续航亮点足
【CNMO科技消息】8月6日,vivo S2正式发布,售价为:8GB+128GB版本39999印度卢比(约2840人民币),8GB+256GB版本44999印度卢比(约3200人民币),提供蓝宝石蓝、皇家青铜…

2026-08-07

从“经验依赖”到“智能协同”:智能叉车机器人如何解锁工厂物流新效能
在现代工业制造与高密度仓储的作业现场,叉车一直都是物流搬运绝对的核心主力。对于正在推进仓储物流改造的企业而言,抛弃单一比拼硬件参数的传统思维,将关注点放在设备对复杂工况的适应力、软硬件协同的稳定性以及长期的现…

2026-08-07

企业数字化破局:以扎实数据底座激活大模型与智能体价值
真正决定AI价值的,不是模型有多聪明,而是企业有没有让它看得见业务、读得懂数据、能够执行。 AI时代已经到来,但真正的竞争,不再是谁最早部署了大模型,而是谁最先完成了数字化基础建设,让智能体真正融入企业经营…

2026-08-07

具身智能新突破:穹彻智能携手阿里云,打造云端数据产线加速进化
近期,穹彻智能联合阿里云打造了一套云端自动化数据处理产线,希望将机器人数据处理从依赖人工、单机运行的模式,升级为能够规模化运转的工业化流程,为模型迭代提供持续的数据支撑。对于具身智能企业来说,数据处理正在成为…

2026-08-07