随着大模型向万亿参数、百万级超长上下文快速演进,大模型推理的系统瓶颈正在从 GPU 算力转向存力与数据搬运,AI SSD 正在推动 AI 推理存储发生范式级转移,重塑智算中心底层基础设施。
当前大模型推理面临显著现实困境:长上下文、多轮对话、Agent 业务带来 KV‑Cache 规模爆发式膨胀,昂贵稀缺的 HBM 显存容量捉襟见肘,单纯依靠 GPU 显存承载全部权重与会话缓存,带来极高部署成本;传统 SSD 仅作为静态文件存储载体,KV‑Cache 量化、索引、数据搬移交由 CPU 处理,数据路径冗长,CPU 负载飙升,GPU 频繁出现算力空转,难以承接实时推理数据流北京忆芯科…。行业数据显示,部分推理场景下 GPU 因等待数据,空闲占比可达 60‑70%。
AI SSD 跳出传统块存储的设计思路,不再是被动的数据容器,升级为近数据计算节点,在 SSD 主控内部集成 AI 算力单元,把 KV‑Cache 压缩、量化、检索、预取、冷热分层等处理任务下沉至存储盘侧完成,依托 GPUDirect Storage 等直通技术,构建 SSD 直达 GPU 的零拷贝高速通道,绕开 CPU 与主机内存中转,大幅缩短数据链路,降低端到端推理时延,释放 GPU 真实算力。
技术架构层面,AI SSD 构建 HBM‑DRAM‑AI SSD 多级内存层级,将冷态 KV‑Cache、MoE 专家权重卸载到闪存介质,以更低成本实现推理缓存容量横向扩展,有效降低单 Token 推理成本,适配云智算、知识库 RAG、智能客服、边缘大模型等多类场景。不同于普通高性能 SSD,AI SSD 围绕大模型推理数据流做固件、主控、系统软件全栈协同,支持预测式预取、数据热度调度,适配主流推理框架,兼顾吞吐、延迟与并发能力。
全球产业链已经加速布局 AI SSD 赛道,国内多家存储主控、模组厂商相继推出 AI SSD 方案,海外头部厂商也在新一代推理平台中引入闪存作为正式上下文缓存层级,标志 SSD 正式进入推理实时数据通路,不再只是外围存储设备。
业内分析表示,AI SSD 不是替代 HBM 与 DRAM,而是作为补充层级补齐内存墙短板,完成从 “算力优先” 到 “算存协同” 的范式切换。未来,AI SSD 将成为大模型推理集群的标准配置,推动大模型落地成本大幅下探,加速大模型规模化商用进程。