很多智算团队都遇到过同一个困惑:GPU 采购预算花了不少,监控面板上利用率却常年只有三四成。问题往往不在 GPU 本身,而在给它喂数据的存储系统。业界把这道性能鸿沟称为「存储墙」——它正在成为 AI 基础设施投入产出比的最大杀手。
存储墙:一组值得记住的数字
过去十年,单块 GPU 的算力增长了约 1000 倍,同期存储性能只增长了约 90 倍,两者差距超过 11 倍且仍在拉大。结果是:典型 AI 训练任务中,GPU 有效计算利用率不足 40%,其余时间都在等待数据加载。按 8 卡服务器百万元级的采购价折算,相当于四成以上的算力支出被闲置。
存储墙在训练现场有四种典型表现:
| 表现 | 根因 |
|---|---|
| GPU 喂不饱,第一个 epoch 前排队极慢 | 聚合带宽不足,TB 级数据集冷启动读取慢 |
| 小文件越多训练越慢 | 亿级文件量击穿元数据处理能力,IOPS 断崖式下跌 |
| 数据反复搬运拷贝 | 块、文件、对象多套存储割裂,预处理→训练→归档各存一份 |
| 越扩容越慢 | 传统集中式架构存在控制器瓶颈,加节点性能不升反降 |
训练负载到底要什么:三个指标看懂
评估训练存储,参数表里这三项是核心,缺一不可:
IOPS(每秒 IO 操作数)。训练数据集动辄数千万到上亿个小文件(图像、文本切片、序列化样本),每个文件的打开、读取、关闭都是元数据操作。小文件高并发读取场景,元数据 OPS 不足会直接卡死数据管道。当前全闪分布式存储的第一梯队水平是亿级 IOPS。
聚合带宽(吞吐量)。千亿参数模型的单次 checkpoint 就是 TB 级写入;多机分布式训练时所有节点并行读数据集,带宽需求叠加。TB/s 级聚合带宽是大规模集群的门槛指标。
延迟。决定 GPU 每一步「拿到下一批数据」的等待时间。全闪架构的标杆水平是十微秒级(P50 个位数微秒、P99 双位数微秒),长尾延迟控制不好,再高的峰值指标也会在真实负载里被拖垮。
一个提醒:以上指标应要求实测数据而非纸面峰值——正规厂商能提供标准化 benchmark 报告与现场实测环境,包括文件、块、对象多协议下的真实负载模拟。
除了性能:选型的五个硬指标
1. 架构:去中心化优于集中式
传统双控存储像高速公路收费站,所有 IO 排队过控制器;去中心化全对称架构没有中心节点,每台节点既能存数据也能参与调度,性能随节点数线性增长。判断标准很简单:要一份「集群规模 vs 性能」的扩展曲线,看千节点规模下性能是否仍能线性输出(扩展拟合度 R² 接近 1 为佳)。
2. POSIX 原生兼容:零改造迁移
训练框架(PyTorch、DeepSpeed 等)与数据处理管道都基于 POSIX 文件接口。选择原生 POSIX 兼容的存储,现有代码不用改一行直接挂载;通过协议转换网关模拟的兼容方案则有语义差异和性能损耗两重坑。
3. 多协议统一:一套存储池承载全流程
预处理(对象/POSIX)、训练(文件)、归档(对象/块)往往用不同协议。理想方案是文件、块、对象三类接口访问同一个存储池,数据不搬家,跨协议天然一致。核对支持的协议清单(NFS、CIFS、S3、iSCSI、HDFS 等)并确认是否有网关损耗。
4. 可靠性:看冗余层级与可用性等级
训练一跑数周,存储故障等于全部作废。评估两点:冗余机制是否覆盖介质(多副本/纠删码)、节点(自动检测重建)、网络(链路切换)、数据(校验自愈)、机房(异地复制)五个层级;可用性等级能否达到 99.999%(五个九)以上并承诺数据零丢失。checkpoint 的高速写入与秒级快照能力,决定故障后能从多近的点恢复。
5. 国产化适配:信创场景的前置条件
政务、能源、金融等信创项目要求全栈国产:CPU(飞腾、鲲鹏、龙芯、海光)、操作系统(麒麟、统信)、以及元器件可溯源。值得注意的是,国产平台上的性能调优深度差异很大——同一产品在国产 CPU 上的实测表现应单独验证,而不是只看 x86 环境的数据。
算一笔总账
训练存储的投入产出要用 TCO 衡量:以百卡集群五年周期测算,电费、机房空间与故障损失往往与硬件采购同量级。全闪方案单位容量的功耗(每 TB 3-4W 是优秀水平)、机箱密度(2U 1.5PB 级)与故障率,共同决定了同样 GPU 数量下你能「喂」出多少有效算力。
如果你的智算集群正被数据供给拖慢,可以把训练规模(模型参数量、数据集大小、节点数)发给我们,我们可以帮你测算存储侧的带宽与 IOPS 需求,给出匹配的配置方案。