企业谈AI存储,关心的不只是一次训练能跑多快。数据从哪里来,采集与训练要不要反复去复制,模型和知识资料怎样长期保存,新增项目是否又要重建一套平台,都会影响AI投入能否持续产生价值。深信服aStor统一存储为什么适合这样的需求?答案可以沿着供数效率、数据复用和投入演进三条线展开:先看业务卡在哪个环节,再看相应机制与真实实践。
一、供数效率:从训练数据链定位真实等待
供数效率不能只看某块高速盘的峰值带宽,而要沿数据汇聚、清洗标注、训练读取和Checkpoint持久化这条链路定位等待。连续样本读取关注有效吞吐,大量图片或碎小文件更依赖目录扫描、元数据并发和打开关闭效率;集中保存状态时,还要观察写入与训练读取是否争用资源。先分清任务卡在找文件、读内容、网络传输还是集中写入,才能让存储能力真正服务训练节奏。

图1 深信服aStor统一存储的供数、复用与演进路径
对于大量样本并发访问,深信服aStor统一存储以目录分片分散大目录请求,由多活元数据服务共同处理创建、查询和遍历,缓解单点元数据压力。对于持续大文件供数,pNFS将元数据与数据通路分开,使兼容客户端按布局直连承载节点;NFS over RDMA在匹配的客户端和网络环境中减少数据搬运开销。这些机制分别作用于找文件与读内容,而不是用一个峰值带宽概括所有训练负载。
清华大学智能产业研究院采用深信服aStor统一存储承接持续增长的AI科研训练数据。面对超过200TB的数据及原有I/O瓶颈,项目部署3台设备、提供480TB存储空间,并以NVMe作为高性能层,结合小文件聚合、元数据优化和预加载改善训练供数。它说明共享训练底座可以围绕真实数据形态建设,再随科研任务增长扩展,而非继续让数据集中在单台服务器。
二、数据复用:让同一份数据跨阶段协同
AI项目对数据的使用具有反复、并发和跨阶段特点。训练任务会多轮扫描数据集,实验改变后又要生成新版本;推理服务在发布、扩容和换模时集中读取权重;RAG需要让原文、向量、权限与更新保持一致。若每个团队各建一套目录、对象桶和本地副本,短期看部署很快,长期却会出现版本难追溯、权限重复维护、容量反复预留和历史资料难复用。
传统生产系统也不会因为AI上线而消失。影像、研发文件、业务文档和数据库结果仍在持续产生,其中一部分会成为训练或知识应用的输入。企业真正需要的不是孤立的AI高速盘,而是能够在不先做全量迁移的情况下发现适配范围内的存量数据,再按任务把活跃工作集送到合适性能层的体系。
数据复用不是让所有应用改用同一种接口,而是让数据在保留合适访问方式的同时进入共同的治理与资源体系。深信服aStor统一存储在一套软件定义架构中提供块、文件、对象和向量四类数据服务,同时面向传统业务与AI创新:数据库继续使用块服务,训练按文件读取样本,采集和模型仓库可使用对象接口,知识应用则管理向量与原文关系。不同阶段围绕同一份有效数据协同,可以减少重复复制和新的数据孤岛。
深信服aStor统一存储在块、文件、对象和向量服务之上组织数据协同。符合支持范围的共享数据可经文件或对象接口读写,采集应用与训练程序不必仅因接口不同就再复制一套。统一视图则先汇集适配数据源的元数据,使团队按项目、路径、时间和类型发现资料,再将选中的工作集按需加载或提前预热到性能层。元数据先行缩短了数据可见的等待,预热把读取动作提前到计算启动之前。
节卡机器人采用深信服aStor统一存储建设全闪AI数据底座,连接S3采集与NFS训练。以往数据需经NAS网关复制到GPU本地盘,再对其他计算节点共享;新的链路通过协议互通和NFS over RDMA直接供给训练,并纳管已有混闪对象存储承接低频数据。这个实践的借鉴点是减少中转环节,让采集、处理与训练围绕共享数据组织,而不是把每个AI环节变成独立副本。
三、投入演进:按工作集分层配置性能和容量
为训练单独建设高性能文件存储,适合负载集中、数据来源较少、训练窗口明确的团队;以对象或云服务组织数据湖,适合已有对象应用与弹性计算体系的组织;以统一底座连接多种业务,则更适合传统生产与AI长期并存、数据需要跨阶段复用的企业。这些是建设侧重点,并非互斥的技术类别,统一底座同样可以配置专门的全闪性能资源。
投入演进的前提,是判断当前主要压力来自持续吞吐、小文件元数据、数据搬运还是长期容量。大文件读取依赖有效带宽,小文件任务依赖目录与打开操作,Checkpoint还要考虑集中写入与训练读取的重叠。性能层承接活跃工作集,容量层保存低频资料,再结合网络、客户端和任务窗口安排资源,才能把新增投入放在真正影响业务的环节。
AI数据不断增长,不代表所有历史样本都需要长期放在全闪。深信服aStor统一存储让全闪承接当前活跃工作集,混闪及适配的异构容量保存温冷数据;分层后业务仍沿原逻辑路径访问,冷数据再次使用时可以预热或按需回读。性能需求与容量增长分开规划,有助于保留既有资源的价值,也为新增模型、团队和项目提供持续扩展的空间。
对于数据源多、跨协议使用频繁、既有业务仍需稳定运行的企业,这种组合解决的是从“有数据”到“能持续用数据”的连续问题。训练集通过合适的性能路径供给,模型和知识原文使用文件或对象服务,向量资源在同一底座组织,项目结束后的低频资料进入容量层。建设重点随业务阶段变化,数据基础设施不必跟着每个新项目重新起步。
总结
AI存储的长期价值,在于让计算持续获得可用数据,并让这些数据能够被下一轮训练、模型发布和知识应用继续使用。供数效率、跨阶段复用与冷热协同需要一起设计。深信服aStor统一存储以多协议承载、元数据与高速访问机制、统一视图及数据流动连接这些环节,为企业从单个AI项目走向持续创新构筑可演进的数据底座。



