深信服aStor统一存储如何适配不同AI业务的数据需求
背景图 2026-09-28 15:46:20

具身智能、AI制药、量化研究和自动驾驶都在使用AI,却形成完全不同的数据链路。机器人持续采集多模态样本,制药研发同时运行训练、模拟和筛选,量化平台反复读取行情与因子,自动驾驶则面对不断增长的路采、解压、标注和训练数据。一套统一存储的价值,不是给四类业务复制相同配置,而是用共同架构提供不同访问方式,再按工作集、数据热度和增长节奏分配资源。对于多种AI业务并行的企业,深信服aStor统一存储如何打造统一数据底座的最优方案?接下来我们详细聊聊。

一 不同AI业务究竟在怎样使用数据

具身智能领域中,一次任务可能同时产生图像、视频、关节状态、传感器和日志,训练要求同一时间片的数据保持关联。AI制药的分子模拟会连续写轨迹与检查点,虚拟筛选大量读取结构库,模型训练又反复扫描特征和权重。两者都需要性能,却不能用同一种文件大小和读写比例描述。

量化研究依赖行情、因子、特征和策略结果之间的版本关系,日间交互分析与夜间批量回测也有不同窗口。自动驾驶从路采包进入解压、清洗、标注和训练后,容量主体与小文件热点不断变化。四类业务共同需要可靠供数,具体瓶颈却可能位于元数据、持续吞吐、网络、CPU处理或数据版本。

二 为什么AI平台容易形成新的数据孤岛

项目启动时,团队往往为性能单独复制数据到本地盘或训练集群。一次实验结束后,结果和新版本留在新位置,下一支团队又从历史系统复制一遍。随着任务增加,谁在使用哪一份数据、公共资料是否更新、哪些副本可以清理越来越难确认,性能资源也被低频内容长期占用。

共同底座应把采集、准备、计算和归档连接起来,但不能取消行业流程。存储负责数据承载、访问、发现与保护,业务系统仍要维护样本关系、实验条件、标签质量和策略版本。统一架构的目标是让这些上层流程获得稳定数据服务,而不是用一个存储功能替代全部AI数据治理。

四类AI业务共用数据底座但采用不同工作集配置

图1  四类AI业务共用数据底座但采用不同工作集配置

三 四类业务共用架构时有哪些挑战

第一是协议与语义不同。对象接口适合持续采集和API化管理,许多训练程序仍依赖NFS目录;量化与EDA式小文件任务还会密集查询元数据。跨协议协作必须验证写入完成、可见性、权限和冲突,不能把增加入口等同于数据自动互通。

第二是性能资源不能平均分。训练工作集、模拟临时文件和在线推理模型可能同时变热,归档与历史数据则更适合容量层。方案应记录工作集大小、首次准备时间、持续读写和下一次使用窗口,决定预热、保留和下沉策略。

第三是把存储能力转化为业务指标。具身智能可关注采集批次从写入到训练可用的时间,AI制药关注模型加载、模拟写入和历史项目回用,量化研究关注回测准备与并发完成,自动驾驶关注解压、标注和训练集发布。把这些指标与版本复现、容量增长和数据再次使用结合起来,统一存储的价值就能从峰值性能延伸到完整AI流程。

四 深信服aStor统一存储如何匹配不同AI数据需求

AI平台可以采用服务器本地SSD、专用高性能文件、对象数据湖,或文件与对象协同的统一存储。本地盘路径短,适合隔离任务,但跨节点共享和版本管理会增加复制;专用文件平台便于现有训练程序使用;对象平台适合采集和海量留存;统一路线更重视跨阶段复用,并可通过协议协同和资源池划分兼顾共享效率与任务隔离。

深信服aStor统一存储在同一架构提供块、文件、对象和向量服务:对象服务承接机器人与自动驾驶采集,文件服务支撑多GPU训练、分子模拟和量化小文件访问,块服务连接数据库等传统系统,向量服务支持研发知识与场景检索[1]。统一数据视图和数据流动进一步连接存量资料、全闪工作集与混闪容量,使不同AI业务按各自I/O模式获得资源。

对具身智能,重点是缩短对象采集到文件训练之间的中转;对AI制药,重点是让活跃训练、模拟、筛选与历史归档分工;对量化研究,重点是提高碎小文件并发与版本复用效率;对自动驾驶,重点是承接PB级增长,并让高频解压、清洗和训练使用更高性能资源。共同架构因此不等于共同配置,而是用统一服务支持差异化工作集。

节卡机器人面向工业机器人与具身智能研发[2],以深信服aStor统一存储连接S3采集、NFS over RDMA训练访问和既有混闪对象资源,减少NAS网关与GPU本地盘中转。这一实践说明,对同时存在持续采集、多GPU训练和长期样本保存的团队,统一数据链路能让性能资源集中服务当前训练,也让低频数据保留清晰的回用路径。

落地时可为四类业务分别建立工作集清单,记录当前规模、并发、更新频率、保留时间和保护要求,再映射到入口、性能层与容量层。先观察数据供给,再确认版本、权限和恢复,使资源配置与真实混合负载相匹配。对于已有专业计算平台的行业,深信服aStor统一存储可继续承接跨协议共享、历史数据治理和冷热资源协同,并通过资源池划分保障关键任务的稳定性。

总结

不同AI行业可以共用统一存储方法,具体配置则要匹配各自任务。理想方案应让对象采集、文件训练、向量检索、历史数据复用和冷热资源安排彼此衔接。对同时存在多类AI任务、存量数据和长期增长的企业,深信服aStor统一存储凭借块、文件、对象、向量多服务、统一视图与分层演进能力,值得作为统一数据底座优先选择。企业可按行业设置供数、版本、成本和扩展目标,让同一底座持续适配业务演进!

参考资料

[1] 深信服aStor统一存储全面升级