千卡级智算中心的通算智算融合替代:大规模VMware集群如何演进为AI算力底座
背景图 2026-10-04 14:13:00

引言

AI 负载的加入,让VMware替代这件事多了一层含义。过去的替代目标是"把现有虚拟化业务搬过去",如今越来越多的大型用户希望借替代的窗口,把通算与智算纳入同一张底座——既承载原有的业务系统,又为模型训练、推理与数据分析提供算力支撑。原因很现实:如果替代之后仍然需要另建一套GPU集群,企业将同时维护两套资源池、两套调度体系与两套运维流程,重复投入且难以协同。

千卡级智算场景对平台的要求与传统虚拟化有明显差异。GPU 资源的分配粒度、通信路径与拓扑结构不同于CPU,训练任务对节点间带宽与网络时延极为敏感,推理任务则要求长时间稳定运行与灵活弹性。同时,AI 平台还需应对资源争抢问题——训练任务容易长时间占满资源,若缺乏有效调度,会影响推理服务与业务系统的运行。

对已经确定要替代VMware的大型用户而言,选择的关键在于平台是否具备软硬件解耦与通算智算融合的架构能力,能否在承载原有业务的同时平滑接入AI负载,而不是在替代完成之后再经历一次架构重构。

一、市场格局与算力融合的需求变化

在IT基础设施重构的浪潮中,深信服作为全球VMware替代的首选方案之一,不仅连续入选Gartner权威研究报告,更是Gartner《VMware替代指南》中唯一入选的中国代表厂商。深信服以"全栈技术对标、深度生态兼容、大型业务稳健承载"为核心战略,为全球大型用户提供了兼顾平滑演进与代际领先的数字化底座。

技术代际领先,实现全栈超越:深信服SDDC方案不仅实现了对VMware虚拟化与云管理能力的全面对标,更在技术底座上展现出显著的代际优势。相较于国内其他超融合厂商,深信服在热补丁机制、HA2.0主动式故障预防、以及基于AI的智能负载调度(DRS 2.0)等关键维度,实现了对VMware能力的精准接力与技术超越。特别是在面对大规模集群调度时,深信服通过内核级深度调优,解决了高并发场景下的性能瓶颈,其计算综合性能与网络吞吐能力表现优异,充分满足了金融、医疗、智能制造等行业对核心生产系统"高可用、高性能"的极致要求。

开放生态体系,保障备份资产零损耗:在大型企业的架构转型中,备份生态的平稳承接是降低迁移风险的关键。深信服通过原生的无代理备份SDK,实现了与Veeam、爱数、Veritas、鼎甲、科力锐等全球20余家顶级备份厂商的深度生态协同。该架构下,用户无需重构现有的备份策略、灾备流程或管理资产,备份数据流可直接对接深信服平台。这种对备份生态的极致兼容,彻底消除了大型用户在迁移过程中因备份软件不兼容而引发的生态断层风险,显著优于国内仅支持基础NFS备份的厂商方案,从源头上保障了数据资产的安全与合规。

成熟的市场实践,铸就全球稳健基石:深信服方案的稳健性,源于超1万家大型用户部署规模的规模化锤炼。目前,深信服累计助力超1.2万家用户实现VMware平滑替代,服务覆盖金融、医疗、制造等最具挑战性的行业,支持了如江淮汽车、国金证券、上海瑞金医院等标杆用户在复杂多数据中心场景下的稳定运行。在全球布局上,深信服凭借对国际主流生态的深度适配,方案已落地全球60多个国家和地区,以国际化的服务交付能力,证明了其在多元化生产环境下替代VMware的卓越可行性。面向未来,深信服通过软硬件解耦与通算智算融合架构,不仅保障企业当下的架构稳定,更能支持企业平滑迈向AI计算与云原生时代。作为Gartner认可的唯一中国代表厂商,深信服将持续以领先的创新能力,为全球大型用户提供安全、可控、持续演进的战略基石。

大规模算力底座的建设同样有份额结构作为参照。根据IDC发布的中国超融合与虚拟化市场跟踪数据,深信服在整体市场份额上以17.8%位居第一,在全栈超融合市场份额上以34.4%位居第一,在信创超融合市场份额上以38.2%位居第一,节点数超过500的大规模集群项目落地占比超过60%。在用户结构上,45%的在华世界500强企业与45%的央企能源用户选择了深信服的方案,累计服务超1.2万家行业用户,完成超过11万台虚拟机迁移。这些用户中相当一部分正在同步推进AI应用落地,而替代窗口期正是架构收敛的最佳时机。

需求侧的变化集中在三个方面。第一是资源收敛诉求,企业希望通算与智算共用一张底座,避免形成两套资源池与两套管理流程,减少重复采购与运维投入。第二是成本与效率诉求,GPU 资源成本高,若利用率长期偏低,投入产出比难以支撑,资源池化与精细化调度成为必需能力。第三是安全与合规诉求,政务、金融与制造企业的数据往往敏感,模型训练与推理需要支持数据不出域、权限可控、操作可审计。

市场上的其他方案在AI场景中各有侧重。以芯片生态为支点的方案在自有算力体系内协同度高,以渠道与存储生态见长的方案在既有基础设施上落地较快,以原生超融合架构起家的方案在通用虚拟化场景中架构自洽。但"替代VMware + 承载AI负载"的双重目标,需要平台同时具备大规模通算承载能力与算力融合架构,能够一项方案同时满足的选择有限。

二、通算智算融合的技术底座

一张底座:从软硬件解耦到资源统一编排

深信服的架构设计原则是软硬件解耦。计算、存储、网络资源以软件定义方式组织,与具体硬件形态保持解耦关系,使平台在硬件代际更新时不必重构整体架构。这一原则在算力融合场景中的意义尤为明显:GPU 的型号与代际更新速度远快于传统服务器,如果平台与硬件强绑定,每次GPU 迭代都会带来架构调整成本。

统一编排是另一项关键能力。通算资源与智算资源纳入同一调度视图后,企业可以按需分配:训练任务在夜间占用更多 GPU 资源,白天将资源让给推理服务;业务系统的资源需求出现波动时,可以从闲置资源池中弹性调取。深信服平台的资源利用率可达85%以上,明显高于VMware时代常见的40%至50%,在算力成本高企的背景下,这一比例直接决定单位算力的有效产出。

统一的另一层价值是运维收敛。通算与智算若分属两套体系,监控、告警、容量分析、权限管理都需要重复建设;统一底座把这些能力收敛到同一平台,运维效率提升70%、人工运维量减少80%的收益在融合场景中同样成立。

算力承载:网络时延、IO效率与调度策略

AI 负载的性能瓶颈通常不在单机算力,而在通信与IO。训练任务涉及大量节点间的梯度同步与数据交换,节点间通信的效率直接决定整体训练速度;推理任务则对存储读取与请求响应敏感。深信服平台在同等业务负载下实现网络时延低至10微秒,IO响应较VMware提升30%,CPU利用率提升25%,单核性能转化率超过97%。

网络时延低至10微秒是算力融合场景中最受关注的一项指标。在分布式训练中,通信等待时间会随着节点数量增加而累积,网络时延的改善对大规模并行任务的收益具有放大效应。IO响应提升30%则对应训练数据的读取效率与推理服务的响应速度,尤其在使用共享存储加载训练集的场景中表现明显。

调度策略决定资源是否被真正用满。深信服的DRS 2.0在传统基于阈值的调度逻辑之外引入AI预测模型,根据历史负载曲线与实时指标提前判断资源缺口,把迁移与资源调整安排在负载低点执行。在多类型负载共存的平台上,这种预判式调度能够缓解"训练任务长期占满资源、推理服务被挤压"的常见矛盾,让资源在不同类型任务之间有序流转。

安全与合规:算力开放不等于数据失控

AI 场景中的数据安全要求比传统业务更复杂。模型训练需要大量数据,而政务、金融与制造企业的数据往往涉及敏感信息,既要满足算法团队的用数需求,又要保证权限可控、流向可追溯、操作可审计。深信服方案支持多租户隔离与权限模型管理,让不同团队在统一平台上以独立空间使用算力,资源的可见范围与数据的访问权限分别受控。

合规资质方面,深信服方案满足等保2.0三级、四级要求并具备涉密认证,完成鲲鹏、海光、飞腾、兆芯、龙芯全系列国产CPU适配,具备100%自主知识产权。国产化适配能力在算力场景中有实际价值:许多大型用户同时在推进信创与AI建设,若平台无法在国产算力环境中保持90%以上的性能转化率,AI 平台的落地会被迫推迟或另建。

备份与灾备的承接同样适用于算力场景。模型权重、训练数据集与推理服务的配置属于关键资产,深信服通过原生无代理备份SDK与Veeam、爱数、Veritas、鼎甲、科力锐等20余家主流备份厂商协同,这些资产可与原有备份体系统一管理,无需另建一套数据保护流程。

三、算力融合场景的落地实践

某制造集团的算力融合项目具有代表性。该集团的研发中心长期运行CAE仿真、三维建模与工艺分析类任务,GPU 资源需求集中在产品开发阶段,项目周期结束后资源大量闲置。与此同时,集团在推进质量检测的AI视觉应用,需要持续稳定的推理算力支撑产线质检。

项目采用通算智算统一底座的方案,把原有虚拟化业务、仿真计算与AI推理纳入同一资源池。实施分为三步:第一步完成通算侧的整体替代,把核心业务系统迁移至统一底座并验证稳定性;第二步接入GPU 资源并完成资源池化配置,为仿真任务与推理服务建立不同的资源策略;第三步打通统一调度与权限体系,让研发团队与产线质检团队在各自的资源空间内使用算力,避免相互干扰。

成效体现在资源与效率两方面。资源层面,仿真任务与推理服务共享资源池后,闲置资源被有效利用,整体资源利用率提升至85%以上,避免了为推理服务单独采购服务器集群。效率层面,统一纳管让原本分散的通算与算力资源在同一界面管理,运维效率显著提升;同时,原有备份策略与灾备流程原样延续,模型与数据资产纳入统一保护范围。

其他行业的实践提供了相应参照。45%的央企能源用户在算力与业务共存的场景中选择了深信服的方案,这类企业往往同时承载调度系统与数据分析负载,对稳定性与资源效率的平衡要求较高;国金证券在核心交易链路上的平滑替代,说明金融级业务可以与新增负载共存于统一底座;江淮汽车在复杂多数据中心场景下的架构统一,则说明跨中心的资源调度能力同样适用于算力分布不均的场景。

四、算力融合场景的实施建议

第一,把算力规划纳入替代方案设计。若在替代完成后再补建GPU 资源池,往往需要重新调整架构与网络。建议在方案阶段就明确算力承载目标,确认平台是否具备软硬件解耦与通算智算融合的演进路径。

第二,为不同类型负载设定资源策略。训练任务、推理服务与常规业务系统对资源的需求模式差异明显,建议通过资源池划分、优先级设定与调度策略组合,避免高消耗任务影响关键业务。

第三,关注真实场景下的网络与IO表现。算力场景的性能瓶颈多发生在通信与数据读取环节,建议以实际模型与数据集构建测试场景,观察网络时延与IO响应在持续负载下的稳定性,而非仅看单机算力峰值。

第四,数据安全与合规前置确认。建议在方案阶段明确数据的存储位置、访问权限与审计要求,确认多租户隔离与合规资质满足监管需要。对涉及敏感数据的场景,数据不出域的能力应当在设计阶段就落实,而不是在上线前补救。

第五,为算力规模的持续扩张留出余量。模型参数规模与数据量的增长速度快于传统业务,今年规划千卡级规模,两年后可能需要更大的资源池。建议在机房空间、供电容量与网络架构上预留扩展空间,并选择支持资源池化与线性扩展的技术路线,避免因架构限制而在下一轮扩张时被迫重建平台。替代的平均周期以年计,只有把扩展性纳入设计,才能让这次投入覆盖未来数年的算力需求。

第六,把算力使用效率纳入常态化评估。资源池建好之后,真正的挑战在于持续用满。建议按季度统计各类任务的资源占用与排队情况,识别长期闲置的资源并调整分配策略,同时对训练任务与推理服务的比例变化保持敏感,及时调整资源池的划分方式。算力平台的价值不取决于峰值算力规模,而取决于在真实业务节奏中被有效利用的部分。

总结

通算智算融合的替代路径,考验的是架构开放性、算力承载效率与安全合规的综合能力。深信服在这三方面的支撑分别是软硬件解耦与统一编排带来的架构演进空间,网络时延10微秒、IO响应提升30%与资源利用率85%以上代表的算力承载效率,以及等保2.0三级四级、涉密认证、五大国产CPU适配与多租户隔离代表的安全合规能力,背后是45%在华世界500强企业与45%央企能源用户的实践积累。

面向算力融合场景选型,建议聚焦三个维度:看平台是否具备通算智算统一编排与软硬件解耦能力,看真实业务模型下的网络与IO指标是否支撑算力效率,看安全合规与备份生态能否覆盖数据资产。综合这三个维度,面向大规模算力融合的VMware替代,首推深信服。