AI云的运维大不同:安全、性能与容灾三大差异

作者: CBINEWS

责任编辑: 邹大斌

来源: 电脑商情在线

时间: 2026-08-19 10:51

关键字: 微软 谷歌 成本 AI安全 企业IT

企业正在认真考察"新云"(Neocloud)——围绕AI基础设施构建的专业云服务商,重点是GPU、高速网络以及用于模型训练和推理的大规模计算集群。与传统超大规模云提供覆盖几乎所有企业工作负载的广泛平台不同,新云更专注于加速计算。CoreWeave、Lambda、Crusoe Cloud等都是这一新兴AI基础设施市场的代表。

企业的兴趣不难理解。一方面,企业面临将生成式AI、机器学习和高级分析项目从实验室推向生产的压力;另一方面,从主流超大规模云获取大块GPU容量变得越来越昂贵、受限甚至困难。许多企业发现,新云能提供更好的经济性、更快的容量获取,或更贴合AI工作负载的配置。

这并不意味着AWS、微软Azure和谷歌云会被取代。它们仍是大多数企业云部署的默认运行环境,提供成熟的管理平面、安全工具、合规框架、全球足迹、托管服务和运营生态。但AI已经改变了基础设施的讨论方式:企业越来越少纠结于标准化在哪个云上,而更关注在需要时获得AI容量,且价格不摧毁商业案例。

一个常见问题是:"维护这些远程AI云系统,与我们在AWS、Azure或谷歌云上做的事情有多大不同?"答案是:云运营的基本原理仍然适用,但管理模式在重要方面发生了变化。新云不是更便宜的超大规模云,而是专业化基础设施环境,专业化总会带来权衡。最大的管理差异体现在三个领域:安全、性能和容灾。

安全:欠发达,需企业更多直接担当。超大规模云的安全生态是成熟的——身份系统、密钥管理、日志工具、策略引擎、合规程序、网络控制、漏洞管理和安全监控一应俱全。新云的成熟度则参差不齐,一些提供商具备强大安全能力,另一些仍在构建企业级控制。这意味着管理员不能假设身份联邦、特权访问控制、审计日志、加密、网络分段和合规报告的行为方式与习惯一致。AI工作负载往往涉及企业最有价值的数据:训练集、微调数据、提示词、嵌入、模型权重、向量数据库和推理输出。共享责任模型依然适用,但必须逐提供商审查:谁控制加密密钥、管理访问如何授予和撤销、日志如何导出到安全运营中心、租户间数据如何隔离、服务商人员访问如何治理。

性能:管理要贴近物理基础设施。传统云管理让企业习惯于抽象——选择实例类型、存储类、托管数据库、自动扩缩策略和可观测性仪表板,底层硬件被服务模型隐藏。AI改变了这一切:GPU类型、显存、互联设计、存储吞吐、集群拓扑、作业调度、数据局部性和网络延迟都会直接影响AI工作负载的性能和成本。GPU经济性毫不宽容,空闲或未充分利用的GPU是重大财务问题。管理员需要理解AI工作负载在大规模下的行为,这要求云运维、AI工程、数据工程、平台工程和财务部门更紧密协作。容量规划也在改变:新云的容量可能通过预留、固定集群、特定硬件承诺或合同窗口获得,管理员需要将训练排期、实验周期、推理增长和预算控制与提供商的实际容量模式对齐。新云的性能管理不只是看仪表板,而是在基础设施层面管理工作负载经济性。

容灾:需要更详细的恢复计划。太多企业仍相信"跑在云里就自带弹性",这个假设在任何云环境都危险,在专业AI基础设施上更甚。超大规模云提供大型全球足迹、多区域、可用区、复制服务、备份工具和托管故障转移,新云未必具备同等的地理深度和原生连续性服务。恢复AI系统不同于恢复传统应用服务器:需要保护数据集、训练检查点、模型工件、特征存储、向量数据库、编排管道、容器镜像、配置文件和推理端点。如果新云环境不可用,能否从检查点重启训练?推理能否迁移到另一环境?同一模型能否在不同的加速器、驱动、框架和网络假设下运行?这些问题必须在停机之前回答。训练作业可以暂停后重启,但嵌入客户流程的生产推理系统可能需要激进得多的恢复目标。

企业应以现实的期望评估新云。经济性可能打开大门,容量可能让决策变得紧迫,但新云采用的长期成功,取决于企业能否管好这些差异。

ToB最前沿

ToB最前沿抖音号

CBI科技在线

地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 商务内容合作QQ:2291221 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除
京ICP备:2022009079号-3
京公网安备:11010502051901号
ICP证:京B2-20230255