思科与英伟达推动机架级系统投产
作者: CBINEWS
责任编辑: 邹大斌
来源: 电脑商情在线
时间: 2026-08-26 09:18
人工智能基础设施市场正在跨越一道重要门槛。行业话题正从采购图形处理器(GPU)转向构建能够可靠、高效且大规模生成token的完整AI工厂。
这就是下一个瓶颈。GPU也许是引擎,但AI工厂是一个系统。计算、网络、存储、散热、软件和运营必须从第0天起一直到持续生产阶段协同运作。任何一个组件表现不佳,昂贵的算力就会闲置,收入也会随之流失。
思科网络工程高级副总裁Will Eatherton、英伟达网络高级副总裁Gilad Shainer以及解决方案架构与工程副总裁Marc Hamilton接受了采访,就新型云(neocloud)、主权AI计划和企业将基础设施推向生产环境,两家公司如何应对这一执行挑战进行了深入探讨,也谈到了在机架规模上构建AI工厂背后的工程、运营和财务要求。
这正是思科与英伟达安全AI工厂扩展至机架级系统这一动作背后的战略背景。思科与英伟达正将液冷计算、AI优化网络、经过验证的设计和统一运营整合在一起,力求压缩从订购基础设施到产出首个token之间的路径。完整的机架级安全AI工厂解决方案将于9月通过思科开放订购。
市场已经进入执行时代。赢家将由它们将资本支出转化为生产能力的速度来决定。
首个token时间成为新的基础设施指标
新型云最能说明这种紧迫性。许多neocloud在GPU到货之前就已经有客户排队等候,这意味着部署延迟会直接转化为收入递延。企业也面临类似问题,因为通过外部应用编程接口(API)消费模型的成本在不断增长。主权AI计划又增添了一层压力,因为它们必须在性能、数据控制和国家基础设施要求之间取得平衡。
这些不同的市场正汇聚到同一个问题上:一个组织能以多快的速度从采购订单走向一座生产就绪的AI工厂?
"当我们与neocloud合作时,从他们为GPU下采购订单的那一刻起,他们的终端客户就已经排好了队,"Will Eatherton说。"挑战之一就是速度——预期是项目一经规划完成,GPU一到货,就要完成软件的所有最终部署环节,然后上电、移交给他们的收入来源。"
重要的转变在于经济层面。传统企业基础设施经常被视为需要向下压缩的成本中心。而AI工厂的设计目的是制造一种数字产品:token。这些token驱动应用、智能体和业务流程,赋予基础设施与收入之间的直接联系。
这改变了记分牌。利用率、可用性、每秒token数和每瓦token数成为业务指标,而不仅仅是工程测量值。
"AI工厂中真正的成本节约不是关于省钱,而是关于token生成以及如何驱动收入——所以需要一种可复制的方法来实现它,"Marc Hamilton说。
一堆组件的堆砌不是AI工厂
这个行业不能沿用旧的数据中心手册来应对这轮建设。AI工厂是作为一台巨型计算系统运行的,由数千乃至可能数十万个组件组装而成。GPU、网络接口卡、交换机、线缆、存储系统、模型和软件库必须协同运作。
这使得架构变得至关重要。英伟达将AI工厂描述为一个五层蛋糕,涵盖数据中心的土地、电力和外壳;芯片;基础设施;模型;以及应用。性能取决于跨每一层的优化。
"建造工厂,不是把组件连起来然后祈祷一切顺利,"Gilad Shainer说。"建造AI工厂意味着你要建造一台超级计算机,而且这台超级计算机需要快速建成,需要提供最高的每秒token数、最高的每功耗token数等等。"
思科扩展后的解决方案将机架级系统和液冷纳入支持HGX和MGX外形规格的架构中,包括英伟达NVL72系统以及通往Vera Rubin平台的演进路径。思科用网络、软件、销售和支持为这些系统提供了整体包装。
网络架构将英伟达Spectrum-X以太网与思科技术相结合。Spectrum-X提供分布式AI计算所需的自适应路由、拥塞控制、远程直接内存访问(RDMA)和无损传输能力。思科Silicon One支持前端、存储和数据中心互联需求,而NX-OS或SONiC则提供了熟悉的操作模式。
这正是这对合作伙伴关系有趣的地方。英伟达带来专为AI打造的基础设施。思科带来网络覆盖面、企业运营模式,以及将AI工厂与已经流经企业业务的数据连接起来所需的既有经验。
参考架构降低财务与运营风险
参考架构有时会被贬低为技术清单。这种看法忽视了它们在AI工厂市场中的作用。
英伟达云合作伙伴(NCP)参考架构确立了整个系统应如何构建、测试和运营。思科验证设计(Cisco Validated Designs)和思科验证基础设施服务将这些要求适配到思科的网络和管理技术中。目标在于可重复性:客户不应在每次部署集群时都重新发明整个系统。
这项认证还有财务层面的影响。基础设施贷款方希望确信,他们提供融资的资产能够交付支撑投资所需的利用率、性能和可用性。因此,遵循成熟的参考架构不仅影响技术性能,还会影响融资条件。
"我们实际上听到一些全球最大的金融贷款机构表示,他们只愿以优惠利率为遵循NCP参考架构的客户提供融资,"Hamilton说。"所以,这现在成了任何思科客户、任何思科销售代表的一个巨大卖点。"
可用性是风险变得最直观的地方。一座因布线、固件或软件问题而只能以50%或60%可用性运行的数十亿美元AI工厂,会摧毁底层的经济模型。首个token重要,但第10亿个token更重要。
经过验证的基础设施减少了变量数量。它为部署团队提供了经过测试的架构、基准测试工具,以及跨思科和英伟达的统一升级路径。在笔者看来,这种运营纪律将成为AI基础设施堆栈中最有价值的层次之一。
Day 2运营将分出赢家
让AI工厂上线只是开始。模型快速迭代,推理软件不断改进,组织也在持续引入新的工作负载。系统必须在不牺牲可用性的前提下不断升级和优化。
"如果你看看Blackwell一代GPU,在其产品生命周期内,我们通过软件优化把推理成本降低了好几个数量级,"Hamilton说。"不是1倍或2倍,而是10倍、20倍、30倍。因此,AI工厂安装完成之后能够持续升级是至关重要的。"
思科正将Nexus One和思科云控制(Cisco Cloud Control)定位为一个跨路由、前端网络、存储网络和Spectrum-X后端的通用管理层。AgenticOps的加入则创造了机会,可以在整个基础设施上应用AI辅助的监控和生命周期管理。
"行业内很多关注都集中在点亮集群、产出第一个token的那一刻,"Eatherton说。"那一直是重点,这很好。但Day 2的方方面面——监控、健康度、可用性和软件升级——这些才是思科多年来一直投入大量精力的地方。"
随着推理跨越本地系统、neocloud和边缘环境,这一点变得更加重要。企业希望访问外部算力,而不必创建一套完全不同的运营环境。Neocloud则希望支持多个客户、部门和开发环境,并配以日益精细的安全和计费控制。
通用架构可以让这些边界变得不那么明显。企业应该能够在本地运行敏感推理,突发扩展到neocloud,并将智能延伸到工厂、医院、电信网络和其他边缘环境。
长期机会比卖机架更大。它关乎为智能创建一种可复制的运营模式。
AI基础设施建设也许是计算史上规模最大的资本部署周期之一,但仅凭资本无法决定结果,执行才能。市场正从GPU稀缺转向系统工程,在那里,网络、软件和运营决定一个组织能从每一美元和每一瓦特中产出多少有用的智能。
首个token时间让AI工厂进入比赛。持续的优化、可用性和规模才能赢得比赛。
