AI推理:成功AI应用的五个最佳实践
作者: CBINEWS
责任编辑: 邹大斌
来源: 电脑商情在线
时间: 2026-08-20 11:08
当一些组织还在起步阶段制定AI战略时,另一些组织已陷入"试点炼狱"——鲜有实验或概念验证(POC)能进入生产。据《企业AI现状》报告,只有25%的组织将40%及以上的AI实验推进到了生产环境。
在最近一次LinkedIn Live的"Coffee With Digital Trailblazers"节目中,讨论了如何交付有价值的AI概念验证。POC受阻的一个关键原因是与AI业务战略契合度不高,或缺乏明确的业务成果。另外两个问题:没有足够的AI变革管理计划,或员工未参与开发过程。
但还有一个重要的技术问题:用于训练AI模型和开发AI智能体的架构,可能与用于AI推理的架构截然不同——推理是在生产环境中运行已训练模型来生成输出。训练和推理在性能、可扩展性、合规性和安全性方面的要求差异巨大,把AI推理想当然地视为训练架构的放大或缩小版本是错误的。
"行业焦点正迅速从训练前沿模型转向优化生产环境中的AI推理。"OVHcloud美国产品高级副总裁Pascal Jaillon表示,"企业正在认识到,AI的长期成功更多取决于在分布式环境中平衡延迟、可扩展性、安全和基础设施成本,而非原始模型规模。随着推理工作负载的扩展,组织正越来越多地评估传统超大规模云单一策略之外的替代方案,以提高成本效率、数据主权和运营灵活性。"
优化AI推理环境还必须考虑运行条件、合规要求和成本权衡。EY杰出技术专家Rick Ross表示:"对CIO而言,本地化推理是一种深思熟虑的架构选择,专为机器人等延迟敏感型应用、或法规强制要求的场景而保留。"
等到AI实验或POC成功后再考虑其推理架构可能是个错误。它可能带来意想不到的返工,或增加需要重启开发流程的复杂性。以下是构建有效AI推理架构、基础设施和运维的五个最佳实践。
1. 为集成和性能设计架构
训练架构是为吞吐量和灵活的数据需求而设计的,而推理需要低延迟、高可靠性和自主运行。AI智能体的推理环境还必须考虑如何通过模型上下文协议(MCP)服务器和智能体间(A2A)集成来编排工作流。
"IT团队应先实现集成和编排层的现代化,确保在AI系统大规模部署之前,它们能够支持事件驱动、低延迟和高可靠性的接口。"Amdocs旗下Amdocs Studios部门总裁Riki Efraim-Lederman表示,"许多遗留环境看起来运行正常,是因为人类在幕后弥补了缺口,但一旦AI系统开始自主行动,这一安全网就会消失,那些弱点会迅速暴露。"
随着组织部署更多AI智能体、使用量增加,devops团队必须考虑不同用例的延迟要求以及峰值负载性能要求。
"IT团队低估了复杂性累积的速度——来自不可预测的突发流量、敏感数据管道,以及在不透明的API和工具链上执行的AI智能体。"Versa AI/ML高级总监Sridhar Iyer表示,"AI推理越来越需要分布式架构,根据延迟、主权和成本在云端、本地和边缘位置之间动态切换工作负载。"
训练环境通常需要灵活访问多个大规模数据源来测试和优化AI模型。这与推理环境形成对比:推理环境往往连接更少的运行时数据源,可用性和延迟是关键的设计考虑因素。
"边缘推理或跨分布式环境推理,只有在数据库与架构匹配时才有效:本地化、一致且高可用。"pgEdge CEO兼联合创始人Phillip Merrick表示,"IT团队倾向于把基础设施决策和数据决策当作两条独立的工作流,但它们不是,它们是同一个决策。"
2. 保护AI的数据和操作
在训练环境中,IT部门可以设置防火墙阻止外部访问、屏蔽敏感数据,并将操作限制在测试环境中。推理环境则需要安全设计(secure-by-design)策略,因为AI智能体要访问实时数据、跨生产SaaS平台自动化操作,并要求围绕决策权限进行动态安全评估。
"推理是模型从实验进入实时运营的时刻,它会接触真实数据、真实服务和真实业务流程。"Native联合创始人兼CPO Gal Ordo表示,"在这一点上,关键问题是模型被允许访问什么、它能触发什么操作、以及运行时必须始终满足什么条件。从一开始就明确边界,让推理在受控的、确定性的环境中运行。"
由于AI的决策是非确定性的,可观测性、审计和监控对于避免失控智能体、标记模型漂移、及早预警意外使用模式至关重要。
"IT部门需要将AI推理视为另一种具有独特身份、数据和成本特征的工作负载。"Blumira安全与IT总监Mike Toole表示,"关键是根据进入提示词的内容的敏感性来选择其运行位置,并应用与任何接触生产数据的SaaS相同的访问控制、日志记录和审查。"
3. 分离训练和推理需求
训练环境可能需要GPU芯片和其他高性能架构。对于推理,基础设施需要专注于合规性、延迟、成本和其他非功能性需求。不同的需求往往导致不同的基础设施。
"随着算力日益分布式化,CPU成为推理工作负载中的关键组件;而随着智能体爆发式增长,算力正是它们的生存之处。"Megaport CEO Michael Reid表示,"与此同时,推理还扮演着南北向流量倍增器的角色,显著增加数据传输需求,给网络容量带来更大压力。因此,全面优化AI推理需要一个计算、网络和存储协同运作的统一环境。"
Web系统通过加入缓存层来优化性能。在AI推理架构中,缓存同样可以减少冗余计算及相关的GPU成本。
"每个从零开始重新处理相同输入的请求都会全价消耗GPU周期。"Tensormesh联合创始人兼CEO Junchen Jiang表示,"键值缓存(Key value caching)消除了这种冗余,大幅降低延迟和GPU支出。从一开始就在推理架构中内置缓存的IT团队,将能够在不受基础设施账单失控影响的情况下扩展。"
大型企业需要根据合规性和性能要求考虑混合基础设施。例如,涉及人身安全的AI智能体和应用需要评估边缘和本地基础设施,而后台办公操作可能完全在公有云上运行。
"企业在AI推理上犯的最大错误是把它当作一个模型决策,而它实际上是一个运营模式决策。"Sonar CIO Andrea Malagodi表示,"推理在哪里运行——云端、本地还是边缘——直接影响延迟、成本、数据暴露和韧性。"
4. 设计灵活且有韧性的运维
推理架构不像Web应用那样一次建成后即可上下伸缩。架构师应规划模型、基础设施、安全和数据管理随着技术、合规性和定价的演变而变化。
"AI推理正迅速成为核心生产工作负载,要求在混合云环境中保持一致、自动化的运维,并建立从模型到部署的清晰信任链。"Red Hat Gen AI基础模型平台产品负责人Tushar Katarki表示,"开源和开放标准在这里至关重要;它们为企业提供保护AI栈所需的透明度,以及在业务所需的任何地方运行推理的灵活性。"
变化的一个来源是AI模型的能力、性能和成本。Cloudways工程高级总监Ayaz Ahmed Khan表示:"模型正以惊人的速度改进,一旦模型发生变化,提示词和安全护栏就必须进行全面评估、审查和修改。"
另一个关注点是跟踪与SaaS平台、数据源和其他AI智能体的使用与交互。NetBox Labs CTO兼联合创始人Shannon Weyrick表示:"IT团队应通过单一控制点路由AI流量,以便了解正在使用哪些模型、哪些数据正在离开组织、成本如何累积,因为你无法保护或管理你看不见的东西。"
Precisely首席产品官Matt Waxman表示,企业AI推理中最被低估的挑战不是模型,而是其背后的数据。"提示词和检索管道从数十个来源拉取数据,这些来源语义不一致、缺少血缘关系、没有治理层,而模型无从知晓。在一个智能体化的世界里,AI系统自主且大规模地行动,这一基础变得更加关键。"
Arcjet CEO兼创始人David Mytton分享了他在生产推理中遇到的实际情况。"每个模型都想成为自己的API,具有不同的请求格式、健康检查、元数据、就绪行为、错误格式和响应字段。一旦你有多个模型或后端,这就无法扩展。"Arcjet在其AI安全模型之上使用开放推理协议(Open Inference Protocol)构建了一个抽象层,为推理服务提供标准化的存活、就绪、元数据、版本化模型路由以及张量式输入输出。
5. 针对成本和不断变化的AI模型进行优化
从几十个扩展到数千个AI智能体的组织,需要推进其finops(云成本管理)计划,以应对AI模型选择和优化对成本的影响。
"随着团队从单智能体原型转向多智能体管道,推理成本并非线性增长。一个多智能体系统消耗的token可能是单次聊天交互的15倍。"Yugabyte产品营销副总裁Andrew Marshall表示,"这个乘数是一个数据问题,而非模型问题——它取决于智能体之间传递多少上下文、多少检索是冗余的、以及每次调用需要从零重建多少状态。"
除了更换AI模型,架构师还应考虑:训练中使用的前沿模型可能有助于开发更小、更高效的模型,这些模型随后用于推理。
"LLM正快速演化为两大类:前沿云规模模型——很可能仍将是超大规模云提供商的领地;以及在企业边缘部署的更小、高度蒸馏的专业模型。"BlueOptima CEO兼董事总经理Jason Rolles表示。这为企业提供了选择:将低级别、低歧义的任务路由到较小的模型,同时利用前沿模型处理需要推理和准确性的决策,从而节省总体成本。
Zencoder CEO兼创始人Andrew Filev表示:"一旦智能体变得有用,使用量跃升了10倍,上下文急剧膨胀,企业开始在每一个token上支付前沿模型的价格。许多企业现在几个月内就烧完了全年AI预算,其中大部分支出来自在每一步——包括简单任务——都运行旗舰模型。"
要增加进入生产的AI模型和智能体的数量,企业需要一个构建有韧性、可扩展推理架构的扎实计划。但随着使用量、合规性、技术和定价的变化,请计划重新评估和演进架构。
