AI推理越来越便宜,你的Agent却越来越贵

作者: CBINEWS

责任编辑: 邹大斌

来源: 电脑商情在线

时间: 2026-08-18 11:18

关键字: 成本 IPO 大语言模型 机器人 AI智能体

好消息是,大语言模型(LLM)的Token成本正在下降;坏消息是,AI工作负载的总成本反而在上升。Gartner研究预测,到2030年Token成本将下降95%,但未来两年内,Agent工作流的推理成本将增长超过五倍。原因在于,AI应用开发者使用的Token越来越多、也越来越贵——这就是Gartner所说的"推理悖论"。

推理悖论:创新速度跑赢成本曲线

"创新的速度正在跑赢成本曲线。"Gartner分析师威尔·索默和萨宾·齐默汉斯尔在研究报告中指出,"市场正被'Token通缩幻觉'所捕获。"买家们危险地假设,随着AI供应商改善Token经济性,这些节省下来的成本会反映到他们的路线图上。但说白了,"并不会"。

报告认为,AI确实能带来巨大价值,在许多常规任务上往往比人更快更好。但伴随AI演进,Token用量在增加、Token价值在波动。具备推理能力的高级AI Agent在单个任务上的成本,已经是最基础AI聊天机器人的150倍。

简单聊天机器人只需读取并解读请求、快速给出一个"概率上合理"的回答;而Agent变得越来越复杂,必须思考、质疑、在出错时自我调整,并且越来越多地连续、甚至不可见地在后台运行。报告写道:"它们需要验证结果的准确性,而不必依赖人类介入;它们还需要与其他Agent对话。"

Agent"蜂群"吞噬Token,推理税惊人

这一切都需要更多资源。随着越来越自主的Agent"蜂群"互相触发、互相调用,Token消耗呈指数级增长——用户在拿到结果之前,就要付出"巨大的推理税"。

Gartner给出的数据触目惊心:训练一个带高级推理能力的中等规模Agent模型,硬件成本是训练同尺寸简单聊天机器人的2.5倍;Agent的推理成本是其5倍;处理同等任务,Agent所需Token是聊天机器人的5到30倍。"想想看,当数百个Agent每小时执行数十甚至数百个任务时,成本会膨胀到什么程度。"分析师们说。

基于多种训练与推理场景,Gartner构建了Token经济学模型进行测算:基础工作流每推理Token成本约0.05美元;摘要与知识检索约0.10美元;更复杂的工作流约0.30美元;规划与学习类任务则高达约0.40美元——是基础工作流的8到10倍。"成本将不可避免地攀升,而价值未必会同步增长,"索默和齐默汉斯尔断言,"每一代新技术的ROI都将来之不易。"

省钱之道:推理分层、按量计费、结果导向

Gartner建议企业从多方面控制Token成本:一是实施"推理分层",把查询路由到最具成本效率的模型,阻止Agent在简单任务上默认调用前沿模型;二是从固定算力费转向按需分级的使用量定价;三是建立模型持续刷新机制,把每个模型版本当作"上市第一天就贬值的新车";四是为AI执行设定最低标准,预先定义成功阈值与合规开销,"在场景针对Token价格波动和合规成本完成压力测试之前,拒绝批准上线";五是将"每结果的产出价值"嵌入产品规划,要求每个AI功能都围绕明确的成果指标(如自动化任务数、成功结案数)预测并跟踪支出。

分析师强调,ROI"完全可能实现",但需要企业付出大量努力。"默认使用通用自主智能,将带来比优化产品生态系统高出几个数量级的无界成本。"

ToB最前沿

ToB最前沿抖音号

CBI科技在线

地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 商务内容合作QQ:2291221 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除
京ICP备:2022009079号-3
京公网安备:11010502051901号
ICP证:京B2-20230255