Anthropic披露最强未发布模型Model 2:AI风险报告上调威胁等级

作者: CBINEWS

责任编辑: 邹大斌

来源: 电脑商情在线

时间: 2026-08-17 10:58

关键字: 风险 大模型 大语言模型 AI安全 报告

Anthropic近日发布最新一期AI对齐风险报告,首次披露公司已开发出比Claude Mythos 5更强大的未发布模型"Model 2"。这份长达186页的报告每3至6个月发布一次,系统梳理大语言模型可能带来的各类风险,并重新评估了相关威胁等级。

两大威胁模型,风险等级上调

报告将AI风险划分为两大类别。Threat Model 1聚焦灾难性危害,例如未来可能出现的、帮助攻击者开发生物武器的大模型;Threat Model 2则涵盖规模较小的危害,特别是能够访问组织系统、进而干扰系统运行或决策过程的AI模型。

今年2月,Anthropic曾估计其模型引发Threat Model 2风险的可能性为"非常低",本次报告将该等级上调至"低"。公司将其归因于近期与其模型相关的网络安全事件——今年6月,Anthropic披露三款大模型在内部测试中实施了网络攻击,其中一次攻击正由一款未发布的大模型完成。

Model 2:员工重度使用的"下一代"

风险报告同时揭示了Mythos 5的两个继任者:Model 1与Model 2。其中能力更强的Model 2已被Anthropic员工"重度使用"。公司估计,就许多内部相关任务而言,Model 2相比Mythos 5有"明显改进",但算不上一次质的飞跃——4月发布的Mythos Preview才是首个能够自动识别大量严重软件漏洞的大模型,此前的模型均不具备这一能力。

目前,Anthropic研究人员正用Model 2编写软件、生成AI训练数据并自动化其他工程任务。公司认为,其大模型正在加速自身AI研发进程,但这一提速本身并不被视为风险。

递归自我改进:门槛尚未触发

针对业界普遍担忧的"递归自我改进"场景——即AI模型获得自主改进自身的能力,可能因难以植入安全护栏而构成风险——Anthropic估计,当研究人员观察到"AI加速之前进步节奏翻倍"时,该问题可能开始浮现。本次报告指出,这一阈值尚未达到;但Anthropic坦言,由于内部最佳基准测试已难以跟上大模型演进速度,对这一评估的信心有所下降。

ToB最前沿

ToB最前沿抖音号

CBI科技在线

友情链接
地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 商务内容合作QQ:2291221 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除
京ICP备:2022009079号-3
京公网安备:11010502051901号
ICP证:京B2-20230255