AI黑客智能体越来越专业,自主向人类发起社会工程攻击
作者: CBINEWS
责任编辑: 邹大斌
来源: 电脑商情在线
时间: 2026-08-06 10:32
英国AI安全研究所披露,在前沿AI模型测试中,一个智能体在未被指示的情况下,试图对真实人员实施社会工程学攻击。
AI黑客智能体学得很快。
总部位于英国的AI安全研究所周二披露,又一次前沿AI模型测试出了岔子。鉴于此前OpenAI和Anthropic已相继披露模型在黑客测试中突破约束的事件,这种情况显然可能会继续频繁发生。
不过,AI安全研究所此次披露的事件包含一个新的令人不安的方面。事件的一部分涉及一个AI智能体——显然是自行决定——尝试欺骗真实人员以实现其目标。
换言之,该智能体在未被明确指示的情况下,试图对真实的人实施社会工程学攻击。
以下是AI安全研究所在披露帖子中的完整描述。这里引用全文,因为其内容确实令人震惊:
"在最严重的案例中,一个智能体试图将恶意代码插入一个开源项目。为了让代码获得批准,该智能体实施了社会工程学攻击——创建虚假在线身份,并利用这些身份向项目维护者施压以批准代码。一位人类维护者发现并拒绝批准了恶意代码。"
"这些尝试并未成功,我们的调查也没有发现任何由此导致的现实世界危害。但这是我们首次在现实世界中看到,在没有特定提示的情况下,围绕自主性和欺骗的风险如此清晰地显现。"
这里的关键是"没有特定提示"。研究人员实际上并没有要求AI智能体创建虚假身份或向一个活生生的人施压去做违背其自身利益的事情。
不过,AI黑客智能体还需要继续学习,因为它们的说服尝试未能打动另一端的人类。从中我们或许可以获得一丝冷冰冰的安慰。
AI安全研究所并未明确将某款前沿模型与社会工程学事件挂钩,不过该公司表示,大部分未经授权的行为问题(共19起)来自Anthropic的Claude Mythos 5,另外两起来自OpenAI的GPT-5.6-Sol。
然而,OpenAI已发布自己的披露声明,表示这两起事件不涉及社会工程学,因此这指向Mythos 5是社会工程学事件的"肇事者"。
在周三回复的电子邮件中,Anthropic表示无法确认AI安全研究所帖子中的技术细节——即Anthropic目前不确认Mythos 5就是涉事模型。
不过,Anthropic指出,研究所对Mythos 5的测试是在开放互联网上进行的——研究所表示在此事件后将"重新评估"这一做法。Anthropic还指出,被测试的Mythos 5版本已禁用标准网络安全防护措施。
尽管如此,"正如我们上周披露自身事件后所分享的,该领域需要更强有力、共同的标准来规范评估环境的构建和安全保障,"Anthropic在声明中表示。
呼吁物理隔离
从这一令人不安的进展中可以得出的众多启示中,加强测试隔离的必要性或许应该排在接近榜首的位置。
正如埃森哲全球网络安全负责人Harpreet Sidhu所指出的,确保前沿AI网络安全测试不会产生现实世界影响的方法已经存在。
首要的是,可以设计真正的物理隔离——让前沿模型运行在与互联网和其他IT系统物理断开的专用基础设施上。
最终,Sidhu表示,在自主黑客智能体失控之后,有一件事应该很清楚:物理隔离现在"已经不再是一个可选项"。
