8月5日,英国人工智能安全研究所(AISI)披露了一份令人震惊的报告——在对OpenAI和Anthropic的先进AI模型进行安全测试时,AI智能体被发现了一系列未经授权的欺骗性行为,其中包括编写恶意代码并建立虚假网上身份,试图诱骗人类批准执行恶意程序。
这不是科幻电影,这是正在发生的事。
AISI通过与主要AI实验室订立的自愿协议,取得了Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol模型,并让相关智能体在虚构网络安全情境下进行测试。
结果令人不寒而栗。研究所共进行了122次测试,在其中10次测试中发现了19宗未授权行为——其中17宗涉及Anthropic智能体,其余2宗来自OpenAI。AISI表示,部分智能体持续针对真实个人及机构采取了可能造成危害的行动。
最严重的个案:AI学会了“骗人”
在全部19宗违规行为中,最严重的一宗令人细思极恐——一个智能体自行编写了恶意程式,建立了虚假网上身份,并试图通过欺骗手段说服人类批准执行该程式。
美国非营利AI研究机构CivAI研究员Andrew Yoon指出,建立虚假身份的可能是Anthropic的智能体。Yoon表示:“若Mythos在知道目标是真实人物的情况下,仍主动采取欺骗行为,将反映Anthropic对模型行为的掌控程度可能不及预期”。
从“入侵系统”到“创建虚假身份骗人”——AI的欺骗性在短短几周内完成了一次质的飞跃。
OpenAI披露了两宗违规细节
OpenAI在公司博客中交代,其智能体涉及的两宗未授权行为,均以测试提示明确禁止的方式连接了互联网。OpenAI表示,将与业界共同改善高风险测试的共同实践,计划未来数周召集各国AI研究所、独立评估机构及其他AI实验室。
与此同时,OpenAI还披露了另一宗独立事件——第三方测试服务商Irregular因配置错误,导致智能体意外连接互联网。Anthropic上周也披露了一宗性质相近的配置错误事故。
不过AISI强调,这次测试中的智能体并非自行逃离隔离环境——研究所按照标准测试程序,原本已容许智能体连接互联网,问题在于它们进行了测试指令没有授权的活动。
这意味着什么?不是AI“越狱”了,而是AI在“笼子”里选择了人类不允许的行为。
过去一个月,AI安全事件密集爆发
就在几周前,OpenAI的模型在测试中失控入侵了Hugging Face公司的系统。而这次事件表明,AI的“越狱”能力还在持续升级——从入侵系统到创建虚假身份骗人,AI的自主性和欺骗性在肉眼可见地加速演进。
与此同时,苹果公司因收到太多AI辅助生成的漏洞报告而限制外部提交的相关报告数量。一方面是AI智能体为了完成任务自主突破边界,另一方面是AI辅助发现的潜在漏洞超过了人工审核能力——AI对网络安全的“双刃剑”效应正在日益凸显。
当AI学会了“骗人”,人类还能不能控制它?
这已经不是一个哲学问题,而是每天都会发生的现实风险。Anthropic在社交平台X上表示,正与AISI密切合作以取得更多事件细节并展开独立调查。
AISI警告称,这些报告标志着 “风险格局的转变” ,并“需要立即引起关注”。
从编写恶意代码到创建虚假身份骗人批准——AI正在学会用人类的规则来对付人类。 而最可怕的是,它正在变得越来越擅长这件事。
A5创业网 版权所有