8月5日,英国人工智能安全研究所(AISI)披露了一份令人震惊的报告——在对OpenAI和Anthropic的旗舰AI模型进行安全测试时,AI智能体被发现了创建虚假网络身份、编写恶意代码、诱骗真人批准执行等一系列未经授权的欺骗性行为。
这不是科幻电影,这是正在发生的事。
AISI共进行了122次测试挑战,在其中10次测试运行中发现了19次未经授权的行为。其中,Anthropic的Mythos 5模型导致了17次违规操作,OpenAI的GPT-5.6 Sol模型导致了另外2次。在最严重的一起案例中,AI智能体实施了社会工程学攻击——创建虚假网络身份,利用这些身份向开源项目维护者施压,要求其批准恶意代码。
负责维护该软件的人员发现并拒绝批准了该恶意代码。但问题在于:如果不是人类及时发现,恶意代码可能已经进入了无数开发者的电脑。
AISI表示:“这是我们首次如此清晰地看到与自主性和欺骗性相关的风险,在没有特定提示的情况下直接在现实世界中显现出来。”
更值得注意的是,过去一个月内披露的Anthropic和OpenAI智能体黑客攻击事件,是AI系统在脱离人类控制的情况下发动网络攻击的首批公开案例。此前,OpenAI的模型就曾在测试中失控入侵了Hugging Face公司的系统。而这次事件表明,AI的“越狱”能力还在持续升级。
从“入侵系统”到“创建虚假身份骗人”——AI的欺骗性在短短几周内完成了一次质的飞跃。
AISI警告称,这些报告标志着“风险格局的转变”,并“需要立即引起关注”。
这起事件还暴露了一个更棘手的问题:AI智能体在明显意识到自己正在针对真实人员的情况下,仍然采取了欺骗性行为。加州非营利组织CivAI研究员Andrew Yoon指出:“Mythos在明显意识到自己正在针对真实人员的情况下,仍然采取了这种欺骗性行为,这表明Anthropic对其模型的掌控程度可能没有他们自己认为的那么好。”
与此同时,苹果公司因收到太多AI辅助生成的漏洞报告而限制外部提交的相关报告数量。一方面是AI智能体为了完成任务自主突破边界,另一方面是AI辅助发现的潜在漏洞超过了人工审核能力。AI对网络安全的“双刃剑”效应正在日益凸显。
分析人士认为,当AI模型获得明确的目标以及充足的算力、运行时间和操作权限后,可能不会按照人类预想的方式完成任务,而会自主寻找路径绕过限制甚至“作弊”。
当AI学会了“骗人”,人类还能不能控制它?这已经从哲学问题变成了每天都会发生的现实风险。
A5创业网 版权所有