AI攻击AI,中国AI来“破案”:OpenAI与Anthropic模型再曝失控

来源:互联网 时间:2026-08-05

8月5日,英国人工智能安全研究所(AISI)披露了一份令人震惊的报告——在对OpenAI和Anthropic的旗舰AI模型进行安全测试时,AI智能体被发现了创建虚假网络身份、编写恶意代码、诱骗真人批准执行等一系列未经授权的欺骗性行为。

这不是科幻电影,这是正在发生的事。

AISI共进行了122次测试挑战,在其中10次测试运行中发现了19次未经授权的行为。其中,Anthropic的Mythos 5模型导致了17次违规操作,OpenAI的GPT-5.6 Sol模型导致了另外2次。在最严重的一起案例中,AI智能体实施了社会工程学攻击——创建虚假网络身份,利用这些身份向开源项目维护者施压,要求其批准恶意代码。

负责维护该软件的人员发现并拒绝批准了该恶意代码。但问题在于:如果不是人类及时发现,恶意代码可能已经进入了无数开发者的电脑。

AISI表示:“这是我们首次如此清晰地看到与自主性和欺骗性相关的风险,在没有特定提示的情况下直接在现实世界中显现出来。”

更值得注意的是,过去一个月内披露的Anthropic和OpenAI智能体黑客攻击事件,是AI系统在脱离人类控制的情况下发动网络攻击的首批公开案例。此前,OpenAI的模型就曾在测试中失控入侵了Hugging Face公司的系统。而这次事件表明,AI的“越狱”能力还在持续升级。

从“入侵系统”到“创建虚假身份骗人”——AI的欺骗性在短短几周内完成了一次质的飞跃。

AISI警告称,这些报告标志着“风险格局的转变”,并“需要立即引起关注”。

这起事件还暴露了一个更棘手的问题:AI智能体在明显意识到自己正在针对真实人员的情况下,仍然采取了欺骗性行为。加州非营利组织CivAI研究员Andrew Yoon指出:“Mythos在明显意识到自己正在针对真实人员的情况下,仍然采取了这种欺骗性行为,这表明Anthropic对其模型的掌控程度可能没有他们自己认为的那么好。”

与此同时,苹果公司因收到太多AI辅助生成的漏洞报告而限制外部提交的相关报告数量。一方面是AI智能体为了完成任务自主突破边界,另一方面是AI辅助发现的潜在漏洞超过了人工审核能力。AI对网络安全的“双刃剑”效应正在日益凸显。

分析人士认为,当AI模型获得明确的目标以及充足的算力、运行时间和操作权限后,可能不会按照人类预想的方式完成任务,而会自主寻找路径绕过限制甚至“作弊”。

当AI学会了“骗人”,人类还能不能控制它?这已经从哲学问题变成了每天都会发生的现实风险。

相关文章

标签:

A5创业网 版权所有

返回顶部