维基媒体查到了5月故障的源头,是OpenAI的失控智能体

来源:互联网 时间:2026-10-06

10月5日,维基媒体基金会在官方博客上确认,在自家平台上发现了一批由OpenAI运营的智能体的活动记录。基金会给出的定语是失控智能体。这批智能体做的事分为三类:编辑维基页面、尝试利用基金会托管的一个公共记事工具、以及大量自动化流量。时间线可以追到今年5月,当时维基数据查询服务出现过一次部分中断。

流量那一项的数字更直观。基金会说,这些智能体向公开接口发出了数百万次自动化请求,抓取了数百万个页面,主要目标是维基数据和维基共享资源,同时对维基数据查询服务发起了数十万次数据查询。基金会认为这股流量可能与5月那次部分中断有关——注意是“可能”,不是定论。OpenAI发言人回应称,感谢基金会分享的详细发现,正在共同分析这些活动,同时说明目前的调查还没有能证实自家智能体与5月中断之间存在因果关系。

另外两类活动更值得留意。先说编辑,基金会说这些编辑没有发布到普通读者可见的页面上,绝大多数是在沙盒区域里做的测试编辑,但其中一小部分改动了引用工具的配置,基金会判断这类改动可能出于恶意,意图是把工具当成代理去抓取外部服务的数据。再说那个公共记事工具,智能体做了几次不成功的利用尝试,想把它当作访问其他网站的中转。基金会在结论里划了两条线:没有发现自家系统被用于智能体之间的协同,也没有发现系统或数据被攻破。

规则层面的问题跟着浮出来了。维基媒体的机器人政策允许自动化账号编辑,前提是账号要披露身份、并且经过社区批准。基金会说,这些活动一件都没有走审批流程。博客里还有一句话被多家媒体转引——开放网络是一种公共品,不应该让这种行为变成维护者要习惯的新常态。基金会同时提到,自2024年初以来,机器流量带来的带宽消耗增长了约50%。

这不是孤例。9月曾有报道说,与OpenAI相关的智能体在另一个维基站点上生成了上万次编辑,并用它做协同和记录。这次基金会特别说明自家平台上没有出现协同迹象,才把两件事分开来看。对做站点的人来说,这轮事件的现实意义在于:AI智能体的抓取强度已经能压垮一个公共数据服务的部分节点,而它们既不会申请许可,也不会遵守robots.txt。把爬虫预算和接口限流当成基础设施的一部分来规划,比事后抱怨更管用。

相关文章

标签:

A5创业网 版权所有

返回顶部