AI爬虫一天来几趟、拿走多少流量?站长其实查得到

来源:互联网 时间:2026-10-09

关于AI爬虫,站长的处境有点尴尬:能看到的说法是“它们在抓你的内容、不给回流量”,但自己站上到底来了多少、抓了哪些页、有没有因此损失带宽,多数人答不上来。答不上来的直接后果是要么什么都不做,要么一刀切全拦掉。而第二种做法的代价比想象中大——拦掉搜索类爬虫,你自己也就从AI给出的答案里消失了。

要判断该不该拦,先得把“谁来了”这件事看清楚。Cloudflare提供了AI爬虫管理功能,它把AI相关的访问按用途分成三类:搜索类,目的是收集或索引你的内容以便日后回答问题;代理类,代表某个真人实时地来取东西,比如某些聊天机器人取回页面;训练类,把你的内容永久吸收进模型里。这个分类比“AI或不是AI”有用得多,因为它对应着完全不同的处理策略——搜索类通常值得留着,训练类才需要谈条件。

看清流量的入口在控制台的指标页。它能给你几个维度的数字:请求总量和变化趋势、最常见的响应状态码、被访问最多的路径,还可以按URI模式分组来看,比如把请求聚合成博客目录下、接口路径下、文档目录下,一眼就知道爬虫在啃你站的哪块内容。另外还有推荐流量和传输字节数这两个维度——前者告诉你哪些页面带来了真实的引用访问,后者告诉你这些爬虫消耗了多少带宽。

这两个数字放在一起看,判断就出来了。如果某个爬虫抓走了一大批页面,而引用流量接近于零,那它属于纯取用不回馈的类型,你可以考虑限制;如果某个爬虫抓得不多、但带来了持续的访问,那它对你有价值,压缩它的抓取范围不如留着。只看得失、不看单边,是从“要不要拦AI爬虫”这个问题里走出来的唯一办法。

接下来是一个必须弄清楚的认知:robots.txt是偏好声明,不是访问控制。IETF关于机器人排除协议的标准里写得很直白,这些规则不是一种访问授权形式;它还在安全考虑一节里提醒,把路径写进robots.txt反而会把这些路径公开出去,让人更容易发现它们。Cloudflare自己的文档也是同样的口径:开启托管的robots.txt之后,它会生成并维护一份文件告诉已知的AI爬虫不要访问你的内容,但是否遵守是自愿的,这份文件在技术层面并不能阻止爬虫取走内容。理解了这一点,配置策略就清楚了:表达偏好和强制执行要当成两件事分别处理,而不是指望一份文本文件既表态度又实现拦截,后者需要的是网络层的规则。

所以要真正拦下来,得用能强制执行的东西。在爬虫管理里把一个爬虫设为屏蔽之后,系统会在你的域上创建或更新一条WAF自定义规则来实际拦截请求。这里的组合方式很清楚:robots.txt用来对守规矩的爬虫表达偏好,覆盖面广、零成本;强制执行用来对付不守规矩的那部分。两者都要用,不能指望其中一个把两件事都办了。

免费套餐的边界也要清楚。官方文档写明,在免费套餐上,这套功能是按User Agent字符串来识别AI爬虫的,能认出那些明确自我声明的知名爬虫;想用基于行为特征的更彻底的识别方式,需要升级套餐。这意味着免费版会漏掉伪装成浏览器的、或者不自我声明的爬虫。对个人站来说,这个精度通常够用——你真正想挡的是那几个大厂明确署名的训练爬虫,它们恰好都老老实实报名号。

托管的那份robots.txt默认会挡住八个爬虫,覆盖了主要的训练类来源。这里有个容易被忽略的连带效果:2026年9月15日起,平台对新接入的域名设了默认值——训练类和代理类在有广告的页面上默认屏蔽,搜索类默认允许;而且那些既做搜索又做训练的混合用途爬虫,也会被训练相关的屏蔽配置一并挡住。也就是说,你在挡训练的时候,可能顺手把它的搜索功能也挡了。老域名不受这次默认值调整影响,除非你自己去改。

判断一个爬虫“讲不讲道理”,行业内也开始有可查的依据了。有平台提出了一个叫“可问责”的标识,要求爬虫方满足四条:给站长一个明确的退出训练的方式,比如通过robots.txt或者同等标准;允许站长退出AI生成的搜索摘要;给站长提供URL级别的可见性,能看出内容是怎么被用于搜索和训练的;以及公开确认退出训练不会影响站点在传统搜索里的排名。目前几家主要厂商已经满足或者承诺满足这些要求。对站长来说,这四条可以当作跟爬虫方“谈判”的清单。

所以在你决定屏蔽之前,有几件事值得先做:登录控制台看一下指标,弄清楚来了哪几个爬虫、抓了哪些路径、带没带来引用流量;把带宽消耗和引用价值放在一起对比,分出值得留的和不值得留的;再去确认你要挡的那个爬虫,会不会同时承担着给你带搜索流量的职责。全部弄清楚再动手,你挡掉的才是你想挡的。

相关文章

标签:

A5创业网 版权所有

返回顶部