最让人困惑的收录现象之一:site:域名 一查,首页乖乖在,可点进收录列表,内页一条都没有。不是站被惩罚(否则首页也悬),而是某种“只收浅层”的机制卡住了。这种情况问题非常集中,基本就出在两处,挨个查很快能定位。
记住一个判断:首页在、内页全无,说明爬虫能进你站、但爬不深,或者爬到了也不认。循着这两点往下看。
一、第一处:抓取深度被层级卡死
搜索引擎给每个站的抓取预算有限,默认会优先浅层页。如果你的内页藏得太深——比如要从首页点三四次、URL 路径套了四五层目录,爬虫往往走到第二层就走了,深层内页根本没机会被抓。下面这段脚本把几个代表页面的路径层级算出来,超过三层的就要警惕。
# 计算代表页面的 URL 层级深度,定位是不是藏得太深
import urllib.parse
PAGES = [
"https://www.example.com/",
"https://www.example.com/post/2026/a.html",
"https://www.example.com/c/tech/x/y/z.html",
]
for u in PAGES:
p = urllib.parse.urlparse(u).path
depth = len([x for x in p.split("/") if x])
print(u, "层级深度 =", depth, "(深于3层容易被漏抓)")
把 PAGES 换成你站真实的内页地址,跑完看“层级深度”。凡是深于三层的,建议通过栏目聚合页、相关阅读、标签页把它们拉到两层以内。层级越浅,被抓到的概率越高,这是内页收录最划算的改法。
二、第二处:内链没把内页接出来
第二处更常见:内页在站点里是孤岛。首页和栏目页没有链到它们,它们只存在于数据库或翻页里,爬虫抓完浅层就结束,深层页从没被发现。表现就是首页被收、内页零收录。修复办法不是改内容,而是补内链:在首页和栏目页加“最新文章”“热门文章”模块,每篇内页正文里自然链出几篇同主题旧文。补内链要讲究“自然”二字:链接文案用真实相关的词,别用“点击这里”这种无意义锚文本;一篇文里链三到五条就够,堆太多反而稀释权重。补完一周左右,再用平台抓取诊断跑几条深层内页,能看到它们开始被正常抓取,这就是内链生效的信号。
三、顺带排查两个小坑
除了上面两处,还有两个容易忽略的点:一是内页用了 JS 渲染正文、没做服务端输出,爬虫抓到的是空壳;二是内页模板带了 noindex 标签(某些 CMS 在分页、归档页误加)。这两个用平台“抓取诊断”跑一条内页就能看出来:抓到的内容如果是空的或带 noindex,对应修模板即可。
四、验证是否修好
两处都补完后,挑 10 条典型内页,通过链接提交工具主动推送,再用抓取诊断逐条确认能抓到正文、返回 200 且无 noindex。之后两周内观察这些地址是否陆续进索引。只要首页在、内页此前只是没被抓到,这个修法见效通常很快。
相关阅读:
A5创业网 版权所有