不少站长看服务器日志,会发现搜索蜘蛛每天来得不少,抓取次数也稳定,但索引量就是不动。这时候容易怀疑蜘蛛池质量、怀疑站点被降权,却忽略了一个更常见的原因:蜘蛛的时间被大量无效 URL 消耗掉了。
搜索引擎对每个站点的抓取资源是有限的。它愿意来,不代表会无限制地抓。当站内出现大量参数组合、重复页面、失效地址和低价值入口时,抓取预算会被快速摊薄,真正需要收录的内容反而排不上队。
先区分:抓取频次与收录结果不是一回事
抓取是蜘蛛来读取页面,收录是搜索引擎判断这个页面值得进入索引。抓取多,只能说明蜘蛛愿意来;收录少,说明它在读取之后认为页面价值不够,或者同类页面已经太多。
如果日志里某个路径被抓了几千次,索引里却只有一两条,这个路径通常就是抓取预算的消耗大户。
哪些 URL 最容易吃掉抓取预算
- 参数组合页:筛选、排序、颜色、尺码、价格区间,每个组合都能生成新地址,蜘蛛顺着链接就会一路抓下去。
- 会话 ID 与跟踪参数:同一篇文章因为分享链接带上不同参数,被当成多个地址反复抓取。
- 无限分页与日历归档:分页一直翻不到头,日期归档每月每天一个地址,内容却高度重复。
- 失效链接与重定向链:站内大量死链、跳转链,蜘蛛每次都要花时间确认最终地址。
- 低质聚合页:标签页、作者页、搜索结果页,只罗列标题没有独特内容,却被站内链接大量指向。
这些 URL 不一定都是错误,但如果它们占据了抓取日志的大部分,有效页面的抓取机会就会被挤压。
核对顺序:从日志到索引
- 导出高频抓取路径:按目录或参数维度统计,找出抓取次数最多但索引量为零或极低的地址模式。
- 标记页面角色:哪些是内容页,哪些是功能页,哪些只是导航或筛选结果。内容页优先保留,功能页考虑收敛。
- 检查入口链接:很多无效 URL 不是蜘蛛自己猜出来的,而是站内链接主动喂给它的。列表页、面包屑、相关推荐都可能是入口。
- 选择收敛方式:能用 robots.txt 屏蔽的目录先屏蔽;不能屏蔽的页面用 canonical 指向主版本;纯导航链接可考虑 nofollow;有效内容页则保留在站点地图里。
- 观察抓取与索引变化:处理之后不要只看一两天。抓取路径结构变化通常需要一到数周,索引量才会跟着调整。
几种常见误判
把抓取量当成收录量
日志里抓取次数上涨,可能是蜘蛛在反复抓同一批参数页,并不代表新页面被收录。要分开看抓取日志和索引状态报告。
屏蔽过度,把内容页也挡了
为了减少抓取,有人直接屏蔽整个目录,结果把需要收录的详情页也挡在外面。屏蔽前先确认目录下有没有真正的内容页。
只靠 robots.txt,不做站内收敛
robots.txt 只是不让抓,站内链接仍然存在,蜘蛛仍可能通过其他路径发现这些地址。更稳妥的做法是同时减少入口链接和参数生成。
抓取预算不是越多越好,而是越集中越好。让蜘蛛把有限的时间花在值得收录的页面上,比单纯追求抓取次数更有意义。
把抓取留给有效页面
如果蜘蛛来得勤、收录却不涨,可以先从日志里找“抓取多、收录少”的路径,再按“分类页面角色—收拢入口—设置规范—观察索引”的顺序处理。不要指望一次调整立刻见效,但持续把无效 URL 从抓取路径里拿掉,有效页面的抓取和收录机会会逐步回升。