很多站点运营会遇到这种情况:一批页面同一天上线、结构相近、内容长度也差不多,过一段时间去核对,有的已经在索引里,有的还停留在“已发现但未编入索引”。这时候如果只看蜘蛛来没来,很容易得出错误结论——日志里蜘蛛确实来过,问题往往不在访问本身,而在抓取量被分给了谁。
一、先把抓取和收录拆成两步
抓取是蜘蛛把页面下载回去,收录是搜索引擎判断这个页面值不值得放进索引。两步之间还夹着一层“值不值得抓”的取舍。日志里出现抓取请求,只能说明页面被访问过,不能说明它会被收录。反过来,一个页面长时间没被抓,也不一定是被封了,很可能是抓取配额优先给了别处。
抓取是过程,收录是结果。把两者混在一起看,就会把配额分配问题误判成页面被拒问题。
二、抓取配额不是平均分配的
站点的可抓取资源是有限的。搜索引擎会综合站点体量、更新频率、响应速度、页面价值来决定先抓哪些、抓多深、抓多频繁。所以同一批页面出现先后差异,往往是下面几类东西在占额度:
- 大量低价值 URL:筛选参数组合、排序参数、会话参数生成的页面,数量可能远超正文页。
- 无限翻页和日历归档:没有出口的列表、按日期铺开的归档页,很容易被持续爬取。
- 历史残留地址:老的跳转链、已经不用的路径,仍被反复访问。
- 重复内容:同一篇内容挂在多个栏目、多个 URL 下,每个地址都要消耗一次抓取。
- 慢响应:响应时间长的页面会拖慢整站抓取节奏,尤其在同一主机下。
把这些加在一起,就能解释为什么新页面排不上队。
三、核对时按这个顺序排查
- 先从服务器日志里筛出最近一段时间被访问最多的 URL 类型,看是不是集中在参数页、列表页或归档页。
- 确认这些高频被抓的 URL 是否有独立价值,没有的话就该考虑收敛,而不是继续放大。
- 检查重要页面的内链入口是不是太少。入口少的页面,被抓的机会本身就低。
- 对比重要页面和低价值页面的响应时间,慢的那一批往往会拖累整体。
- 最后再看收录状态,区分“已发现但未编入索引”和“已抓取但未编入索引”,判断卡点在哪一步。
四、给重要页面腾额度,而不是硬催
调整的思路通常是做减法:把不打算被索引的 URL 用 robots 或 noindex 处理干净,把跟踪参数在站内链接里去掉,把重复内容归并到主版本,把翻页逻辑做出合理出口。这些动作不会立刻带来收录变化,但能逐步把抓取重心移回正文页。
同时别忽略站点本身的响应能力。服务器慢、页面打开时间长的时候,再谈抓取配额意义不大,因为额度再多也会被慢速请求消耗掉。
五、几个容易误判的情况
- 蜘蛛访问频繁:可能只是在反复抓同一个低价值地址,不等于新页面被重视。
- 索引量上涨:涨的可能是不该收的页面,需要按类型拆开看。
- site 查询结果变少:查询结果数不等于索引量,不适合当作唯一指标。
- sitemap 提交了很多次:提交只是提供发现渠道,不决定抓取优先级。
核对这件事更像是做账:先把抓取流量花在哪里看清楚,再决定哪些页面值得留、哪些该收掉。顺序对了,很多“为什么它没被收录”的问题会自己浮出答案。