很多站长用蜘蛛池,发现抓取量上去了,可收录量却不见涨。这种落差并不少见。你以为是蜘蛛池没效果,其实是还没弄明白抓取与收录之间的门道。
蜘蛛池真正能解决的是什么
搜索引擎收录一个页面前,首先要发现它的URL,然后爬虫才会去抓取内容。蜘蛛池要做的事,就是利用大量活跃的抓取源,把新出现的URL反复推送给搜索引擎,让爬虫对尚未发现的链接产生兴趣。说得直白一点,蜘蛛池是帮你把页面送到爬虫的“候客区”,但爬虫愿不愿把页面端上餐桌,要看页面本身有没有“卖相”。
很多站点把抓取量当作唯一指标,忽略了一个事实:搜索引擎爬虫每天会抓取海量网页,真正被索引的只不过是很小一部分。抓到的页面要去完成索引过程中的质量评定,内容空洞、结构混乱、重复度过高都会被刷下来。这就解释了为什么用了蜘蛛池后,日志里一堆200,收录却纹丝不动。
第一件事:把URL整理得干干净净
URL是搜索引擎识别页面的门牌号,如果门牌号不一致,爬虫就会以为出现了好几户。常见的坑有:http和https混用、带上跟踪参数、存在动态页面静态化不一致等。比如同样一篇文章,可能同时存在/article?id=123和/article/123两个地址,蜘蛛池帮你把两个地址都推给搜索引擎,其结果就是多了一份重复内容。
- 务必设置301跳转,把非规范地址统一指向唯一标准URL。
- 主动添加canonical标签,在页面上标明“首选地址”。
- 删除不必要的URL参数,尤其是带sessionid、from来源的参数。
- 确保robots.txt没有错误屏蔽或允许抓取后台地址。
把URL理顺后,蜘蛛池带来的抓取才会“劲儿往一处使”,权值也会集中到同一个版本上。
第二件事:避免站内重复内容
很多内容管理系统会自动生成标签页、分类页,甚至翻页带不同排序,这些页面很容易出现标题相近、列表相似的情况。再加上为了填充栏目而发布的转载稿,就让站点充斥着大量低价值的重复页面。蜘蛛池把这些页面也一并推给搜索引擎,不但浪费抓取配额,还可能让搜索引擎认为整个站点缺乏原创价值,进而降低其余页面的信任度,最终拖累真正有质量的内容也无法收录。
想要救火,必须先防火。给每个页面赋予唯一的title和description,列表页可以强化当前分类的独有说明,而不是千篇一律地罗列文章标题。万一页面内容确实相近,用canonical正则到最核心的那一页,避免爬虫“左右为难”。
第三件事:提升页面信息增量
收录的底线是页面提供了一次检索条件下最有可能满足用户的信息。搜索引擎判断你的页面是否够格,会看内容是否结构清晰、是否补充了其他页面没有的数据,甚至是否有直观的图片或表格。
不要只写“枣子很甜”这种笼统的文案,而是要写清楚为什么这个品种的枣子甜、含糖量有多高、适合什么人群。把用户关心的细节写透,再用小标题拆分段落,这样的页面才算有了索引价值。相反,如果每篇文章都是拼凑洗稿、语言混乱,就算蜘蛛池把URL推送一百遍,也难以换来一个收录名额。
收录没有捷径,但每一次合理的抓取,都值得被认真对待。
抓取和收录的距离,从不取决于谁更会催更。蜘蛛池能提升URL的上镜率,可页面最终能不能在索引库中留下姓名,凭的还是URL清爽、内容独特、站点可靠。当你不再把蜘蛛池当成“提交工具”,而是当成一次难得的曝光时,后面的功夫一点也省不得。