讨论收录时,很多人直接从抓取开始看,其实在抓取之前还有一步:发现。蜘蛛得先知道这个 URL 存在,才谈得上安排抓取。发现路径做得不好,页面内容再完整,也可能长时间躺在那里没人访问。
发现、抓取、收录是三件事
收录流程大致可以拆成:蜘蛛发现 URL、安排抓取、判断页面质量、决定是否放进索引。每一步都可能卡住,而且卡住的原因不一样。本文只讲第一步,因为这一步最容易被忽略,也最容易主动修:一个页面如果没有任何入口,后面的环节都无从谈起。
蜘蛛发现 URL 的主要路径
- 站内链接:从首页、栏目页、列表页、相关推荐一路点过去,这是最主要的发现方式。链接层级越浅,被发现的概率通常越高。
- 站点地图:适合补充那些内链不容易覆盖到的 URL,但它只是提供线索,不等于会被抓取。
- 外部链接:别的站点链过来,蜘蛛顺着链接爬进你的站。外链少的新站,发现速度自然慢一些。
- 其他入口:RSS、站长平台的提交入口、历史抓取记录里出现过的链接,都可能带来发现。
孤儿页面:内容不差,就是没人带路
孤儿页面指的是站内没有任何链接指向它的页面。常见来源有几类:活动页下线后入口被删掉、商品下架但详情页还在、批量生成后忘了接入列表页、改版调整导航时把某些栏目摘了出去。
这类页面蜘蛛很难自己找到。如果它曾经被外链引用过,可能还会被反复抓到;如果连外链都没有,基本就停在未被发现的状态,等再久也不会自己冒出来。
内链深度和入口数量,决定发现顺序
同样是新页面,一个从首页三步能点到,一个要点七八层,被发现的时间差可能很明显。可以按下面的思路自查:
- 从首页出发,点几下能到这个页面?超过四到五层就要留意。
- 它有几个站内入口?只有一个入口的页面抗风险能力弱,入口页一改就断。
- 入口链接放在哪?正文里的上下文链接,通常比页脚批量链接更接近内容本身。
链接位置也会影响判断
导航、面包屑、正文推荐、相关阅读,这些位置的链接在页面里的分量并不一样。同一个 URL 从正文里链过去,和塞在页面底部一大片链接里,效果往往不同。后者入口数量看着很多,实际价值有限,还可能被当成模板噪音。
被发现只是起点,收录还要过质量关
URL 进入待抓取队列之后,蜘蛛还要判断值不值得抓、抓完值不值得留。内容重复、正文单薄、模板占比过高、和站内已有页面高度相似,都可能让它停在抓取或索引环节。
所以修好发现路径并不能解决所有收录问题,但它是你能主动控制的部分,投入产出比相对高。
一份简单的自查清单
- 新页面发布时,是否同时接入了至少一个稳定的内链入口?
- 栏目页、列表页的分页和筛选,是否把真正的内容页带上了?
- 站点地图里的 URL,是否都是你希望被发现的页面?
- 日志里长期只被外链抓到、没有站内抓取记录的 URL,是不是孤儿页面?
- 重要页面的内链深度,是否明显比普通页面更深?
发现解决的是蜘蛛知不知道你,收录解决的是蜘蛛愿不愿意留你。两件事混着看,很容易找错原因。
实际运营里,先确认发现路径通畅,再去看抓取和索引表现,排查会顺很多。收录本身是结果,不是能单方面要求的动作,能做的是把入口、结构和内容基础打好,剩下的交给时间。