外链、蜘蛛池、主动提交都能把蜘蛛引到站上,但很多站长看日志时会发现:蜘蛛只落在被引用的那一个 URL,最多再抓一两个页面就走,内页始终停在“已发现未抓取”。这不是外链没用,而是外链只负责把人带到门口,进门之后怎么走,取决于站点自己的结构。
先把“引蜘蛛”和“让蜘蛛留下”分开看
外链和蜘蛛池解决的是 URL 发现,也就是让搜索引擎知道有这么一个地址存在。它不负责把整站喂给蜘蛛。蜘蛛进来之后抓多少、抓多深,取决于它对整个域名的判断:值不值得多花预算、入口页能不能继续往下走。所以外链带来的抓取,往往是一次性的、浅层的。想让它变成持续的收录,要靠站内承接。
入口页要能“指路”
被外链指向的页面,通常是首页、栏目页或某篇内容页。蜘蛛落在这里之后能不能继续走,就看这个页面向外输出了什么。
- 有没有指向主要栏目的稳定链接;
- 导航是否使用可抓取的 a 标签,而不是 JS 点击事件或按钮;
- 重要内页离入口页几跳,是否已经超过三层;
- 是否有大量指向站外、失效或需要登录的链接,把注意力分走。
被引用的页面最好不是孤岛
如果外链指向的是一个很少被内链提及的页面,蜘蛛到了这里也找不到更多线索。更理想的情况是,被引页面本身就长在站点的主干结构里,有自己的上游栏目和下游推荐。
内页的发现路径要有多条
只靠一条内链发现内页,效率很低。可以并行铺几条路径:
- 栏目页、列表页的常规内链;
- 相关文章、上下篇、推荐位;
- XML 站点地图,只放真正需要收录的 URL;
- 在已有收录的页面里补充编辑性内链。
这些路径不必全部上齐,但至少要保证重要内页不是只挂在一个入口上。入口越单一,蜘蛛漏掉它的概率越高。
别忽略抓取频率和预算
蜘蛛在站上的时间是有额度的。如果站点里存在大量参数页、筛选页、重复列表页,抓取预算会先被这些低价值 URL 消耗掉,真正想收的内页反而排不上队。可以先把明显不需要收录的目录用 robots.txt 挡住,或者用 noindex 明确表态,把额度让出来。这一步做在前面,比事后反复提交更有效。
一个可执行的排查顺序
- 看日志:蜘蛛落在哪些 URL,抓了几次,有没有继续深入;
- 看入口页:导航和内链是否可抓取,跳数是否过深;
- 看内页:是否有独立价值,是否和已有页面高度重复;
- 看站点地图:是否包含重要内页,是否混入大量低质 URL;
- 看屏蔽规则:是否有误挡、软 404、指向错误的 canonical。
按这个顺序过一遍,多数“蜘蛛只抓一两个页面”的情况都能找到原因,而不是笼统地归到“外链不行”。
外链和蜘蛛池解决的是“来不来”,站内结构决定的是“走多深、收多少”。两者是两件事,别用同一套动作去期待同一个结果。
最后提醒一点:蜘蛛的抓取行为和最终收录之间,还隔着页面质量的判断。即使蜘蛛抓了内页,也不代表一定进索引。把入口理顺、把内页做扎实,是能自己控制的那部分,剩下的交给时间。