外鏈、蜘蛛池、主動提交都能把蜘蛛引到站上,但很多站長看日誌时會發現:蜘蛛只落在被引用的那一個 URL,最多再抓一两個頁面就走,内頁始终停在“已發現未抓取”。這不是外鏈没用,而是外鏈只负责把人带到门口,進门之後怎么走,取决于站点自己的结构。
先把“引蜘蛛”和“让蜘蛛留下”分開看
外鏈和蜘蛛池解决的是 URL 發現,也就是让搜尋引擎知道有這么一個地址存在。它不负责把整站喂给蜘蛛。蜘蛛進来之後抓多少、抓多深,取决于它對整個域名的判断:值不值得多花预算、入口頁能不能繼續往下走。所以外鏈带来的抓取,往往是一次性的、浅层的。想让它變成持續的收錄,要靠站内承接。
入口頁要能“指路”
被外鏈指向的頁面,通常是首頁、栏目頁或某篇内容頁。蜘蛛落在這里之後能不能繼續走,就看這個頁面向外輸出了什么。
- 有没有指向主要栏目的稳定連結;
- 導航是否使用可抓取的 a 标簽,而不是 JS 点击事件或按钮;
- 重要内頁离入口頁几跳,是否已经超過三层;
- 是否有大量指向站外、失效或需要登入的連結,把注意力分走。
被引用的頁面最好不是孤岛
如果外鏈指向的是一個很少被内鏈提及的頁面,蜘蛛到了這里也找不到更多线索。更理想的情况是,被引頁面本身就長在站点的主干结构里,有自己的上游栏目和下游推荐。
内頁的發現路径要有多條
只靠一條内鏈發現内頁,效率很低。可以並行铺几條路径:
- 栏目頁、列表頁的常規内鏈;
- 相關文章、上下篇、推荐位;
- XML 站点地图,只放真正需要收錄的 URL;
- 在已有收錄的頁面里补充編輯性内鏈。
這些路径不必全部上齐,但至少要保證重要内頁不是只挂在一個入口上。入口越單一,蜘蛛漏掉它的概率越高。
別忽略抓取频率和预算
蜘蛛在站上的時間是有額度的。如果站点里存在大量參數頁、篩選頁、重复列表頁,抓取预算會先被這些低價值 URL 消耗掉,真正想收的内頁反而排不上队。可以先把明顯不需要收錄的目錄用 robots.txt 挡住,或者用 noindex 明确表態,把額度让出来。這一步做在前面,比事後反复提交更有效。
一個可执行的排查顺序
- 看日誌:蜘蛛落在哪些 URL,抓了几次,有没有繼續深入;
- 看入口頁:導航和内鏈是否可抓取,跳數是否過深;
- 看内頁:是否有獨立價值,是否和已有頁面高度重复;
- 看站点地图:是否包含重要内頁,是否混入大量低质 URL;
- 看屏蔽規則:是否有誤挡、软 404、指向错誤的 canonical。
按這個顺序過一遍,多數“蜘蛛只抓一两個頁面”的情况都能找到原因,而不是笼统地归到“外鏈不行”。
外鏈和蜘蛛池解决的是“来不来”,站内结构决定的是“走多深、收多少”。两者是两件事,別用同一套動作去期待同一個结果。
最後提醒一点:蜘蛛的抓取行為和最终收錄之間,還隔着頁面质量的判断。即使蜘蛛抓了内頁,也不代表一定進索引。把入口理顺、把内頁做扎實,是能自己控制的那部分,剩下的交给時間。