很多站点的問题不是没有内容,而是關键頁面被放在了一條很長的發現鏈條末端。首頁到詳情頁要经過五六层,中間還夹着篩選和分頁,搜尋蜘蛛即使能沿着連結走進来,也未必有足够的抓取配額走到最深處。抓取深度,本质上决定了 URL 被發現的机會大小。
一、抓取深度為什么會影响 URL 發現
搜尋蜘蛛的来訪是有预算的。它從一個入口進入站点,沿着連結一层层展開,每往下一层,消耗的抓取次數就更多。深度越浅的頁面,被反复回訪的机會越多;深度越深的頁面,往往要等前面的頁面抓得差不多了,才可能排進队列。
這带来一個常见現象:首頁、栏目頁几乎天天被訪問,而真正有内容的詳情頁,半個月才被看一眼。並不是詳情頁不重要,而是它距离入口太遠,路径太長。
二、层級是怎么被算出来的
最短路径優先
同一個 URL 通常會被记成离入口最近的那條路径的距离。也就是说,只要你能在某處给它安排一條更短的入口,它的层級就會随之改善。
多條鏈路並不等于多次机會
一個頁面被十條連結指向,並不會让它的层級變浅,但會增加它被重新發現的概率。真正决定能不能入队的,還是最短的那條路径。
三、几種常见的越点越深的结构
- 栏目頁只放一個更多按钮,真實列表藏在第二层頁面里;
- 列表頁依赖脚本渲染,連結在源碼里不存在,只能靠站点地图兜底;
- 詳情頁之間互不引用,每個頁面都是孤立的终点;
- 归档、标簽、作者頁层层嵌套,把入口價值稀释掉;
- 導航只寫一級分類,二級分類只能靠面包屑返回。
這些结构單獨看都不算错,叠在一起就會让詳情頁的可達深度成倍增加。
四、把重要 URL 拉近入口的几個動作
- 在首頁或一級栏目頁保留一组稳定的人工入口,指向目前最重要的内容分類。
- 正文里用相關阅讀、上下篇、同标簽推荐,把同一层的頁面横向连起来。
- 列表頁尽量在 HTML 中輸出真實連結,减少對脚本的依赖。
- 给深层頁面补一批来自浅层頁面的直鏈,哪怕數量不多。
- 控制归档頁、篩選頁的自動生成規模,避免浅层位置被低價值 URL 占满。
五、深度不是越浅越好
把所有頁面都塞進首頁,结果是首頁的連結價值被摊薄,重要頁面反而得不到足够關注。更合理的做法是分級:核心頁面保持在两跳以内,長尾内容允许深一些,但要有稳定的横向鏈路维持。
另一個容易被忽略的点是路径稳定性。如果每次更新都改動導航结构,蜘蛛上一次记住的路径就可能失效,需要重新探索一遍,發現效率會明顯下降。
六、怎么核對真實深度
把抓取日誌和站内連結表放在一起看,可以反推每個 URL 最近一次是被哪個頁面带進来的,以及從入口算起经過了几跳。重点看两類頁面:有内容但長期没有抓取记錄的,和抓取频繁但頁面價值很低的。
- 有内容無抓取:優先补浅层直鏈,而不是反复提交;
- 抓取多價值低:收敛生成規則,减少浅层噪声;
- 层級忽深忽浅:检查導航和列表模板近期有没有改動。
抓取深度很难一次調好。它更像一條随内容增長不断變化的路,需要定期看看關键的 URL 是不是還留在入口附近。