網站收錄

孤岛頁面與内鏈深度:頁面迟迟不被發現的核對顺序

有些頁面没被收錄,不是内容問题,而是搜尋蜘蛛從没走到過。本文按入口數量、入口頁狀態、点击深度、連結可抓取性给出核對顺序,並列出無限滚動、首頁短暂露出等常见入口問题與可落地的處理動作。

網站收錄

孤岛頁面與内鏈深度:頁面迟迟不被發現的核對顺序

有些頁面並不是被判定為低质量才不收錄,而是搜尋蜘蛛压根没有走到過那個地址。所以在排查收錄之前,先確認一件事:這個頁面從首頁出發,能不能通過正常連結被点到。如果答案是不能,後面讨论的内容质量、更新频率都属于次要問题。

抓取的前提是有入口

搜尋蜘蛛發現 URL 的常见来源包括:站内連結、sitemap、外部連結,以及歷史抓取记錄里残留的地址。其中站内連結的可控性最强,也最容易被忽略。一個頁面如果只存在于 sitemap 里,没有其他頁面指向它,它的抓取優先級通常較低,等待時間也會被拉長。

連結本身要可被抓取

  • 連結要寫成 a 标簽的 href 属性,不要用 onclick 或者 div 模拟跳轉;
  • 避免把 JavaScript 渲染後才插入的連結作為唯一入口;
  • 内部連結不要加 rel="nofollow",也不要用 robots.txt 屏蔽列表頁;
  • 锚文本尽量有實际含义,避免整頁都是“点击這里”。

核對顺序

  1. 先確認頁面有几個内鏈入口。只有 sitemap 里出現、正文中没有任何連結指向的地址,通常属于孤岛頁面。處理方式是把它接回主结构,而不是反复提交。
  2. 再看入口頁自己有没有被抓取。如果指向目标頁的栏目頁或列表頁長期没被抓,目标頁自然难以被發現。入口失效會连鎖传递。
  3. 检查点击深度。從首頁到目标頁要经過几层連結?层級越深,被抓取的频次和優先級通常越低。重要頁面尽量控制在三层以内。
  4. 检查列表頁的分頁與篩選。如果新頁面只出現在第十頁之後,或者只在某個篩選參數组合里出現,被發現的概率會明顯下降,可以把重要入口前置。
  5. 检查入口連結是否指向跳轉或屏蔽地址。入口先跳 301 再跳目标頁,鏈路越長,發現效率越低。
  6. 最後才看内容與更新。入口確認存在、层級合理、連結可抓取之後,再去讨论内容差异度和更新信号,顺序不要颠倒。

常见的几種入口問题

  • 栏目頁用無限滚動,連結只在滚動後才生成,蜘蛛看到的是空容器;
  • 新文章只在首頁短暂露出,第二天就被推到列表深處;
  • 标簽頁、聚合頁數量很多,真正的内容頁却没有反向連結;
  • 把站内搜尋结果頁当成入口,實际是參數型临时地址。
把頁面接進主連結结构,是提高被發現概率的常規做法,但它不等于一定被收錄。是否進入索引,仍由搜尋引擎综合判断。

可以落地的處理動作

先做一次小范围盘点:從首頁出發按点击层級顺一遍站内連結,找出没有任何頁面連結到的地址。针對這些地址,選擇相關的栏目頁或文章頁做自然的上下文連結,而不是在頁脚全站堆連結。對于确實需要長期保留、但入口偏弱的頁面,可以考虑在相關聚合頁或導航中给出固定位置。

處理完之後不要立刻反复提交,给抓取和评估留一段時間,再观察入口頁與目标頁的抓取记錄是否出現變化。如果入口已经接好、层級也合理,剩下的就更偏向内容本身和整体站点质量了。