網站收錄

点击距离與内鏈深度:頁面收錄迟迟不動的入口排查顺序

頁面内容没問题、狀態碼正常,却長期不進索引,問题有时出在更前面:爬虫能不能顺着連結走到它面前。本文按入口類型和点击距离梳理排查顺序,区分“發現层面”與“頁面层面”的問题,並给出补鏈的優先級,帮助判断该先改哪里、後看什么。

網站收錄

点击距离與内鏈深度:頁面收錄迟迟不動的入口排查顺序

很多站長查收錄时,习惯盯着頁面本身:内容够不够厚、有没有 noindex、狀態碼是不是 200。但有一類頁面,内容過關、狀態碼也正常,就是長期不進索引,問题出在更前面的一步——爬虫能不能顺着連結走到它面前,以及要走几步才能走到。這就是点击距离和内鏈深度要解决的問题。

一、先分清:是没被發現,還是被發現没被收錄

点击距离影响的是“發現”這一层。如果目标頁面從来没有出現在抓取日誌里,那大概率是入口的問题;如果已经被抓過几次却没進索引,那就该回到頁面质量和信号层面去看。两者排查方向完全不同,混在一起只會来回改、看不出效果。

判断方法很简單:翻服務器日誌,看爬虫有没有對這條 URL 發起過請求。完全没有记錄,就重点查入口;有請求记錄但索引里没有,就別再纠结内鏈了。

二、量一下点击距离

点击距离是指從已知入口(通常是首頁或主要列表頁)出發,需要点几次連結才能到目标頁。可以粗略分档来看:

  • 一层:首頁直接連結,比如主導航里的栏目頁;
  • 两到三层:分類頁、子栏目頁,属于爬虫经常光顾的范围;
  • 四到五层:較深的内容頁,抓取频率開始明顯下降;
  • 五层以上:基本只能靠 sitemap 或外部連結被發現,重新抓取的間隔會拉得很長。

並不是越浅越好,導航也不该被塞满。但如果一個頁面超過四层,又没有任何横向入口指向它,那它的發現效率就很难保證。

三、按入口類型逐項核對

同样是内鏈,作用並不一样。建议按下面的顺序检查:

  1. 主導航和面包屑:是否覆盖主要栏目,面包屑是否輸出真實連結而不是纯文字;
  2. 分類列表頁:新頁面上线後,有没有進入對應列表的前几頁,而不是只躺在最後一頁;
  3. 相關推荐、上下篇:能不能把同主题的深层頁横向连起来;
  4. 站内搜尋、标簽聚合:是否對爬虫開放,還是被整体屏蔽了;
  5. sitemap:是否包含這條 URL,深层頁有没有被漏掉。

其中最容易忽视的是横向連結。纵向层級由站点结构决定,改起来牵一發動全身;而相關推荐和上下篇属于内容层面的补鏈,成本低,也更容易随内容更新持續生效。

四、几種让点击距离被“虚增”的结构

有些頁面看起来层級不深,實际爬虫走起来却很深,常见原因有:

  • 列表頁只有第一頁有真實連結,後面的内容靠 JS 加载;
  • 導航用 JS 事件跳轉,而不是 a 标簽的 href;
  • 篩選、排序參數把同一個列表拆成大量版本,爬虫走進參數迷宫;
  • 重要頁面只挂在頁脚的全站連結里,被大量無關連結稀释;
  • 分頁被 nofollow,導致後續頁面的連結鏈路中途断開。

這些問题的共同点是:人能看到,爬虫不一定能走通。核對方式是用纯文本方式查看頁面,或者在禁用 JS 的情况下看連結是否還在、href 是否可点。

五、补鏈的優先級怎么排

不是所有深层頁都值得补鏈,可以按重要程度分档處理:

  1. 核心轉化頁和重点内容頁優先,直接在相關文章、列表頁、導航中加連結;
  2. 时效性較强的内容,放在首頁或栏目顯眼位置,過期後再撤下;
  3. 長尾頁、归档頁,靠 sitemap 和分類聚合覆盖即可,不必强行提到首頁;
  4. 纯功能頁、參數頁,先评估是否值得保留入口,再决定补鏈還是收口。
补鏈解决的是“被發現”,不保證“被收錄”。如果頁面本身内容單薄、與站内其他頁高度重复,补再多的連結也只是让它被抓得更频繁,不一定進索引。

六、补完之後先看什么

补完連結不要立刻盯着索引量。建议按這個顺序观察:先看日誌里该 URL 的抓取次數有没有變化,再看抓取时返回的狀態碼和内容是否符合预期,最後才去看索引狀態。這個顺序能帮你分清:到底是入口没通,還是頁面本身還没達到收錄條件。

点击距离是一個容易被忽略的排查項,因為它不在頁面内部,而在頁面與頁面的關系里。收錄出問题时,先確認爬虫能不能走到,再谈頁面质量,往往能少走几段弯路。