網站收錄

列表頁收錄一大堆,詳情頁却不進索引:先核對内鏈導出與聚合范围

列表頁和篩選頁被大量收錄,詳情頁却長期停在“已發現”或完全没進索引,是常见的结构性問题。本文按内鏈導出、聚合參數、詳情頁自身條件、日誌抓取分配四個环节给出核對顺序,並說明處理的先後關系。

網站收錄

列表頁收錄一大堆,詳情頁却不進索引:先核對内鏈導出與聚合范围

很多站点會遇到這样的情况:栏目列表頁、分頁、篩選结果頁很快被收錄,而真正想让人看到的詳情頁,要么停在“已發現,尚未编入索引”,要么连抓取记錄都很少。這不是單一的收錄問题,而是頁面结构、内鏈分配和抓取资源三者叠加的结果。核對时不要只盯着詳情頁本身,先看它在整站鏈路里的位置。

先分清两類頁面在抓取鏈路里的角色

列表頁通常是入口型頁面:更新频率高、外鏈和内鏈都多、URL 层級浅,還常常被導航和首頁直接指向。詳情頁是终点型頁面,主要靠列表頁把連結传過来。如果列表頁本身又有分頁和篩選,蜘蛛很容易在中間层反复游走,走不到最後一层。

  • 列表頁更新频繁,触發重抓的概率天然更高;
  • 分頁、篩選组合會制造出大量近似 URL,抓取预算被摊薄;
  • 詳情頁如果只出現在靠後的分頁里,被發現的時間會明顯拉長。

核對一:内鏈是否真的導出到了詳情頁

先做最基础的一步:把列表頁的 HTML 拉下来,搜詳情頁的 URL,看連結是否在源碼里。常见的几個断点:

  1. 列表内容是 JS 渲染的,源碼里只有骨架,抓到的 HTML 中没有詳情頁連結;
  2. 标题連結被寫成按钮或图片,缺少可抓取的 a 标簽;
  3. 連結带了 nofollow,或者指向了跳轉中間頁;
  4. 第一屏有連結,後續分頁的連結没有進入源碼。

如果詳情頁只能通過“更多”按钮或滚動加载出現,那么它被發現的前提就變得很脆弱。

核對二:篩選與聚合是否制造了無限列表

带排序、價格区間、标簽组合的篩選頁,往往能产出成千上萬個 URL。這些頁面内容相似、價值重复,却因為不断有新 URL 出現而持續吸引抓取。结果就是蜘蛛在篩選頁里打轉,詳情頁分到的次數變少。

處理顺序上,先收敛篩選參數,再谈詳情頁收錄,比反過来做更省力。

收敛方式包括:只保留有搜尋量的篩選组合、對無價值组合加 noindex 或 robots 限制、用可抓取的連結结构替代纯 JS 篩選。

核對三:詳情頁自身是否具备入库條件

  • 正文是否完整可達,有没有被登入、彈窗或懒加载挡住;
  • 同一模板下的詳情頁是否高度雷同,只有标题和一行參數不同;
  • canonical 是否指向本身,而不是誤指向列表頁或其他版本;
  • 返回的狀態碼是否稳定,有没有間歇性 5xx 或软 404。

如果詳情頁本身信息量不足,即便連結通畅、被抓取,也可能長期停在索引之外。

核對四:用日誌看抓取次數怎么分配

從日誌里分別統計列表頁、分頁、篩選頁、詳情頁的抓取次數和狀態碼分布。重点看两件事:篩選類 URL 是否占了很大比例;詳情頁的抓取是否集中在少數几個頁面上。前者說明资源被中間层吃掉,後者說明内鏈導出的分布不均。

按顺序處理,留出观察窗口

  1. 先收敛篩選與排序參數,减少低價值 URL 的产生;
  2. 确保詳情頁能從列表頁第一屏或分頁源碼中直接点击到達;
  3. 站点地图只提交值得收錄的詳情頁,不要把篩選頁塞進去;
  4. 改完後观察一段時間,對比詳情頁的抓取次數與索引狀態變化。

结构調整的效果通常需要一段抓取周期才能体現,中途频繁改動反而會干扰判断。把核對做在前面,比反复提交 URL 更有意义。