網站收錄

列表頁翻到第二頁之後:分頁要不要收錄,怎么梳理抓取路径

列表頁的分頁既服務于用戶浏览,也承担着让蜘蛛走到深层詳情頁的任務,但這两件事的目标並不一致。本文按可達性、URL 形態、canonical 指向、路径無限延伸的顺序梳理分頁處理,並列出几個容易被忽略的细节和可以观察的指标。

網站收錄

列表頁翻到第二頁之後:分頁要不要收錄,怎么梳理抓取路径

列表頁的分頁看起来只是一個小功能,但它同时承担两件事:让用戶看完更多條目,让蜘蛛沿着連結走到更深的詳情頁。這两件事的目标並不完全一致——用戶需要翻頁,而蜘蛛只需要能顺着連結一路走到底。很多站点在這里犯的错誤,是把“分頁可抓取”和“分頁要收錄”当成同一件事。

先分清分頁的两種角色

在判断分頁该不该進索引之前,先問一個問题:這一頁除了把第一頁的條目往後挪了几位,還有没有獨立内容?

  • 纯翻頁頁:第 2、3、4 頁只是第一頁的延續,标题、描述、侧栏几乎一样,正文只有不同的條目摘要。這類頁面通常没有獨立的检索價值。
  • 带篩選语义的列表頁:例如“某城市 + 某品類”,它對應的是用戶會主動搜尋的组合,本身就是着陆頁,應当作為獨立 URL 對待,而不该被当成普通分頁。

把這两類混在一起處理,是分頁問题最常见的源头:该獨立的被当成分頁,该收敛的被当成着陆頁,结果要么詳情頁發現不到,要么索引里塞满相似列表。

核對顺序

  1. 先看詳情頁是不是全部可達。用日誌確認蜘蛛是否抓到過位置較深的詳情頁。如果分頁靠按钮事件触發,点击“加载更多”才拼接内容,蜘蛛很可能走不下去。抓不到,後面所有讨论都没有意义。
  2. 再看分頁 URL 的形態。?page=2 這類參數如果可以被任意组合、任意排序,會衍生出大量近似地址。核對是否存在無意义的參數叠加,以及預設排序是否也能生成一個带參數的地址。
  3. 然後决定 canonical 指向。如果分頁不需要獨立收錄,让它自我引用、把連結留在頁面上,通常比直接指向第一頁更稳妥——指向第一頁會被当作重复項合並,連結一般仍會被跟随,但抓取分配可能被削弱。是否這样處理,要结合自身抓取情况观察。
  4. 最後检查翻頁路径會不會無限延伸。带日期、带随机排序、允许回溯大量歷史頁的列表,容易形成蜘蛛翻不完的路径。這類入口要主動收敛。

顺序不能颠倒。先解决可達性,再谈收錄取舍;先减少無意义地址,再谈 canonical。

几個容易被忽略的细节

  • 分頁頁的标题和描述如果和第一頁一模一样,被收錄後属于同质结果,不收錄又浪費了可以表達的差异,两種做法都要有意识。
  • 移動端常见“上拉自動加载”,桌面端才是翻頁。核對时不要只测桌面,也不要用浏览器渲染後的结果替代原始 HTML 做判断。
  • 列表翻到很後面的頁面,條目往往早已下架,翻頁地址仍可訪問,返回一堆空壳。這類頁面即使被抓到,也难有收錄價值。
  • 分頁數量随库存變化,昨天第 20 頁存在、今天只剩 15 頁,残留地址却返回 200 而不是 404,會持續消耗抓取。

什么时候可以接受分頁進索引

如果分頁頁自身有足够的獨立信息,比如聚合了不同评论、不同排序下确有差异的内容,並且用戶确實會從搜尋直接落到這一頁,那么让它保持可索引是合理的。判断依據是用戶價值,而不是“多收錄一頁是一頁”。反過来,如果分頁頁只是机械複製,留在索引之外同样不會损失什么。

可以观察的指标

調整之後不要只盯着分頁本身,重点看两件事:一是詳情頁的抓取數量,以及“已發現、尚未编入索引”的比例有没有變化;二是日誌里爬取請求的分布,是否從大量翻頁地址轉向了詳情地址。這两個方向變好,說明路径梳理起了作用。指标暂时没變化也不必急着下结论,抓取和索引的反馈本来就有延迟。

分頁本身不是問题,把分頁当成着陆頁,或者把着陆頁当成分頁,才是問题的開始。