網站收錄

分頁與列表頁的收錄邊界:哪些该進索引,哪些留在抓取层就够

列表頁和分頁頁常被当成收錄目标,其實它們更多是帮爬虫發現詳情頁的通道。本文按“有没有搜尋需求、内容是否重复、入口是否唯一”三個問题,梳理第一頁與後續翻頁、篩選排序组合頁、标簽聚合頁的處理差异,並给出用 site 查询、服務器日誌和索引覆盖报告核對判断的检查方式。

網站收錄

分頁與列表頁的收錄邊界:哪些该進索引,哪些留在抓取层就够

先把“發現”和“收錄”分開看

列表頁、分頁頁、篩選頁最容易被混淆的一点是:它們的價值更多在于让爬虫顺着連結走到詳情頁,而不是自己成為搜尋结果。把這两件事分開之後,判断就简單很多——一個分頁 URL 哪怕不進入索引,只要爬虫會来、會跟着連結繼續往下走,它的任務就已经完成了。

反過来,如果你把所有翻頁都当成收錄目标去追,往往會得到一大堆内容高度相似、彼此抢位置的頁面,既占用抓取资源,也让索引變得臃肿。

判断一個列表頁该不该進索引

可以按下面三個問题依次過一遍,多數頁面在第二步就能有结论。

  1. 它有没有獨立的搜尋需求?如果用戶會直接搜“某類文章列表”“某某排行榜”這類词,說明這個頁面本身有被检索的價值,可以考虑保留在索引里。
  2. 它的主体内容和別的頁面重不重复?page/2、page/3 這類翻頁,通常只是把同一批内容切块,正文高度相似,獨立價值很低。
  3. 它有没有稳定的入口和唯一的 URL?排序參數、會话參數拼出来的组合頁,往往一個内容對應几百個 URL。這種先收敛入口,再谈收錄,顺序不能倒。

常见的几類頁面,處理方式不一样

第一頁與後續翻頁

很多站点把第一頁当作栏目主入口,那么第一頁保留在索引里是合理的;page/2 及之後的翻頁,如果只是同一批内容的延續,一般不需要單獨進索引,但要保證爬虫仍然能從第一頁顺着点下去。

關键是別用 noindex 把整條鏈断掉。被 noindex 的頁面上的連結仍然可以被跟踪,但如果整站大面积這么做,發現效率會明顯下降。稳妥的做法是保留可抓取、可顺着翻頁前進的路径,只控制是否進入索引。

篩選、排序产生的组合頁

颜色、價格、排序方式這些參數组合起来,數量是指數級的。常见處理是:保留一两個确實有搜尋量的篩選组合,其余通過 URL 規范或 robots 規則挡在發現入口之外。判断标准不是“參數多不多”,而是“這组條件下有没有人真的會搜”。

标簽頁與聚合頁

标簽頁的特点是數量多、每頁内容少、彼此交叉嚴重。如果站内已经有對應的栏目頁和詳情頁,這些标簽頁往往只是重复入口。可以先看它們是否带来過自然搜尋点击,長期没有曝光的,考虑合並進栏目頁或逐步收敛。

怎么確認自己判断得對不對

  • 用 site: 查询看看這類 URL 實际被收錄了多少,和你的预期差多少。
  • 翻服務器日誌,看分頁 URL 的抓取频次是否正常——如果翻頁几乎不被抓,說明入口或連結有問题,而不是“搜尋引擎不喜欢”。
  • 看索引覆盖报告里“已發現,尚未收錄”的 URL,其中分頁和篩選頁占比偏高,通常說明可抓取的低價值 URL 太多。
判断顺序建议固定在:先確認有没有搜尋需求,再看内容是否重复,最後才决定是保留索引還是只留作抓取通道。反過来的顺序容易一刀切,把本来有需求的頁面也一起關掉了。

調整之後要观察什么

收敛一批分頁或篩選頁之後,重点不是看收錄總數有没有下降,而是看两件事:詳情頁的抓取频次有没有變化,以及這些列表頁原本带来的搜尋点击有没有轉移到栏目頁上。如果詳情頁抓取更顺畅、栏目頁接住了流量,說明這次收敛是有效的;如果詳情頁反而變慢,通常要回头检查入口連結是否被一起砍掉了。