列表頁、分類頁、聚合頁一旦開啟翻頁,URL 數量就會按倍數增長。第 2 頁、第 3 頁……第 50 頁都存在,蜘蛛也能顺着連結一路讀下去。但這些地址该不该被抓取,和它們该不该進索引,其實是两個問题。
先分清两種翻頁
同样是 ?page=3,背後可能是完全不同的東西:
- 内容递進型:第 1 頁是最新 20 條,第 2 頁是更早的 20 條,每一頁都有各自不重复的條目。這類分頁是内容的组成部分,用戶确實會翻到第 5 頁去找東西。
- 视图切換型:排序方式、每頁條數、展示模式不同,條目集合基本一致。這類地址更像同一批内容的多個视图。
判断方法很朴素:把两個 URL 的正文列表拉出来對比。重合度高的是视图切換,各取所需的是内容递進。
被抓取不等于要進索引
蜘蛛需要顺着翻頁連結走到第 10 頁,才能發現那里的一條老内容。如果把深翻頁全部屏蔽抓取,等于切断了這條通路。更常见的做法是:放開抓取,但對没有獨立價值的深翻頁做索引收口,比如加 noindex,或者让它們 canonical 指向第 1 頁。
注意顺序:noindex 和 canonical 都要求頁面能被抓到才生效。先屏蔽抓取再指望索引消失,往往只會让狀態卡在原地。
几種常见處理,各适用什么场景
- 分頁全部可收錄:适合内容量适中、频道頁本身有检索需求的站点。前提是每一頁都有獨立标题和摘要,別让第 3 頁的标题還是“XX 列表”。
- 第 1 頁收錄,後續 noindex:适合條目更新快、翻頁内容时效性弱的频道。用戶搜尋时命中的多半是具体條目頁,而不是第 7 頁列表。
- 後續頁 canonical 指向第 1 頁:适合视图切換型參數。但要確認第 1 頁确實能代表這批内容,否則會把有價值的差异信息抹掉。
- 無限滚動加分頁 URL:滚動加载的部分最好保留可被抓取的連結入口,別只靠点击触發。
深翻頁泛滥时的止损動作
如果站内出現大量第 30 頁、第 80 頁這样的地址,先別急着批量删。可以按這個顺序處理:
- 把翻頁連結的锚文本寫清楚,例如“下一頁”,而不是一串没有含义的编号。
- 對确實没有检索需求的深翻頁做 noindex,同时保留内鏈,保證蜘蛛仍能走到更早的條目。
- 检查是否每個條目都有獨立入口。如果某條内容只能通過第 20 頁找到,問题不在分頁,在于它缺少更直接的連結路径。
一次自查的顺序
- 随机挑三個分頁 URL,看标题和摘要是否重复。
- 確認這些頁面是否可被抓取,检查 robots 與返回狀態碼。
- 看它們目前是否在索引里,別只依赖單一指令查询,多做几種方式交叉確認。
- 按上面几類场景選一種策略並统一执行,別让不同频道各来一套。
- 观察一段時間後再調整,短時間反复改指令會让狀態更难判断。
分頁處理的本质,是把“蜘蛛需要走的路”和“用戶需要搜到的頁”分開對待。路要留通,索引不一定要全留。