做站点运营的人经常會遇到一個現象:詳情頁没几條進索引,分頁列表却一條接一條被收錄,翻到第 8 頁、第 20 頁依然能在搜尋结果里看到。這不一定是坏事,但如果不加区分地放任,索引里會堆积大量低價值 URL,真正需要被發現的頁面反而被稀释。
分頁為什么容易被大量收錄
分頁有几個天然優势:連結數量多、层級浅、更新频繁、指向它的内鏈稳定。對搜尋引擎来说,這類 URL 發現成本很低,抓取也很顺。相反,一個新詳情頁可能只挂在列表頁底部,還要经過若干层跳轉才能被發現。抓取机會的分配本身就不均衡,收錄结果自然也會偏。
這里要区分两件事:抓取是過程,收錄是结果。爬虫来了很多次,不代表頁面一定進索引;内容质量、重复程度、是否被規范到別的 URL,都會影响最终取舍。
分頁去留的判断维度
一看内容是否自成一体
如果分頁上除了标题和日期,只有一串連結,内容與第 1 頁高度重合,它的獨立價值就很有限。反過来,有些分頁承担了真實的浏览需求,比如按時間归档、按分類翻頁,用戶确實會一頁頁看下去,那就不必急着收口。
二看是否有更合适的規范目标
同一组分頁可以用 canonical 指向系列首頁,让搜尋引擎知道這些 URL 属于同一组内容。但要注意:規范标簽不等于刪除,也不保證會被完全采纳,它只是表達偏好。指向一個不相關或已 404 的地址,反而會制造新的問题。
三看抓取成本與索引規模
如果站点能组合出几十萬個篩選與翻頁 URL,抓取预算會被大量消耗在翻頁上,新内容與重要頁面的發現速度就會變慢。這时問题往往不是「要不要收錄分頁」,而是「要不要让這么多分頁 URL 被生成出来」。
常见的處理思路
- 保留可控分頁:只保留有真實浏览價值的翻頁,例如分類頁的前几层。
- 限制無限翻頁:用「加载更多」或只保留前若干頁可点,避免生成到第 100 頁。
- 收敛參數:排序、视图切換等參數尽量统一,不為每種组合生成獨立可索引地址。
- 規范到系列首頁:對确定為同一组的分頁给出统一規范目标,並保持该目标可訪問。
- 让列表保持更新:如果翻頁只是把舊内容反复重排,長期價值會持續下降。
動手前的自查顺序
- 先看搜尋表現:分頁是否有真實的展示與点击,還是只是躺在索引里。
- 再看日誌:爬虫在分頁上花了多少請求,占總量比例如何。
- 检查參數生成規則:是否存在可以组合出大量 URL 的入口。
- 確認 canonical 與 robots 設定是否指向可用地址,避免自相矛盾。
- 改完之後留出观察期,索引變化通常不會立刻發生。
把分頁当成「有内容的頁面」還是「導航的延伸」,决定了你该保留它還是收口它。判断标准應该是用戶會不會真的用它,而不是搜尋引擎有没有收錄它。
容易踩的坑
- 直接用 robots.txt 封掉分頁,導致爬虫無法顺着連結發現更深的詳情頁。
- 把所有分頁都規范到第 1 頁,结果第 1 頁承载了過多本不属于它的词。
- 只盯着收錄數量,不看這些頁面實际带来了什么。
分頁被收錄本身不是错誤,它只是需要被纳入整体策略来管理。先明确哪些分頁有獨立價值,再决定保留、合並還是限制生成,比單纯追求「收錄多」或「收錄少」更有意义。