站点的列表翻頁(常见的 /page/2、?paged=3、list_2.html)被搜尋索引收進去,是很多站点都會遇到的情况。它未必是坏事:有些翻頁頁确實有獨立入口價值,也有些纯粹是重复内容的载体,占着抓取配額。难点在于两類頁面没有明顯的分界线,所以要先判断角色,再决定收口方式,而不是统一一刀切。
先给翻頁頁分個類
按頁面的實际功能分成三類,處理方式會清楚很多:
- 系列内容分頁:長文、连载、教程的第二三頁,用戶會顺着讀下去,頁面上有内容增量。
- 列表導航分頁:文章列表、商品列表翻頁,主要作用是發現新連結,頁面之間差异有限。
- 篩選排序分頁:带篩選參數或排序參數生成的组合,數量容易失控,重复度也往往偏高。
判断值不值得收錄的几個角度
- 有没有搜尋需求:如果用戶會直接搜某類内容的第二頁、第三頁,保留收錄通常更合理。
- 内容是否只是重复:翻頁頁如果只有标题列表變化,正文结构與第一頁高度相似,價值有限。
- 抓取日誌里的占比:翻頁頁吃掉大量抓取次數、挤占詳情頁,就要考虑收口。
- 被發現的新連結:如果詳情頁主要靠列表頁被發現,收口时要保證内鏈通路不被切断。
常见收口方式與各自的副作用
canonical 指向第一頁
适合翻頁只是同一批内容另一種排列的情况。要注意第一頁本身必须自指,不要出現整條鏈路都指向別處的循环。若某一頁确實有獨立價值,就不要把它並到第一頁。
noindex, follow
适合不希望翻頁頁進入索引、但仍希望蜘蛛顺着連結爬到詳情頁的场景。寫成 noindex, nofollow 會同时断掉連結發現,除非你另有替代入口。
限制翻頁深度與連結暴露
比如只让前几頁在站内可点,後面的頁靠接口或按需加载。這種做法會让部分頁面难以被抓到,取舍时要把用戶能否到達和蜘蛛能否到達分開看。
一個容易忽略的冲突:同一批翻頁頁里,有的用 canonical 指向第一頁,有的用 noindex,還有的两種都寫。指令混用时搜尋引擎會自行判断,最终结果往往與预期不一致。改之前先把現状列成表,比改之後反复猜要省事。
調整之後的核對顺序
- 抓取日誌:看翻頁頁的抓取频次是否下降,詳情頁是否相應增加。
- 索引狀態:抽查若干翻頁 URL,確認是移出還是仍在,留意生效本身有延迟。
- 内鏈通路:確認深层詳情頁仍有可被抓到的入口,没有變成孤岛。
- sitemap 與 robots:提交的文件里不要再包含已经不打算收錄的翻頁地址,避免信号互相矛盾。
记錄變更,別反复折腾
翻頁收口很少一次到位。建议把改動時間、改動方式、当时的抓取與索引資料记在同一處,隔一段時間再看趋势。多次来回切換 canonical 與 noindex,反而會让這類頁面在搜尋引擎眼中的處理方式更不稳定。