列表頁翻到第 2 頁、第 3 頁,要不要让它們進索引?這個問题看起来只是加不加一個标簽,實际牵扯到抓取预算、重复内容判断和用戶進入路径。處理顺序弄反,常见的结果是:该被發現的深层内容没被發現,一堆高度相似的列表却占着索引位。
先分清楚是哪一類分頁
同样叫“列表頁”,性质差別很大,處理方式也不一样。
- 内容型列表:每頁展示不同的商品、文章、职位,翻頁後内容确實變化,每個頁面都有獨立的條目集合。
- 纯翻頁型:第 2 頁只是第 1 頁的延續,标题、描述和主体结构高度相似,缺少獨立信息。
- 篩選參數型:由排序、價格区間、标簽组合生成,URL 數量可以不断膨胀。
分類没做,直接统一加 noindex 或者统一 canonical 到第一頁,都會誤伤。比如把内容型列表全部 canonical 到第一頁,等于告诉搜尋引擎後面几頁的内容属于第一頁,深层條目可能因此更难被單獨發現。
三種常见處理方式與各自代價
1. canonical 指向第一頁
适合翻頁内容高度重合、每頁没有獨立價值的场景。代價是指向必须一致:如果第 2 頁 canonical 到第 1 頁、第 3 頁又 canonical 到第 2 頁,形成鏈條,後續核對會很混乱。另外,canonical 的目标本身必须是可被索引的頁面,否則等于把整组頁面都推向一個不參與索引的地址。
2. 加 noindex
适合篩選參數頁、排序頁這類低價值组合。要注意 noindex 只影响索引,不影响抓取,蜘蛛仍會来爬。如果這類 URL 數量巨大,需要配合内鏈控制、robots.txt 或參數處理一起收口,否則抓取會持續被消耗。
3. 保持可抓取、可索引
适合每頁都有獨立條目、用戶确實會翻頁浏览的列表。這種情况下要做的是标题、描述、篩選入口的差异化,而不是一刀切屏蔽。
一個關键判断:如果没有第 N 頁,某個深层頁面還能不能被用戶和蜘蛛通過別的路径找到?如果找不到,分頁本身就是一條重要路径,收得太狠會伤到内容發現。
一個可执行的核對顺序
- 抓取几條分頁 URL,確認實际返回的狀態碼、canonical 和 meta robots,不要只看模板文件。
- 把分頁按上面三類归堆,列出每一類對應的 URL 模式,數量和大致占比。
- 检查翻頁連結是否為真正的 a 标簽。翻頁按钮如果是 JS 渲染或纯点击事件,蜘蛛可能拿不到後續 URL。
- 確認第一頁與後續頁的差別是否只是數字,标题、H1、描述是否完全复用。
- 對决定不收的類別,统一加 noindex 並指定一個規范版本;對决定收的類別,检查内鏈和站点地图是否覆盖到關键頁面。
- 观察一段時間後,對照索引狀態,看是否出現集中在分頁 URL 上的“已抓取尚未索引”或重复归並。
容易被忽略的两点
一是 rel="next" / rel="prev" 早已不是索引信号,不要再指望它解决重复問题。它可以作為爬取提示保留,但决策還得靠 canonical、noindex 和内鏈。
二是分頁與站点地图的關系。把第 2 頁之後全部塞進 sitemap 通常没有好處;反過来,把深层條目的直鏈补進内鏈或 sitemap,往往比分頁本身被收錄更有價值。
分頁處理没有通用答案,只有先分類、再定策略、最後核對實际輸出這一條顺序。把它当成一個個頁面来判断,比直接套模板更省事,也更容易在索引报告里看出問题。