分頁為什么會被單獨收錄
列表頁、商品列表、文章归档常常被拆成 page=2、page=3 這样的多頁。對搜尋引擎来说,每個頁碼都是一個獨立 URL,只要能抓到、能解析,就有可能進入索引。問题不在于“能不能被收錄”,而在于這些地址在索引里扮演什么角色:是帮用戶找到深层内容,還是只是重复了第一頁的标题和摘要。
先分清两件事:抓取是蜘蛛訪問並下载頁面,索引是把頁面放進可检索的库。分頁被频繁抓取但不進入索引,是常见结果,並不代表配置出错。反過来,如果分頁大量進入索引,也可能意味着入口頁的质量信号被稀释。
核對顺序:從入口頁往深處走
第一步:確認頁碼 URL 的统一寫法
同一個第二頁可能出現 ?page=2、/page/2、?paged=2、#page2 等多種形式。先统一成一種,其他形式 301 到規范地址。用 # 锚点寫的“翻頁”不會被当成新頁面,如果站内連結只寫成锚点,深层内容可能永遠不被發現。
第二步:看分頁自身的 canonical
常见两種做法:分頁 canonical 指向第一頁,或者指向自身。指向第一頁时,搜尋引擎更可能把後續頁碼合並到入口頁,深层條目获得單獨抓取的机會下降;指向自身則等于承認分頁是獨立地址。選哪種取决于内容组织方式,但同一個站点應保持一致,不要一部分指向首頁、一部分指向自身。
第三步:检查分頁的标题與描述
如果第 2 頁到最後一頁都用同一個标题和同一段描述,索引里出現多條几乎相同的摘要並不奇怪。可以在标题里加入頁碼或分组标识,让每頁有可区分的主题。
分頁本身不是“坏頁面”,判断标准是它是否提供了與入口頁不同的内容集合,以及用戶是否真的會從搜尋结果進入這一頁。
第四步:確認蜘蛛能走到第几頁
很多站点的列表只有“下一頁”,第 10 頁之後不存在可点击路径。這種情况下,深處内容只能靠站点地图或站内搜尋被發現。可以用抓取日誌統計頁碼參數的訪問分布,看蜘蛛實际停在哪里。
- 第一頁被抓取次數遠高于後續頁,属于正常;
- 第 3 頁以後完全没有訪問,說明路径或内鏈存在問题;
- 同一頁碼被反复抓取但内容未變,检查返回头與缓存設定。
第五步:决定收錄策略並保持一致
- 列表内容本身需要被检索的:保留分頁可抓取,規范到自身,标题做区分。
- 只是浏览入口的:允许抓取但用 noindex 排除索引,注意 noindex 不影响抓取,深层條目仍有机會被發現。
- 已经有“查看全部”頁面的:把分頁指向它,並检查该頁面体积是否過大。
- 篩選參數、排序參數和頁碼混在一起的:先按參數维度收敛,再處理頁碼。
策略定下来後,同步更新站点地图與内鏈:不要在站点地图里提交已经 noindex 的地址,也不要让内鏈把蜘蛛送到 301 跳轉鏈的中間节点。
观察與調整
調整後不要只盯着索引數量這一個指标。可以關注抓取分布是否從大量重复分頁轉向深层條目、入口頁的抓取频次是否變化、站点地图中被抓取的比例。最终收錄與否由搜尋引擎决定,我們能做的是把 URL 形態、内容差异和發現路径整理清楚。