很多站点的收錄問题不是出在首頁或詳情頁,而是出在分頁上。一篇文章被拆成五頁,一個列表被翻成几十頁,结果索引里同一组内容出現了多個地址。核對时如果不先把分頁這一類拆出来看,很容易把“總量涨了”誤判成“收錄變好了”。
先分清三類分頁
不是所有翻頁都该用同一套處理方式,核對前先按来源归一下類。
- 真分頁:内容确實太長,一頁放不下,或者列表條目确實多,需要分批呈現。每一頁都有用戶會直接搜到、用到的可能。
- 伪分頁:為了增加浏览量,把本可以一頁讲完的内容切成多頁,每頁正文只有几百字,标题几乎一样。
- 篩選與排序:分類、價格区間、排序方式产生的地址,本质上還是同一批條目換了顺序或做了過滤。
三類里,只有第一類值得認真考虑單獨收錄,後两類通常需要收口。
在索引里怎么核對
打開站点的收錄核對表,把带分頁特征的地址單獨列一列,可以按 URL 里的頁碼段、page 參數、斜杠加數字這几類去筛。
- 數一下分頁地址在總收錄量里占多大比例。如果超過三成,先別急着看新增,先看看主頁面有没有被挤掉。
- 抽十来個分頁,逐條對比标题、H1 和首屏摘要。如果除了頁碼數字几乎完全一致,這些頁面在索引里大概率會互相竞争。
- 看主頁面是否稳定:第一頁收錄正常,還是反而被後面的頁碼頁替換掉了展示位置。
- 看抓取记錄里分頁的占比。深翻頁消耗的抓取次數如果明顯偏高,正文頁的更新就容易被延後。
處理方式要分情况選
真分頁
如果每頁确實有獨立内容,建议给每一頁寫單獨的标题和摘要,別只在标题後面加個“第几頁”。同时保持頁面之間用普通的 a 連結互连,前後頁都能直接点到,不要只靠滚動加载。
伪分頁
優先合並回單頁。合並後只保留一個地址,原分頁地址做跳轉或返回合适的狀態碼,不要留着两個内容高度相似的頁面同时可訪問。
篩選與排序頁
保留有搜尋價值的那几種组合,其余用 noindex 收口,但連結仍然要能被跟踪,不然里层的條目頁會變得很难被發現。
几個容易踩的坑
- canonical 全部指向第一頁:如果後面的頁面确實有自己的内容,這么做等于告诉搜尋引擎這些頁面是重复的,它們很难再被單獨收錄;如果内容本来就相同,那更應该做的是合並,而不是留着一堆可訪問的地址。
- 依赖 rel=next/prev 做归並:主流搜尋引擎已经不再把它当作收錄信号,別把它当成唯一的處理手段。
- 把分頁全塞進 sitemap:sitemap 是發現入口,不是收錄清單。深翻頁大量出現,會稀释真正需要更新的正文頁的抓取机會。
- 给分頁加 nofollow:這會让更里层的内容更难被爬到,通常不是想要的结果。
判断标准可以简化成一句话:這個分頁地址單獨拿出来,能不能回答一個用戶會主動搜尋的問题。能,就给它獨立身份;不能,就收口到主地址上。
改完之後怎么驗證
分頁的調整不會立刻反映在索引里,建议只改一類,然後固定周期观察三個指标:分頁地址的收錄數量是否下降、主頁面是否保持稳定收錄、正文頁的抓取次數是否回升。三者一起看,比只盯收錄總量的涨跌更有意义。