栏目頁、标簽頁、归档頁是站内新内容被發現的主要入口。這些頁面通常靠翻頁把歷史内容一頁頁铺開,如果分頁這一环出了問题,蜘蛛往往只抓到第一頁的十几條連結,後面的内容就只能靠 Sitemap 和内鏈碰运气。
分頁為什么會影响 URL 發現
蜘蛛的抓取是有预算的。它進入一個列表頁後,會沿着頁面上的連結繼續走。分頁連結如果存在且可点,它就能顺着翻到第二頁、第三頁;如果分頁連結是按钮、是脚本生成、是异步加载出来的,那么對蜘蛛来说,這一頁就是终点。時間一長,越老的内容越难被重新訪問,更新過的舊文章也可能長期停留在舊版本上。
常见的几類分頁問题
翻頁連結依赖脚本
“加载更多”按钮通過点击事件請求接口並把结果插入頁面,這種寫法對用戶很顺手,但連結没有出現在初始 HTML 里。可以给按钮加一個普通的 a 标簽作為回退,指向带頁碼的地址,让不支持脚本的訪問者也能翻頁。
路径與參數混用
同一個列表既能用 /list/page/2/ 訪問,也能用 /list/?p=2 訪問,两套地址各自被抓,就容易出現重复内容。挑一種作為标准,另一種用 301 指過去,或者干脆不产生。
分頁被規則挡住
有些人担心翻頁太多浪費抓取,就在 robots.txt 里屏蔽带 page 的地址,或者给分頁加上 noindex。屏蔽之後,蜘蛛同样無法沿着這些連結往下走,代價是新内容發現變慢。如果只是不想让分頁參與排名,用 noindex,follow 更合适,同时確認 canonical 指向自身而不是第一頁。
翻頁數量過多
一個栏目如果分成上百頁,後面几十頁可能長期無人訪問。可以考虑限制可见翻頁范围,同时用 Sitemap 或专题頁把老内容重新组织成可發現的入口。
自查清單
- 打開栏目頁的源代碼,確認翻頁連結是 a 标簽,且 href 里有真實地址。
- 用禁用脚本的方式看一眼頁面,是否還能走到第二頁。
- 检查分頁地址是否只有一種形式,尾斜杠、大小寫、參數顺序是否统一。
- 查看分頁頁面的 canonical,是否指向自身,而不是全部指向第一頁。
- 確認分頁的 meta robots 没有誤用 noindex,nofollow。
- 翻到最後一頁,看是否存在空白頁、重复的第一頁内容或 404。
- 排序參數(按時間、按热度)是否产生了大量内容相同的地址。
- 在訪問日誌里搜一下翻頁地址的抓取记錄,看蜘蛛實际走到了第几頁。
處理时的几個原則
- 優先保證可達:先让連結能被抓到,再谈要不要让它參與排名。
- 一個地址一種形式:分頁地址越規整,重复内容的排查成本越低。
- 给老内容留入口:除了翻頁,也可以用分類聚合、相關推荐、Sitemap 分担發現任務。
- 改動後回看日誌:調整了分頁结构,隔一段時間看看蜘蛛的抓取路径有没有跟着變化。
分頁不是靠堆頁碼来讨好蜘蛛,而是把已有的内容组织成一條能被走通的路。
這類检查不需要多复杂的工具,打開頁面看源碼、亲手翻几頁、再翻翻訪問日誌,多數問题就能暴露出来。發現一處改一處,比一次性大改模板更稳妥。