分頁是列表型栏目绕不開的结构。文章列表、商品列表、标簽聚合頁,只要内容量上来,就會自然分出第 2 頁、第 3 頁。對用戶来说,分頁只是浏览方式;對搜尋蜘蛛来说,分頁却是一组需要判断的 URL。如果分頁逻辑没處理好,蜘蛛可能在翻頁上消耗大量抓取配額,也可能错過列表深處的内容。
分頁為什么值得單獨自查
蜘蛛發現新 URL 的路径,很大一部分来自列表頁和分頁。它顺着第一頁找到第二頁,再找到第三頁,理论上可以一路爬下去。問题在于,站内分頁一旦出現參數混乱、連結依赖 JavaScript、或者每頁内容高度重复,蜘蛛就容易在同一個列表里来回绕。更常见的情况是,分頁連結虽然存在,但只是按钮,没有可抓取的 a 标簽,蜘蛛只能抓到第一頁。
另一個誤区是把所有分頁都设成 noindex。分頁不是低质頁面,它是通往詳情頁的通道。如果把分頁全部屏蔽,蜘蛛仍然可以通過第一頁找到部分文章,但較深的内容就需要更多轮抓取才能發現。對更新频繁的站点来说,這會让新内容進入索引的速度變得不稳定。
先分清三種常见分頁形態
传统翻頁
每頁有獨立的 URL,頁面底部或顶部有上一頁、下一頁、頁碼連結。這種形式對蜘蛛最友好,關键是保持連結可抓取,並让頁碼 URL 稳定,不要今天用 /page/2,明天用 ?paged=2。
加载更多
点击按钮後追加内容。如果按钮只是 JavaScript 事件,没有對應 URL,蜘蛛無法通過它繼續往下。可以保留一個可抓取的“下一頁”連結,或者為加载更多提供獨立 URL。
無限滚動
用戶滚動时自動加载。体驗顺滑,但蜘蛛通常不會滚動頁面。需要给無限滚動配上分頁 URL,或者至少在第一屏提供足够多的可抓取連結,並在頁面中放置指向後續頁面的連結。
分頁自查清單
- 翻頁連結是否使用普通 a 标簽,而不是 onclick 或纯按钮?
- 第二頁及之後的頁面,标题和描述是否只是机械重复第一頁?
- 分頁 URL 是否统一,有没有參數和路径混用?
- 分頁頁面是否被誤设成 noindex 或 robots.txt 屏蔽?
- 分頁頁面上的 canonical 是否指向自己,而不是全部指向第一頁?
- 列表内容是否随頁碼更新,還是每一頁都展示同一批内容?
- 空分頁、超出范围的頁碼是否返回 404 或 410,而不是 200 空列表?
几個容易踩坑的處理方式
把分頁 canonical 全部指向第一頁是常见错誤。這样等于告诉搜尋引擎後續頁面不是獨立頁面,蜘蛛可能减少對它們的抓取,列表深處的文章也更难被發現。分頁頁面可以自指 canonical,或者不寫 canonical,让搜尋引擎自行判断。
用 robots.txt 屏蔽分頁參數也要谨慎。如果被屏蔽的 URL 正好是蜘蛛進入詳情頁的唯一路径,就會切断發現鏈路。更好的做法是保留可抓取的分頁,把真正無價值的篩選组合參數頁單獨處理。
分頁标题完全一样並不致命,但可以在标题里自然加入頁碼或该頁的特征,例如“第 2 頁”。不要為了關鍵詞堆砌而强行改寫,保持可讀即可。
观察蜘蛛在分頁上的行為
可以结合抓取日誌看几件事:蜘蛛是否訪問到第 3 頁、第 5 頁,還是只停在第一頁;分頁 URL 是否出現大量重复抓取;參數组合是否产生蜘蛛陷阱。如果發現某個列表頁每天被反复抓取,但詳情頁更新很少,就要检查分頁連結是否让蜘蛛進入了循环。
分頁不是為了让蜘蛛無限翻頁,而是為了让重要内容有一條清晰、稳定、可抓取的發現路径。能翻到,比翻得深更重要。
小结
分頁自查不需要复杂工具。打開栏目第一頁,禁用 JavaScript,看看還能不能顺着連結走到第二頁、第三頁;再看看分頁 URL 是否稳定、是否被誤屏蔽、canonical 是否合理。把這几件事理顺,蜘蛛在列表頁里的抓取會更有效率,新内容也更容易被带到该去的位置。