把目标 URL 摊在多個分頁上很常见:首頁只做引導,每頁放几十條,再靠“下一頁”一路往後。但搜尋蜘蛛並不會自動翻完所有分頁,它翻到第几頁、要不要繼續,取决于連結结构、抓取预算和每一頁的表現。
搜尋蜘蛛是怎么“翻頁”的
搜尋引擎心里没有一份全局的“分頁清單”。它發現第 2 頁的途径通常是:第 1 頁上有指向第 2 頁的連結,或者像“下一頁”這样的锚文本連結。抓到第 2 頁後,再顺着里面的連結找到第 3 頁,一层层往後。
所以分頁本质上是鏈式發現:只要中間某一頁没被抓、抓失敗了,或者連結寫成了搜尋蜘蛛跟不到的形式,後面的頁面就一起断鏈。
哪些情况會让它停在前面几頁
- 抓取预算有限:入口頁整体權重低、歷史抓取频次低时,搜尋蜘蛛往往只按时抓前几頁,靠後的分頁排不上队。
- 分頁連結由 JS 生成:点“下一頁”才用脚本加载新内容,連結本身不在 HTML 里,搜尋蜘蛛基本看不到後續頁。
- 分頁地址带一堆參數:?page=2&t=xxx 這類地址如果每次訪問都不一样,容易被当成新 URL,反而消耗抓取预算。
- 深层頁面内容几乎一样:每頁只有几條連結、彼此没有区別,搜尋蜘蛛判断價值不高,往後翻的動力更弱。
- 中間某一頁返回 404、403、5xx 或超时:鏈子断了,後面的分頁可能長期不被發現。
想让後面的分頁也有机會,可以做的几件事
- 让每一頁都能從入口頁直接点到,而不是只有“下一頁”。比如第 1 頁底部列出第 2、3、4…頁的連結。
- 控制分頁數量和單頁連結數,別把几千條拆成几百頁,那等于人為拉長抓取路径。
- 分頁連結用普通的 <a href>,不要用 JS 点击事件,不要加 rel="nofollow",也別放在 iframe 或图片里。
- 保證每一頁都能正常返回 200,响應稳定、快速。
- 把分頁地址同时放進 sitemap,作為連結發現之外的补充通道。
- 如果必须分頁,尽量把最重要的目标 URL 放在前几頁。
分頁做深並不等于“多铺几條路”。路径每多一层,後面的 URL 被發現和抓取的概率就低一截。
几個常见誤区
1. 以為分頁做了就會被抓完
分頁只是给搜尋蜘蛛提供了入口,抓不抓、抓多少,由它自己决定。分頁數量越多、單頁價值越低,靠後的頁面越可能長期不被訪問。
2. 用 rel="canonical" 指向第一頁来“集中權重”
這個做法更多影响索引层面的判断,並不能加速後續分頁的發現。處理不当還可能让搜尋蜘蛛把分頁视為重复内容,降低繼續抓取分頁的意愿。分頁场景更稳妥的做法,是让每一頁都有獨立、可正常訪問的地址。
3. 只盯着總抓取量,不看被抓的是哪一頁
在日誌里看看搜尋蜘蛛實际訪問到了第几頁、哪些分頁從来没出現過,通常比只看總數更有用。
最後提醒:本文讲的是抓取和發現的常见規律,不同搜尋引擎、不同站点的表現差別很大,也不存在“分頁一定會被抓完”的保證。入口頁做得浅一点、结构清楚一点,通常比把連結摊成几十頁更容易被搜尋蜘蛛走完。