分頁頁面在很多站点里數量不小,一個频道翻到几十頁很常见。它們既不是完全没用的頁面,也不是每一頁都值得進索引。處理分頁的關键,是先分清它是内容入口還是纯導航,再决定放與收。
分頁 URL 為什么容易被卡住
蜘蛛進入列表頁後,通常先抓第一頁,再顺着下一頁連結往下走。走到第二頁、第三頁时,連結层級已经比較深,如果站点没有別的入口指向後面的頁碼,抓取很容易在這里停下。這不是蜘蛛不喜欢後面的頁面,而是它判断繼續深入的收益有限。
另一個常见情况是分頁 URL 參數變化太多,比如同时存在 ?page=2、?p=2、?start=10 几種寫法,指向同一批内容。蜘蛛面對重复的列表结构,往往只會保留其中一部分。
先给分頁分類,再决定取舍
- 内容型列表頁:文章、商品、房源等逐條排布,每一頁都包含獨立條目。這類分頁有實际價值,值得保留為可抓取、可索引。
- 聚合型列表:标簽、篩選、排序结果。内容大概率與主列表重复,通常不求收錄,但要保證連結结构清晰,不至于把抓取预算耗光。
- 纯導航分頁:比如评论区翻頁、图片集翻頁。它們服務于阅讀体驗,收錄與否影响不大,重点是別让它們互相之間形成死循环。
几種分頁寫法與對應處理
路径式(/list/page/2/)對搜尋引擎最友好,URL 稳定、易讀,也方便在 sitemap 里單獨列出;參數式(?page=2)足够用,但要统一只保留一種參數,別让同一頁有多個入口。
加载更多和無限滚動不生成新 URL,蜘蛛点不到後面的内容。常见做法是给每批内容配一個可訪問的分頁連結,点击时用脚本追加,同时把這個連結留成真實的 a 标簽地址。
该收的收,该收口的收口
如果分頁确實承载獨立内容,可以保持可索引,並注意两点:一是标题別全都一样,至少在标题里体現頁碼或范围;二是第一頁與第二頁之間要有明确的前後連結,別只靠上一頁按钮。
如果分頁只是篩選排序的产物,可以不必强求收錄,但要避免它們挤占抓取:用 robots.txt 屏蔽明顯無意义的參數组合,或在頁面上限制篩選维度,让 URL 组合數量可控。已经产生的重复分頁,可考虑用 canonical 指回主列表,但前提是两者内容确實高度重合。
上线前可以自查的几点
- 任意一個列表頁,從首頁出發几次点击能到第 3 頁?
- 同一批内容是否存在多種分頁 URL 寫法?
- 分頁連結是否都是可点击的 a 标簽,而不是纯 JS 事件?
- 评论、篩選等低價值分頁是否被限制在可控數量内?
- 蜘蛛日誌里,列表頁的抓取是否集中在第一頁?
分頁不是越多越好,也不是越少越好。判断标准很简單:這一頁拿掉之後,用戶和蜘蛛是否還能找到後面的内容。