網站收錄

分頁列表頁的收錄取舍:頁碼 URL、加载更多與查看全部怎么處理

列表頁翻頁产生的第二頁、第三頁属于哪一類 URL,该不该進索引?本文把分頁拆成頁碼 URL、加载更多、查看全部三種實現,說明各自的收錄特点、常见坑與處理顺序,帮你把分頁当成内容發現通道来看待,而不是简單地一封了之。

網站收錄

分頁列表頁的收錄取舍:頁碼 URL、加载更多與查看全部怎么處理

列表頁、商品頁、文章归档都會分頁。第二頁、第三頁這些 URL,是收錄問题里最容易被含糊處理的一類:既不想让它們占满索引,又担心封得太死,導致蜘蛛走不到後面的内容。先把分頁当成一個“發現通道”来理解,再去决定每個 URL 的收錄姿態,思路會清楚很多。

分頁頁不是詳情頁的複製品

分頁 URL 上通常没有獨有内容,只是同一批資料的另一段切片。它的作用主要在两方面:一是让蜘蛛顺着連結爬到更早或更晚的记錄,二是给用戶提供浏览路径。前者關乎發現,後者關乎体驗,收錄更像附带结果。判断标准可以简化成一句话:這個頁碼 URL 對用戶有没有獨立價值,對爬虫有没有带路作用。两邊都是否,就没有必要让它進索引。

三種常见實現,處理方式不同

頁碼 URL

形如 ?page=2 或 /list/page/2/ 這類地址,一般可抓取、連結可被跟進,是發現舊内容比較可靠的路径,不建议直接用 robots.txt 封掉。robots.txt 管的是抓取,不是收錄,被封的 URL 仍可能以缺少描述的形式出現在结果里;而且被封之後,頁面里的連結也不再被跟進,後面的分頁會被一起切断。更温和的做法是:頁面保持可抓取,但不額外做優化,把索引名額留给第一頁和詳情頁。

加载更多與無限滚動

用 JavaScript 追加内容时,如果没有可抓取的連結,蜘蛛往往只能看到首屏那一批记錄。可以给“加载更多”一個真實的 a 标簽指向對應頁碼,或者同时保留一個普通分頁入口,也可以在首屏 HTML 里放足够多的連結。判断方法很直接:關掉 JS,看還剩多少可点的連結。

查看全部頁

把多頁合並成一條長列表,确實方便用戶一次看完,也减少了 URL 數量。但要留意两点:一是頁面体积和加载速度,几十上百條记錄一次渲染,移動端体驗容易受影响;二是如果查看全部頁與分頁内容高度重合,需要明确让一個版本作為規范,避免同一批内容出現多個入口。常见做法是让查看全部頁指向第一頁,或者反過来让分頁頁指向查看全部頁,關键是信号统一,而不是两種指向同时發出。

建议的處理顺序

  1. 先確認分頁在站点里承担的作用:纯浏览,還是承担了内容發現。
  2. 检查是否存在可抓取的連結路径,不依赖 JS 能否走到較深的頁碼。
  3. 决定規范化目标:第一頁、查看全部頁,還是頁碼頁各自獨立。
  4. 再考虑是否限制深分頁,比如控制最大頁碼,或按排序方式收敛。
  5. 最後固定一份抽样 URL 清單,持續观察它們的抓取與索引狀態。

深分頁要不要放開

如果站点有几萬條记錄,理论上能生成上千個頁碼 URL。全部放開,抓取量會堆在几乎没有搜尋需求的頁面上;一刀切封掉,又可能让老内容失去入口。折中办法通常是:保留正常分頁路径,让蜘蛛可以顺着走,但不主動推送後半段頁碼;同时用分類、标簽、榜單、相關内容等入口,把重要内容從另一條路重新暴露出来。這样即使深分頁被冷落,内容本身也不至于失联。

分頁 URL 的收錄,本质上是“要不要留一個入口”的問题,而不是“要不要让這個 URL 變成结果”。把入口和索引分開看,處理时少一些纠结。

另外,別只盯某一個頁碼有没有被索引。更值得记錄的是:從第一頁到第 N 頁,蜘蛛實际走到了第几頁,用了多久,之後哪些詳情頁被發現了。這些資料比單個頁碼的收錄狀態更能說明分頁路径是否真的在起作用。