分頁頁面的本质:它是導航,還是内容
列表頁第一頁通常有明确的主题,比如“全部产品”“最新文章”,用戶也确實會從這一頁開始浏览。但翻到第 2 頁、第 3 頁之後,頁面上剩下的内容往往只是同一批條目的重新排列,标题和描述高度相似,正文几乎為零。搜尋引擎面對這類 URL 时,判断逻辑和用戶並不完全一样:用戶点進去只是“再看一屏”,而抓取一個分頁 URL 要占用一次抓取机會。
所以分頁收錄的核心問题不是“能不能收”,而是把有限的索引位置和抓取配額留给谁。
三種常见的分頁實現
1. 传统連結分頁:/list?page=2
每頁獨立 URL,頁面上有可点击的“下一頁”連結,爬虫可以顺着走到底。這種结构最清晰,但也很容易产生几十上百個几乎同质的 URL。如果站点没有做任何限制,索引里可能塞满這類頁面。
2. 加载更多與無限滚動
用戶看到的是同一頁面不断追加内容,但很多實現其實是靠接口异步拉取,URL 始终不變。這样一来,第二屏之後的内容對搜尋引擎来说可能等同于不存在——除非你在頁面里提供了對應的可抓取連結。這類實現最常见的問题是:内容确實存在,却没有一個能被單獨發現的地址。
3. 视图全部:一頁展示所有條目
把 200 條记錄塞進一個頁面,看似省事。代價是單頁体积變大、加载變慢,而且頁面主题被稀释,很难與任何一個具体查询词對上。
判断该不该收錄,先問几個問题
- 這一頁有没有用戶會直接搜尋的獨立信息?如果只是排序不同,通常没有。
- 翻頁内容是否稳定?带排序、篩選參數的分頁每次组合都不同,容易产生大量低價值 URL。
- 列表里有没有指向詳情頁的連結?如果有,爬虫顺着第一頁就能發現大部分内容,後面的分頁對 URL 發現的贡献會递减。
- 站点的抓取配額够不够用?内容量小的站,让分頁進索引影响不大;内容量大的站,分頁會明顯挤压詳情頁的抓取机會。
如果决定不收錄,可以怎么做
- 保留可抓取:不要用 robots.txt 直接封掉分頁。封掉之後,爬虫無法通過列表頁繼續往下發現詳情頁,URL 發現路径會断在這里。
- 只限制收錄:在第 2 頁及之後加 noindex,让頁面可以抓、可以传递連結關系,但不進索引。
- 收敛參數:把排序、每頁條數這類不影响内容的參數统一到預設值,或让它們不生成獨立 URL。
- 给“查看全部”一個規范指向:如果确實需要聚合视图,用 canonical 指回主列表頁,而不是让它和分頁互相竞争。
两個常被忽略的细节
一是入口連結別只指向第 1 頁。如果所有導航都落在第一頁,後面的分頁即使被抓,也拿不到多少内部信号。二是分頁标题不要千篇一律。很多站点第 2 頁的标题還是“全部产品”,和第一頁完全重复,這類重复本身就是索引取舍时的减分項。
分頁不是必须全部收錄,也不是必须全部屏蔽。真正要回答的是:這一頁被收錄之後,能不能带来任何獨立的搜尋價值;如果不能,就让它可以被抓取、但不必進索引。
最後可以定期回到搜尋控制台或日誌里看一眼:抓取請求里分頁 URL 占了多少比例。如果占比明顯高于詳情頁,又没有带来對應的流量,那多半是该調整的时候了。