很多站点收錄量看着不小,翻開来一看,大头是各種列表頁和翻頁地址:分類頁、标簽頁、归档頁、?page=2 一直排到 ?page=87。這些 URL 确實存在,也确實有内容,但對搜尋用戶的價值往往有限,還會占掉抓取配額和索引空間。分清哪些列表頁值得被收錄、哪些應该收住,是收錄管理里很基础的一步。
列表頁和詳情頁承担的角色不同
詳情頁回答的是“這個東西是什么”,列表頁回答的是“這一類里有哪些東西”。用戶搜一個具体問题时,通常落在詳情頁上;搜一個宽泛词时,列表頁才有机會出現。所以列表頁不是不能收錄,而是要有選擇地收錄。
值得让搜尋引擎收錄的列表頁,通常具备几個特征:主题稳定、有獨立的搜尋需求、内容會持續更新、能通過内鏈被用戶找到。反過来,纯粹為了導航而存在的中間层,比如按日期排序的归档、按字母分组的索引,價值就低很多。
翻頁 URL 是重复内容的重灾区
第 2 頁、第 3 頁的内容,往往是第 1 頁的延續,頁面标题也几乎一样。如果每一頁都被單獨收錄,索引里就會出現大量高度相似的頁面。常见的翻頁形式有三種,處理方式並不完全相同:
- 參數翻頁,如 ?page=2、?paged=2:最容易产生無限组合,也最容易被大量抓取。
- 路径翻頁,如 /page/2:结构清晰,但每一頁仍是獨立 URL。
- 加载更多或無限滚動:用戶看到的是同一頁,背後可能生成一批地址,需要先確認它會不會产生新的可抓取 URL。
判断该留還是该收住,先問三個問题
- 這一頁有没有獨立的搜尋需求?有人會专门搜“第 3 頁”吗?基本没有。
- 這一頁的内容和第一頁差別有多大?如果只是同一批條目的重新排列,差別就很小。
- 如果它不進索引,會不會影响用戶找到詳情頁?只要詳情頁有稳定的内鏈入口,翻頁不收錄通常不影响發現。
几種常见的處理方式
做法没有唯一答案,關键是整站保持一致,別让同一類頁面出現互相矛盾的信号。
- 保留抓取、不保留索引:用 noindex、允许 follow,让爬虫能顺着列表頁繼續發現詳情頁,同时不让列表頁自己進索引。注意這條路径成立的前提是這些連結没有被 robots.txt 挡住。
- 翻頁指向主列表頁:如果翻頁内容确實只是延續,可以让 canonical 指回主列表頁。但要先確認這符合實际内容關系,不要把所有分頁都强行指回首頁或某個無關頁面。
- 參數收口:能合並的參數尽量合並。排序、篩選這類只改變展示顺序的參數,可以让它不生成獨立可索引的地址。
- 限制翻頁深度:把過深的翻頁改成加载更多,而不是持續生成第 50 頁、第 51 頁這样的地址。
容易踩的几個坑
把整站列表頁一刀切地加上 noindex,往往會在几個月後才發現詳情頁的發現路径也變窄了。列表頁是爬虫發現新内容的主要入口之一,收得太狠會伤到自己。
- 用 robots.txt 阻止抓取翻頁 URL,同时又期待列表頁上的連結被跟進——這两件事本身就是矛盾的。
- 同一類頁面一半用 noindex、一半用 canonical,信号不统一,爬虫只能自己判断。
- 只盯着收錄數量,不看這些 URL 有没有带来實际訪問。收錄多不等于有價值。
可以這样落地
先把站点里所有列表型 URL 導出来,按類型分组:分類頁、标簽頁、归档頁、站内搜尋頁、翻頁。给每一组寫下“是否希望被收錄”的决定和理由,再對應到具体實現方式。上线一段時間後抽查一次,看看這些地址在索引里的實际狀態和当初的预期是否一致。列表頁的收錄策略不需要很复杂,但需要明确,並且長期保持一致。