網站收錄

列表頁、聚合頁與分頁:哪些该進索引,哪些只需被蜘蛛抓取

分類頁、标簽頁、站内搜尋结果頁和分頁在數量上常超過正文頁,它們该不该進索引经常被忽略。本文把抓取與收錄拆開看,给出頁面归類、判断标准、處理手法和上线後的自查顺序,帮助站点减少索引里的低價值地址。

網站收錄

列表頁、聚合頁與分頁:哪些该進索引,哪些只需被蜘蛛抓取

分類列表頁、标簽聚合頁、站内搜尋结果頁、篩選參數頁——這類頁面在數量上往往遠超正文頁。它們承担着站内連結通道的作用,蜘蛛大部分時間也花在這些頁面上。但它們到底该不该進索引,很多站点没有明确答案,结果就是索引里堆了一大批低價值地址。

先把抓取和收錄拆開看

蜘蛛抓取一個頁面,目的是發現里面的連結、了解站点结构;而收錄進索引,意味着這個地址有机會作為一個獨立结果被展示。两件事的目标不同,所以一個頁面完全可以是「值得抓,但不值得收錄」。

列表頁對抓取很有價值:新發布的文章靠它被蜘蛛發現,站点层級也靠它串起来。但如果用戶搜某個词时,這個列表頁给不出比正文頁更有用的信息,把它放進索引只會稀释站点整体质量。

常见的几類頁面怎么归類

通常建议保留在索引里

  • 稳定的栏目頁、分類頁:主题明确,由編輯维護,長期存在。
  • 人工篩選的专题聚合頁:數量有限,每頁有獨立主题和說明文字。
  • 分頁的第一頁,也就是列表主入口,通常就是分類頁本身。

通常不建议收錄,但可以放行抓取

  • 站内搜尋结果頁:内容随查询變化,重复度高,還可能被外部批量构造地址。
  • 纯排序、篩選參數頁:同一批内容換顺序,主副本已经存在。
  • 自動生成的标簽頁:只有几個标题堆在一起,缺乏可讀内容。
  • 分頁的第二頁之後:作為爬取通道保留,不必單獨進索引。

判断一個頁面值不值得收錄

拿不准的时候,可以按下面几個問题過一遍:

  1. 能不能用一句话说清這頁的主题?说不清的大概率不需要收錄。
  2. 用戶會不會拿這個主题去搜?如果對應的需求已经有正文頁承接,就没必要再放一個列表頁進来。
  3. 它和站内另一個頁面有多少内容重复?重复比例高时,让其中一個作主副本。
  4. 去掉這個頁面,站内連結會不會断?會断說明它需要保留可抓取,而不是被屏蔽。
  5. 内容會随時間大幅變化吗?搜尋结果頁、促销聚合頁属于這一類。

几種處理方式和容易踩的坑

不希望頁面進索引,最直接的是在頁面上加 noindex。要注意两点:一是 noindex 需要蜘蛛能抓到頁面才生效;二是如果頁面本身有外部連結指向,被索引的概率會更高,處理要更主動一些。如果想让蜘蛛繼續顺着頁面里的連結走,可以配合 follow,让連結通道保留下来。

用 robots.txt 直接屏蔽則要谨慎:屏蔽之後蜘蛛看不到頁面上的 noindex 指令,如果這個地址被外站大量引用,它仍可能以缺少描述的形式留在索引里。屏蔽同时也會切断頁面内部的連結通道,影响新頁面的發現速度。

分頁處理上,比較常见的做法是主入口正常收錄,後續分頁保持可抓取,不額外追求收錄。canonical 指向自身即可,不要為了省事把所有分頁都指向第一頁,那會让蜘蛛誤判内容归属。

判断标准可以简化成一句:對用戶有獨立價值、内容稳定的頁面進索引;只服務于爬取和跳轉的頁面,放行抓取但不追求收錄。

調整之後的自查顺序

  1. 用 site: 指令看這類地址還在不在索引里,粗略掌握規模。
  2. 查服務器日誌,確認列表頁仍被正常抓取,連結通道没有断。
  3. 看被改動的頁面是否還在承接流量,避免誤伤原本有展示的聚合頁。
  4. 观察一批正文頁的發現速度,確認抓取通道没有被削弱。
  5. 過几周再复盘一次索引數量與展示資料的變化。

列表頁和聚合頁的處理没有统一答案,關键是別把它們当成顺手一起收錄的副产品。先明确每個頁面在站点里扮演什么角色,再决定它是抓取通道還是索引里的一個结果,後續調整會清晰很多。