分類列表頁、标簽聚合頁、站内搜尋结果頁、篩選參數頁——這類頁面在數量上往往遠超正文頁。它們承担着站内連結通道的作用,蜘蛛大部分時間也花在這些頁面上。但它們到底该不该進索引,很多站点没有明确答案,结果就是索引里堆了一大批低價值地址。
先把抓取和收錄拆開看
蜘蛛抓取一個頁面,目的是發現里面的連結、了解站点结构;而收錄進索引,意味着這個地址有机會作為一個獨立结果被展示。两件事的目标不同,所以一個頁面完全可以是「值得抓,但不值得收錄」。
列表頁對抓取很有價值:新發布的文章靠它被蜘蛛發現,站点层級也靠它串起来。但如果用戶搜某個词时,這個列表頁给不出比正文頁更有用的信息,把它放進索引只會稀释站点整体质量。
常见的几類頁面怎么归類
通常建议保留在索引里
- 稳定的栏目頁、分類頁:主题明确,由編輯维護,長期存在。
- 人工篩選的专题聚合頁:數量有限,每頁有獨立主题和說明文字。
- 分頁的第一頁,也就是列表主入口,通常就是分類頁本身。
通常不建议收錄,但可以放行抓取
- 站内搜尋结果頁:内容随查询變化,重复度高,還可能被外部批量构造地址。
- 纯排序、篩選參數頁:同一批内容換顺序,主副本已经存在。
- 自動生成的标簽頁:只有几個标题堆在一起,缺乏可讀内容。
- 分頁的第二頁之後:作為爬取通道保留,不必單獨進索引。
判断一個頁面值不值得收錄
拿不准的时候,可以按下面几個問题過一遍:
- 能不能用一句话说清這頁的主题?说不清的大概率不需要收錄。
- 用戶會不會拿這個主题去搜?如果對應的需求已经有正文頁承接,就没必要再放一個列表頁進来。
- 它和站内另一個頁面有多少内容重复?重复比例高时,让其中一個作主副本。
- 去掉這個頁面,站内連結會不會断?會断說明它需要保留可抓取,而不是被屏蔽。
- 内容會随時間大幅變化吗?搜尋结果頁、促销聚合頁属于這一類。
几種處理方式和容易踩的坑
不希望頁面進索引,最直接的是在頁面上加 noindex。要注意两点:一是 noindex 需要蜘蛛能抓到頁面才生效;二是如果頁面本身有外部連結指向,被索引的概率會更高,處理要更主動一些。如果想让蜘蛛繼續顺着頁面里的連結走,可以配合 follow,让連結通道保留下来。
用 robots.txt 直接屏蔽則要谨慎:屏蔽之後蜘蛛看不到頁面上的 noindex 指令,如果這個地址被外站大量引用,它仍可能以缺少描述的形式留在索引里。屏蔽同时也會切断頁面内部的連結通道,影响新頁面的發現速度。
分頁處理上,比較常见的做法是主入口正常收錄,後續分頁保持可抓取,不額外追求收錄。canonical 指向自身即可,不要為了省事把所有分頁都指向第一頁,那會让蜘蛛誤判内容归属。
判断标准可以简化成一句:對用戶有獨立價值、内容稳定的頁面進索引;只服務于爬取和跳轉的頁面,放行抓取但不追求收錄。
調整之後的自查顺序
- 用 site: 指令看這類地址還在不在索引里,粗略掌握規模。
- 查服務器日誌,確認列表頁仍被正常抓取,連結通道没有断。
- 看被改動的頁面是否還在承接流量,避免誤伤原本有展示的聚合頁。
- 观察一批正文頁的發現速度,確認抓取通道没有被削弱。
- 過几周再复盘一次索引數量與展示資料的變化。
列表頁和聚合頁的處理没有统一答案,關键是別把它們当成顺手一起收錄的副产品。先明确每個頁面在站点里扮演什么角色,再决定它是抓取通道還是索引里的一個结果,後續調整會清晰很多。