站点做大之後,最容易失控的往往不是正文,而是那些由模板自動生成的頁面:列表分頁、标簽聚合、站内搜尋结果。它們共同的特点是數量随内容增長而增長,頁面之間高度相似。如果全部放開让蜘蛛抓,抓取配額會被大量重复地址消耗;如果一刀切全部屏蔽,又可能顺手砍掉真正有價值的入口。
分頁:它是路,不完全是内容
分頁通常出現在栏目列表、文章归档這類位置。它的價值主要在導航:蜘蛛顺着第一頁到第二頁、第三頁,才能摸到更早發布的詳情頁。所以分頁一般建议保留可抓取,分頁連結用标准的 a 标簽輸出,而不是只靠点击事件或滚動加载来切換。
需要注意的是,分頁頁面本身很难有獨立價值,也不太适合当成落地頁去经营。它更像是通道,通道要畅通,但不必在上面堆内容。
标簽頁:先看它是不是“有内容的聚合”
标簽頁大致分两種。一種是編輯手工挑選、围绕固定主题持續维護的聚合頁,這類頁面通常有自己的說明文字、有稳定的内容量,可以当作正常栏目頁對待。
另一種是系統根據文章标簽自動生成的頁面,作者随手打一個标簽就多出一個地址。這類頁面往往只有一两條内容,标题和描述高度雷同,數量還随發文不断增長。它們的處理原則是:能合並就合並,不能合並就限制索引,不要让它無限制繁殖下去。
站内搜尋结果頁:預設属于该挡住的那一類
站内搜尋頁的數量几乎是無穷的。用戶可以搜任何词,還能叠加篩選條件、翻頁、排序,每一種组合都可能生成一個新地址。
- 頁面内容由用戶查询词决定,站点很难控制质量;
- 同一批结果會因為參數不同而反复出現;
- 蜘蛛一旦顺着搜尋框爬進去,很容易陷入參數组合的循环。
常见做法是用 robots.txt 挡住搜尋路径的抓取,同时對已经被抓到的搜尋頁加 noindex。需要提醒的是,這两件事作用范围不同,挡住抓取並不等于地址會從索引里消失,具体還要看它有没有被別處連結引用。
判断留還是挡,先問四個問题
- 它有没有獨立内容?如果去掉列表本身,頁面没有任何自己的文字或說明,價值通常偏低。
- 用戶會不會主動搜它?有稳定搜尋需求的聚合頁值得保留;纯粹為了让蜘蛛有東西可爬而生成的,則不值得。
- 它和已有頁面重合多少?大量地址指向同一批内容时,索引還要額外做篩選,留下一個清晰版本更省事。
- 數量可控吗?十萬個自動标簽頁和十個手工栏目,管理成本完全不是一回事。
几種處理方式的适用范围
- 保留抓取、允许索引:适合有獨立說明、内容量稳定、确實有搜尋需求的聚合頁。
- 保留抓取、加 noindex:适合需要充当導航路径、但本身不值得進索引的分頁或過渡頁。
- robots.txt 挡住抓取:适合參數组合無穷、抓了也没有意义的地址,比如站内搜尋與多條件篩選。
- canonical 指向主版本:适合多條路径指向同一批内容的场景,注意被指向的頁面本身要可索引。
几個容易忽略的细节
第一,屏蔽之前先確認這些頁面没有被内鏈或導航引用。如果首頁還挂着指向被屏蔽地址的連結,蜘蛛會反复撞上死路。第二,處理方式要跟站点規模匹配:小站几十個标簽頁不必大動干戈,大站則需要從模板层面统一規則,而不是逐頁去改。第三,任何調整都要留出观察期,抓取和索引的變化通常不會当天就顯現出来。
這類頁面的核心問题不是“能不能被抓”,而是“值不值得占一個索引名額”。把數量控制住、把規則收敛到模板层,比事後逐個清理要省力得多。