站点小的时候,每個頁面都是手寫的,收錄問题相對简單。站点變大以後,标簽頁、站内搜尋结果頁、日歷归档頁、作者聚合頁這類由系統自動生成的 URL,會很快超過人工頁面的數量。它們该不该让蜘蛛抓、该不该進索引,往往没人专门管,最後就成了收錄資料里的水分。
自動生成的頁面通常從哪来
- 标簽、分類、专题的聚合頁,以及它們的多級组合;
- 站内搜尋结果頁,尤其是带關鍵詞參數的那種;
- 按時間归档的日歷頁,某年某月甚至某天一個 URL;
- 作者、地区、價格区間等维度自動筛出来的列表頁。
這些頁面不是没有價值,問题在于其中多數是同一批内容的重复排列,真正獨有的信息很少。
它們為什么會拖累收錄表現
第一,内容稀薄且高度相似。同一篇文章可能同时出現在首頁、分類頁、标簽頁、归档頁和搜尋结果頁里,搜尋引擎要花力气判断哪一個是主体版本,判断不清楚时,就容易出現一批“已發現但未编入索引”的 URL。
第二,數量失控。标簽和搜尋參數一组合,URL 數量可以是内容量的几十倍,抓取配額被大量分给這些頁面,真正需要被發現的深度内容反而排到了後面。
第三,质量信号被摊薄。索引里長期堆着一批低價值 URL,整站的頁面质量判断會受影响,在優质内容本来就不多的中小站点上尤其明顯。
判断一個頁面该不该開放,問三個問题
- 有人會专门搜尋它吗?比如“某品牌全部产品”這類组合頁可能有人找,而“3 月 15 日的归档”基本没人搜。
- 它有没有獨有的内容?如果整頁内容都能在別處找到,獨立價值就很低。
- 它的數量可控吗?如果參數一換就能生成成千上萬個變体,就要谨慎。
三個問题都答不上来的頁面,預設不让它進索引,通常更稳妥。
几種常见處理方式,別用混
- noindex:希望頁面能被抓取、但不進索引时用它,寫在頁面 meta 里,蜘蛛必须抓到頁面才看得到。
- robots.txt 屏蔽:希望蜘蛛完全不要訪問时用它,比如站内搜尋结果頁。注意它表達的是“別来抓”,不等于“別收錄”。
- canonical:頁面本身有保留價值,只是變体太多,可以指向主体版本,让索引和權重集中過去。
- 内鏈控制:减少導航、列表、頁脚對這些自動頁面的大量指向,這是最直接、也最容易被忽略的一步。
经常被搞混的一点:如果一個頁面既被 robots.txt 屏蔽,又寫了 noindex,蜘蛛根本抓不到這個頁面,也就讀不到 noindex。结果是它可能仍然以“僅有 URL”的形式出現在索引里,既没有标题也没有摘要。要让它彻底不出現,應该先允许抓取,再用 noindex。
不一定要一刀切
标簽頁里如果有一批确實有人找、内容也够厚的,可以保留並让它們進索引,其余的合並或清掉。站内搜尋结果頁一般建议屏蔽抓取,但如果搜尋能稳定产出有检索價值的组合頁,也可以單獨留几個入口做人工维護。归档頁同理,只保留按年或按月的入口,日期級的 URL 直接挡掉。
做法不用追求一步到位。可以先從服務器日誌或搜尋控制台里看哪些自動頁面真的被抓了、被收錄了,再决定收哪些、放哪些。收窄一批低價值 URL 之後,通常要過几周時間,才能在抓取分布和索引狀態上看到變化。