網站收錄

标簽頁和站内搜尋结果頁:自動生成的頁面该不该让蜘蛛抓取

标簽頁、站内搜尋结果頁、日歷归档頁這類由系統自動生成的 URL,往往在數量上超過人工頁面。它們内容稀薄、彼此高度相似,會占用抓取配額並影响整站质量判断。本文给出判断标准與几種常见處理方式,並說明 noindex 與 robots.txt 混用时容易踩的坑。

網站收錄

标簽頁和站内搜尋结果頁:自動生成的頁面该不该让蜘蛛抓取

站点小的时候,每個頁面都是手寫的,收錄問题相對简單。站点變大以後,标簽頁、站内搜尋结果頁、日歷归档頁、作者聚合頁這類由系統自動生成的 URL,會很快超過人工頁面的數量。它們该不该让蜘蛛抓、该不该進索引,往往没人专门管,最後就成了收錄資料里的水分。

自動生成的頁面通常從哪来

  • 标簽、分類、专题的聚合頁,以及它們的多級组合;
  • 站内搜尋结果頁,尤其是带關鍵詞參數的那種;
  • 按時間归档的日歷頁,某年某月甚至某天一個 URL;
  • 作者、地区、價格区間等维度自動筛出来的列表頁。

這些頁面不是没有價值,問题在于其中多數是同一批内容的重复排列,真正獨有的信息很少。

它們為什么會拖累收錄表現

第一,内容稀薄且高度相似。同一篇文章可能同时出現在首頁、分類頁、标簽頁、归档頁和搜尋结果頁里,搜尋引擎要花力气判断哪一個是主体版本,判断不清楚时,就容易出現一批“已發現但未编入索引”的 URL。

第二,數量失控。标簽和搜尋參數一组合,URL 數量可以是内容量的几十倍,抓取配額被大量分给這些頁面,真正需要被發現的深度内容反而排到了後面。

第三,质量信号被摊薄。索引里長期堆着一批低價值 URL,整站的頁面质量判断會受影响,在優质内容本来就不多的中小站点上尤其明顯。

判断一個頁面该不该開放,問三個問题

  1. 有人會专门搜尋它吗?比如“某品牌全部产品”這類组合頁可能有人找,而“3 月 15 日的归档”基本没人搜。
  2. 它有没有獨有的内容?如果整頁内容都能在別處找到,獨立價值就很低。
  3. 它的數量可控吗?如果參數一換就能生成成千上萬個變体,就要谨慎。

三個問题都答不上来的頁面,預設不让它進索引,通常更稳妥。

几種常见處理方式,別用混

  • noindex:希望頁面能被抓取、但不進索引时用它,寫在頁面 meta 里,蜘蛛必须抓到頁面才看得到。
  • robots.txt 屏蔽:希望蜘蛛完全不要訪問时用它,比如站内搜尋结果頁。注意它表達的是“別来抓”,不等于“別收錄”。
  • canonical:頁面本身有保留價值,只是變体太多,可以指向主体版本,让索引和權重集中過去。
  • 内鏈控制:减少導航、列表、頁脚對這些自動頁面的大量指向,這是最直接、也最容易被忽略的一步。
经常被搞混的一点:如果一個頁面既被 robots.txt 屏蔽,又寫了 noindex,蜘蛛根本抓不到這個頁面,也就讀不到 noindex。结果是它可能仍然以“僅有 URL”的形式出現在索引里,既没有标题也没有摘要。要让它彻底不出現,應该先允许抓取,再用 noindex。

不一定要一刀切

标簽頁里如果有一批确實有人找、内容也够厚的,可以保留並让它們進索引,其余的合並或清掉。站内搜尋结果頁一般建议屏蔽抓取,但如果搜尋能稳定产出有检索價值的组合頁,也可以單獨留几個入口做人工维護。归档頁同理,只保留按年或按月的入口,日期級的 URL 直接挡掉。

做法不用追求一步到位。可以先從服務器日誌或搜尋控制台里看哪些自動頁面真的被抓了、被收錄了,再决定收哪些、放哪些。收窄一批低價值 URL 之後,通常要過几周時間,才能在抓取分布和索引狀態上看到變化。