網站收錄

站内搜尋结果頁和标簽聚合頁:放開收錄還是挡住

站内搜尋頁、标簽頁和自動生成的聚合頁常常占據收錄量的大头,却缺少獨立價值。本文從抓取日誌出發,說明怎样判断這些 URL 该保留還是收敛,以及 robots.txt 屏蔽與 noindex 的区別和常见誤用。

網站收錄

站内搜尋结果頁和标簽聚合頁:放開收錄還是挡住

很多站点做收錄自查时,第一反應是看數量:收錄多了觉得是好事,收錄少了就急着找原因。但收錄量本身並不等于有效頁面量。站内搜尋结果頁、标簽聚合頁、按時間或條件自動生成的列表頁,往往占了收錄的大头,却几乎没有獨立價值。先把這類 URL 理清楚,比盯着總數更有意义。

這些批量生成的頁面從哪来

常见来源有几類,它們通常共用同一套模板,只是路径或參數不同:

  • 站内搜尋结果頁:用戶搜一個词就生成一個 URL,词库有多大,潜在 URL 就有多少。
  • 标簽頁、作者頁、专题聚合頁:由内容属性自動匯總,條目多时可能有價值,條目少时就是空壳。
  • 排序、篩選、分頁參數:同一批内容被拆成多種组合。
  • 日歷归档、按年月归档的列表頁:早期博客系統自带,現在多數是歷史遗留。

判断标准:這個 URL 有没有獨立用途

不要用“是列表頁還是正文頁”来分類,而要看它能不能獨立满足一次訪問需求:

  • 有稳定检索需求的站内搜尋頁:比如用戶反复搜尋的少數關鍵詞,结果頁内容相對固定,可以考虑保留。
  • 主题明确的标簽頁:标簽下的條目足够多,且這些條目确實围绕同一主题,頁面有可讀的說明文字。
  • 人工维護的聚合頁:有編輯挑選、排序和描述,而不是纯粹按發布時間倒序拼出来。

相反,如果頁面只是把已有内容換個顺序再列一遍,标题和正文由模板拼成,没有增量信息,那它大概率只會稀释抓取资源。

具体怎么處理

  1. 先看日誌:確認蜘蛛是否在反复抓這些 URL,抓取频率是否挤占了正文頁的額度。没有資料支撑就先不要動手。
  2. 選擇正确的屏蔽手段:已经完全不想让它出現在索引里,用 noindex;只是想省抓取资源、仍希望連結被發現,用 robots.txt 屏蔽抓取。两者作用不同。
  3. 不要混用:同一批 URL 既在 robots.txt 里被禁止抓取,又指望 noindex 生效,结果是蜘蛛讀不到頁面上的 noindex,URL 仍可能以無摘要形式停留在索引里。
  4. 给保留的聚合頁加内容:补一段真實描述、控制條目數量、加上指向核心内容的連結,並让 canonical 明确指向自身,避免與正文頁互相竞争。
  5. 站内搜尋頁預設收紧:整体设為 noindex, follow,让連結繼續被跟踪;只對少數确有检索價值的查询放開。
處理顺序建议是:先確認抓取情况,再决定是挡抓取還是挡索引,最後才考虑是否需要清理已经存在的索引。反過来做,很容易誤伤正文頁的内鏈入口。

收尾後的观察点

調整之後不要只看總數變化。更值得關注的是:正文頁的抓取频次有没有上升,日誌里低價值 URL 的訪問占比有没有下降,站内搜尋頁是否還在以近似無限的组合被訪問。這些指标比收錄數字更能說明處理是否有效。索引調整本身需要時間,不必因為一两天没變化就反复改動規則。