搜尋抓取

站内搜尋頁、标簽頁與归档頁:自動生成的 URL 是怎么被蜘蛛發現的

站内搜尋、标簽、归档這類自動生成的 URL,常在不知不觉中占掉一部分抓取量。本文從連結入口出發,說明它們如何被蜘蛛發現,以及按顺序收敛内鏈、限制抓取、收紧 Sitemap 的處理思路與驗證方法。

搜尋抓取

站内搜尋頁、标簽頁與归档頁:自動生成的 URL 是怎么被蜘蛛發現的

站内搜尋頁、标簽頁、归档頁這類自動生成的 URL,通常不是运营主動建立的,却经常在抓取日誌里占到不小比例。它們不直接影响用戶浏览,但會占用抓取资源,也可能挤掉真正需要被發現的頁面。

這些 URL 是怎么被蜘蛛發現的

蜘蛛只會沿着連結走,不會凭空知道地址。只要頁面上存在指向參數頁的連結,這個 URL 就進入了發現流程,哪怕它完全由程序生成、每次訪問内容都不一样。

  • 站内搜尋提交後的结果頁,常带 q、s、keyword 之類參數;
  • 标簽云、文章底部的标簽連結、热门關鍵詞模块;
  • 按年月生成的归档頁,以及日歷组件里的日期連結;
  • 列表頁的排序、篩選、翻頁组合出的參數序列。

如果這些連結出現在全站導航或頁脚,等于每個頁面都在向蜘蛛重复推荐同一批地址,抓取量會被長期分走一块。

常见源头與判断标准

站内搜尋结果頁

參數组合接近無限,同一個模板能生成成千上萬個地址,頁面内容還高度相似。除非搜尋頁本身有稳定的检索價值,通常不值得让蜘蛛深入。

标簽與聚合頁

标簽頁要看质量:围绕明确主题、有獨立描述和一定數量内容的标簽頁可以保留;只有几條連結、内容與列表頁重复的标簽頁,抓取收益很低。

归档與日歷頁

纯按時間生成的归档頁對用戶價值有限,對蜘蛛同样是重复内容。保留按月归档、去掉按日归档,是常见做法。

處理顺序:先收敛連結,再谈屏蔽

  1. 先看入口:確認這些連結從哪些模板、哪個模块輸出,改模板比事後屏蔽更省事。
  2. 收敛内鏈:把标簽云、日期連結從全站公共区域移除,只在相關頁面出現,减少重复推荐。
  3. 限制爬取:對确定無價值的路径用 robots.txt 屏蔽。注意屏蔽的是抓取,不等于 URL 不會被發現,有外鏈指向时它仍可能出現在队列里。
  4. 标记頁面:需要保留但不想收錄的頁面,可用 noindex 配合 follow,让連結關系繼續传递。
  5. 收紧 Sitemap:清單里只留需要被索引的地址,不要把參數頁批量寫進去,否則等于主動扩大抓取面。
  6. 观察日誌:處理後再看抓取分布,確認參數頁比例是否下降,並检查是否誤伤了正常頁面。
屏蔽和 noindex 解决的是要不要抓、要不要收;内鏈结构决定的是蜘蛛會不會走到這里。前者是补救,後者更接近根源。

驗證效果时看什么

  • 參數頁在總抓取量中的占比是否下降;
  • 被屏蔽路径是否仍有大量訪問,返回碼是什么;
  • 核心栏目頁與詳情頁的抓取次數有没有因此上升;
  • 日誌里是否出現新的、意料之外的參數组合。

這些頁面本身没有错,問题往往出在數量和入口位置。把来源控制住,比事後逐條屏蔽更省力,也更稳定。