搜尋抓取

标簽頁與聚合頁的抓取取舍:放行标准與收口方式

站内标簽頁、聚合頁和篩選列表會随内容增長大量生成,蜘蛛很容易一路走進近似頁面。本文给出判断這類頁面是否值得抓取的三個問题,分別說明放行與收口的做法,對比 robots.txt 屏蔽與頁面級 noindex 的差异,並整理分頁、内鏈入口與上线後日誌复盘的检查顺序。

搜尋抓取

标簽頁與聚合頁的抓取取舍:放行标准與收口方式

站点規模一上来,标簽頁、聚合頁、篩選列表這類由模板自動生成的地址會成倍增長。它們内容高度相似,却常常挂着站内入口,蜘蛛很容易一路走進去,把時間花在近似頁面上。這篇聊的是怎么判断哪些该让蜘蛛繼續走,哪些该在入口處收住。

先判断:這類頁面有没有獨立價值

不要按頁面類型一刀切,按它實际提供的信息判断。可以問三個問题:

  • 有没有獨立内容:除了列表本身,是否有說明文字、篩選逻辑带来的差异化结果?
  • 有没有稳定需求:這個组合词是否真有人會搜,還是只是站内導航的副产品?
  • 數量是否可控:是可枚举的几十個,還是會随内容增長無限膨胀?

三個問题里有两個答“否”,基本可以归到需要收口的一侧。

该放行的:數量有限、内容有增量的聚合頁

核心栏目下的标簽頁、主题聚合頁,如果每個都有少量獨立描述,總數也能控制住,通常值得保留抓取。做法上注意几点:

  1. 入口放在栏目頁或相關文章底部,位置固定,不要藏在二級折叠里;
  2. 每個聚合頁给出简短但不重复的說明,避免整頁只有标题堆叠;
  3. 分頁保留可抓取的翻頁連結,不要只靠“加载更多”按钮;
  4. 同一组篩選结果只保留一個可索引地址,其余參數组合做規范化處理。

该收口的:無增量、组合爆炸的列表

篩選、排序、站内搜尋结果属于典型。它們的共同点是组合數量巨大、單頁價值低。收口方式主要有两種,別混用:

  • robots.txt 屏蔽:适合完全不需要被抓取的路径,比如站内搜尋结果、會话類參數。注意被屏蔽後蜘蛛看不到頁面上的 noindex,日後如果解除屏蔽,歷史地址可能被重新抓取。
  • 頁面級 noindex:适合還想让蜘蛛沿連結繼續走、但不想让頁面進入索引的情况。代價是蜘蛛仍會抓取,會占用一部分抓取量。
常见的组合失誤是“内鏈照留 + robots 屏蔽”:連結還挂在頁面上,蜘蛛反复發現却抓不了,日誌里堆出一批無意义记錄,連結本身也难以起到传递作用。

分頁與“查看全部”怎么處理

列表頁的分頁建议保留真實連結,逐頁可達;“查看全部”如果會让單頁体积過大,或者内容與分頁重复,就只做前端交互,不给獨立地址。已经生成過的查看全部地址,用 noindex 或 301 收敛到第一頁。

内鏈上要不要放這些入口

判断标准不是“能不能放”,而是“放了之後蜘蛛會不會走偏”。可以按這個顺序調整:

  • 有價值的聚合頁:從栏目頁和正文相關位置给入口;
  • 價值一般的:只從栏目頁给一個入口,不進入正文区;
  • 無價值的:不给内鏈,同时用 noindex 或 robots 處理。

上线後的复盘

調整完,看一段時間服務器日誌:這些路径的抓取次數是否下降,被抓取的有效内容頁是否增加,有没有冒出大量 403 或 404。如果抓取量没有變化,先查是不是還有別的入口在放行,比如移動端模板、RSS 或舊版頁面。

這類工作没有一劳永逸的答案,内容结构一變,之前的判断可能就失效了,定期回看比一次设定更實际。