网站收录

分页、标签、归档被大量收录:先按模板统计索引占比,再决定收敛

索引量上涨时,逐条屏蔽地址往往越删越多。更有效的顺序是先把已收录 URL 按页面模板归类,统计每类的索引占比与展现表现,再判断哪些模板值得收敛。本文给出归类、抽样、判断与收敛后的核对方法,并说明 robots、canonical、分页处理中常见的误区。

网站收录

分页、标签、归档被大量收录:先按模板统计索引占比,再决定收敛

站点的索引量突然涨了一截,很多人的第一反应是「坏 URL 太多,赶紧屏蔽」。但真到动手时,往往不知道该屏蔽哪一类:地址成千上万,逐条看根本看不过来。更稳的顺序是先把索引里的 URL 按页面模板分组,看每一类各占多少,再决定收敛谁。

为什么先按模板看,而不是先按单条 URL 看

索引里的地址是结果,模板才是原因。一条标签页被收录,意味着这套标签模板的生成规则、内链结构和可索引设置共同放行了它。只处理单条 URL,同类地址还会不断冒出来;按模板处理,才能一次覆盖一类。

第一步:把已收录的 URL 按生成规则归类

用 site 查询配合日志或站长平台的索引数据抽样,把地址归到下面这些常见类里:

  • 栏目与列表分页:/list/、/page/2、?paged=3
  • 标签、话题、作者等聚合页:/tag/、/author/、/topic/
  • 时间归档:/2024/05/、/archive/
  • 站内搜索结果:/search?q=
  • 排序与筛选参数:?sort=、?price=、?color=
  • 附件与下载类地址(如果混在页面索引里)

归类标准尽量落到「由哪套程序模板生成」,而不是靠肉眼看地址长得像不像。

第二步:算占比,并抽取样本看表现

  1. 给每一类记两个数:已收录数量、该模板在全站生成的地址总数。
  2. 算出索引占比,同时记录这类页面在站内获得的点击和展现量级。
  3. 抽查五到十条,看它是真的有独立内容,还是只有分页导航和同一批标题。

占比高不等于有问题。占比高、几乎没有独立内容、也拿不到展现,才需要动手。

判断标准可以简单一点:这个地址单独拿出来,除了导航和重复的标题列表,还剩多少只有它才有的信息。剩得越少,越倾向收敛。

第三步:按优先级收敛,而不是一刀切

优先处理

  • 站内搜索结果、多参数组合筛选、没有内容的空标签页,通常直接设为不可索引最省事。
  • 翻页很深的列表页,保留前几页作为抓取通路,更深的做收敛或折叠。

谨慎处理

  • 分页全部 noindex 会切断深层内容被发现的路径,蜘蛛进不去,新内容也更难被抓到。
  • 标签页如果有编辑维护、确实能聚起一批相关内容,可以保留,但要控制生成量。

几个容易踩的坑

  • robots.txt 只是不让抓,不等于移出索引,已收录的地址可能还会挂一段时间。
  • 把大量模板页 canonical 指到首页,会让这一类的信号互相打架,之后核对时更难判断谁是代表地址。
  • 只改配置不看日志,很难确认释放出来的抓取配额到底有没有转给正文页。

收敛之后怎么核对

调整后按两到四周为一个周期观察三件事:这类模板的索引数量有没有下降;抓取请求是否从这些地址转到正文页;正文页的收录有没有跟着变化。如果索引没动,先分清是还没重抓,还是抓了之后状态没更新,再决定要不要继续加码。

整个过程不必追求把索引数量压到某个数字,目标只是让索引里留下的是真正能被检索、也值得被检索的页面。