网站收录

收录盘点先分两类:该收没收的,与不该收却收了的

收录问题其实分两类:该收没收与不该收却收了,处理方向正好相反。本文给出 URL 分类的判断标准,拆解缺收常卡在发现、抓取还是索引判断,并说明无价值页面该从入口还是页面级信号收口,附一份可复用的盘点顺序。

网站收录

收录盘点先分两类:该收没收的,与不该收却收了的

做收录盘点时最容易犯的一个错,是把收录数当成单一指标:涨了就觉得健康,跌了就急着找漏洞。实际上同一个站点里往往同时存在两种相反的收录问题——有些页面该被索引却迟迟没进,另一些页面本来不该出现在索引里却占着位置。这两类问题的处理方向完全不同,混在一起看,很容易越修越乱。

第一步:先把 URL 分成“该收”和“不该收”

在打开任何工具之前,先拉一份站点 URL 清单,按是否希望被索引打上标记。判断依据不是页面好不好看,而是它有没有独立价值、是否可能承接搜索需求、与其他页面是否高度相似。

  • 该收:核心内容页、有明确主题的栏目页、有独立信息量的详情页、必要的帮助与说明页。
  • 不该收:排序与追踪参数页、会话 ID、站内搜索结果页、筛选组合过细的页面、测试与临时目录、重复的打印页。

这份清单不必一次做到完美,但它决定了后面每一步该往哪个方向走。

该收却没收:先看卡在哪一步

一个页面从存在到进入索引,大体要经过发现、抓取、渲染、索引判断几道关。缺收时先定位卡点,再动手。

发现环节

  • 页面是否真的能从别处到达?只存在于 sitemap、没有任何内链指向的 URL,被发现的机会明显更少。
  • 内链层级是否太深?点击三四次还到不了的页面,抓取优先级通常靠后。
  • sitemap 是否包含且格式正确?提交了不等于被读取,日志里能看到抓取记录才算数。

抓取与渲染环节

  • 服务器返回是否稳定?大量 5xx、超时或频繁跳转会让抓取意愿下降。
  • 主要内容是否依赖脚本渲染?渲染失败时,抓到的可能只是空壳。
  • 是否被 robots 或防火墙误拦?先确认抓取没有被挡住。

索引判断环节

  • canonical 是否指向了别的 URL?指向冲突时,搜索引擎可能只保留另一个版本。
  • 页面是否与其他页面高度相似?模板化内容和转载会削弱独立收录的理由。
  • 内容量是否过薄?只有标题加一两句话的页面,通常难以进入索引。

不该收却收了:从入口与信号两头收口

这类问题不一定要把页面删掉,很多时候只需要让搜索引擎不再把它当作独立页面。

  • 页面级:确实无价值的页面用 noindex 处理,同时保留可抓取状态,否则这个信号可能读不到。
  • 入口级:sitemap 只放希望被索引的 URL;内链不要指向无意义页面;分页与筛选链接做好收敛。
  • 信号级:重复或近似页面用 canonical 指定主版本,并保证站内链接指向主版本而不是副本。
禁止抓取不等于禁止索引。只靠 robots 挡住的 URL,仍可能因外部链接而进入索引,页面抓不到,修正信号也就传递不进去。

常规盘点可以按这个顺序走

  1. 导出站点 URL 清单,标记该收与不该收。
  2. 用服务器日志确认抓取覆盖:哪些 URL 被访问过,频率如何。
  3. 对照实际索引状态,把缺收的按发现、抓取、索引三类归因。
  4. 对不该收的页面,先处理入口,再处理页面级信号。
  5. 改动后留一段观察期,按批查看变化,不要一天一个结论。

收录是结果,不是目标

把收录数当成 KPI,常见的后果是不断放宽入口,把没有承接能力的页面也推进索引,短期数字好看,长期反而稀释了整站的质量判断。更稳的做法是守住“该收的收进来、不该收的挡在外”,用批次和时间窗口看趋势,而不是盯某一天的绝对值。