网站收录

哪些页面值得进索引:按页面类型做收录取舍

收录数量不是越多越好。这篇文章把站点页面分成首页、栏目页、详情页、标签聚合页、筛选排序页和功能辅助页几类,给出统一的判断标准,说明每一类该保留收录还是用 noindex 挡在索引之外,并附上一份可以直接照做的自查顺序。

网站收录

哪些页面值得进索引:按页面类型做收录取舍

收录数量本身不是目标。一个页面进索引要有意义,前提是它有机会独立承接某个搜索需求。如果它只是流程中的一环,或者内容和其他页面高度重合,进索引往往只是给站点多添一条重复记录,也会分散抓取和评估的注意力。所以做收录管理,第一步不是“怎么让更多页面被收录”,而是给页面分类,想清楚每一类各自该处于什么状态。

把站点页面分成几类

  • 首页:承载品牌与整体导航,通常必须收录。
  • 栏目页 / 分类页:一个主题下的入口,是否收录取决于该栏目本身有没有稳定需求。
  • 内容详情页:文章、商品、词条等,是收录主体。
  • 标签页 / 聚合页:由规则拼出来的列表,价值取决于它是否提供了列表之外的信息。
  • 筛选、排序、站内搜索结果页:多由参数组合生成,容易产出大量近似 URL。
  • 功能与辅助页:登录、购物车、感谢页、隐私声明等,一般不需要出现在索引里。

判断标准:能不能独立满足一个需求

同一套标准可以套到任何页面上,问三个问题:

  1. 有人会直接搜这个页面的主题吗?
  2. 这个页面的内容,是否已经完整地存在于另一个页面里?
  3. 页面上有没有足够、且与主题一致的正文本信息?

第一个问题是需求,第二个是重复度,第三个是页面质量。三个答案都偏向正面,就值得收录;有一个明显为否,就要考虑把它挡在索引之外。

各类页面的常规处理

首页和核心栏目页

保持可抓取、可索引,标题和描述写清楚。栏目页如果内容量太少,只有几个链接、没有介绍文字,它和详情页的关系就变成了纯导航,可以先用内链和描述把它养起来,再考虑收录。

内容详情页

收录主体。要保证正文在 HTML 里就能读到,不要只靠 JS 渲染;同时确认每篇内容有唯一的主版本 URL,别让同一篇内容以多个路径出现在索引里。

标签页与聚合页

这类页面争议最大。判断点在于:它是不是只是把已有链接重新排了一遍?如果标签页有独立的说明文字、清晰的筛选逻辑,并且能覆盖一个详情页覆盖不到的需求,可以保留收录;如果只是机械罗列,加 noindex 更稳妥。另外别把标签页做得比详情页还多,容易造成入口稀释。

筛选、排序和站内搜索页

默认不要索引。排序参数、价格区间、颜色筛选这些组合出来的 URL 数量是指数级的,内容彼此又高度近似。做法上,可以在模板层面统一加 noindex,或者用 robots.txt 屏蔽参数路径。要留意的是一旦某个 URL 已经被抓取并被索引,再上 robots.txt 并不能把它从索引中移除,需要靠 noindex 或 404、410 来推动下线。

功能与辅助页

登录、注册、购物车、订单确认、站内搜索、隐私政策这类页面,对搜索用户没有独立价值。统一 noindex 处理,同时不要让它们出现在站点地图和主导航里。

判断一个页面该不该收录,问的是“它作为一条搜索结果是否合格”,而不是“它是不是我站点的一部分”。

落地时可以用的手段

  • noindex:让页面可抓取但不进索引,适合还没被大量抓取的页面。
  • robots.txt:减少抓取,但不能代替下线,也不能阻止已收录页面继续出现。
  • canonical:多个 URL 指向同一内容时,用来指定主版本。
  • 内链与站点地图:决定哪些页面被优先发现,间接影响收录顺序。

自查顺序

  1. 用站点地图或服务器日志导出全站 URL 列表,按上面的分类打标。
  2. 抽样查询一批 URL,看实际被索引的是哪几类页面。
  3. 对比“希望被收录”和“实际被收录”两份清单,找出多出来的部分。
  4. 对多出来的部分,先判断是模板问题还是内容问题,再决定用 noindex 还是 canonical。
  5. 改动后不必期待立刻生效,观察几周到一个月,看索引量的趋势而不是单日数字。

收录取舍是一件需要持续做的事。站点结构变了、内容量上来了、栏目改版了,原来的判断可能就不再适用。定期回头看一眼索引里都躺着哪些页面,比一次性做完所有设置更有用。