收录数量本身不是目标。一个页面进索引要有意义,前提是它有机会独立承接某个搜索需求。如果它只是流程中的一环,或者内容和其他页面高度重合,进索引往往只是给站点多添一条重复记录,也会分散抓取和评估的注意力。所以做收录管理,第一步不是“怎么让更多页面被收录”,而是给页面分类,想清楚每一类各自该处于什么状态。
把站点页面分成几类
- 首页:承载品牌与整体导航,通常必须收录。
- 栏目页 / 分类页:一个主题下的入口,是否收录取决于该栏目本身有没有稳定需求。
- 内容详情页:文章、商品、词条等,是收录主体。
- 标签页 / 聚合页:由规则拼出来的列表,价值取决于它是否提供了列表之外的信息。
- 筛选、排序、站内搜索结果页:多由参数组合生成,容易产出大量近似 URL。
- 功能与辅助页:登录、购物车、感谢页、隐私声明等,一般不需要出现在索引里。
判断标准:能不能独立满足一个需求
同一套标准可以套到任何页面上,问三个问题:
- 有人会直接搜这个页面的主题吗?
- 这个页面的内容,是否已经完整地存在于另一个页面里?
- 页面上有没有足够、且与主题一致的正文本信息?
第一个问题是需求,第二个是重复度,第三个是页面质量。三个答案都偏向正面,就值得收录;有一个明显为否,就要考虑把它挡在索引之外。
各类页面的常规处理
首页和核心栏目页
保持可抓取、可索引,标题和描述写清楚。栏目页如果内容量太少,只有几个链接、没有介绍文字,它和详情页的关系就变成了纯导航,可以先用内链和描述把它养起来,再考虑收录。
内容详情页
收录主体。要保证正文在 HTML 里就能读到,不要只靠 JS 渲染;同时确认每篇内容有唯一的主版本 URL,别让同一篇内容以多个路径出现在索引里。
标签页与聚合页
这类页面争议最大。判断点在于:它是不是只是把已有链接重新排了一遍?如果标签页有独立的说明文字、清晰的筛选逻辑,并且能覆盖一个详情页覆盖不到的需求,可以保留收录;如果只是机械罗列,加 noindex 更稳妥。另外别把标签页做得比详情页还多,容易造成入口稀释。
筛选、排序和站内搜索页
默认不要索引。排序参数、价格区间、颜色筛选这些组合出来的 URL 数量是指数级的,内容彼此又高度近似。做法上,可以在模板层面统一加 noindex,或者用 robots.txt 屏蔽参数路径。要留意的是一旦某个 URL 已经被抓取并被索引,再上 robots.txt 并不能把它从索引中移除,需要靠 noindex 或 404、410 来推动下线。
功能与辅助页
登录、注册、购物车、订单确认、站内搜索、隐私政策这类页面,对搜索用户没有独立价值。统一 noindex 处理,同时不要让它们出现在站点地图和主导航里。
判断一个页面该不该收录,问的是“它作为一条搜索结果是否合格”,而不是“它是不是我站点的一部分”。
落地时可以用的手段
- noindex:让页面可抓取但不进索引,适合还没被大量抓取的页面。
- robots.txt:减少抓取,但不能代替下线,也不能阻止已收录页面继续出现。
- canonical:多个 URL 指向同一内容时,用来指定主版本。
- 内链与站点地图:决定哪些页面被优先发现,间接影响收录顺序。
自查顺序
- 用站点地图或服务器日志导出全站 URL 列表,按上面的分类打标。
- 抽样查询一批 URL,看实际被索引的是哪几类页面。
- 对比“希望被收录”和“实际被收录”两份清单,找出多出来的部分。
- 对多出来的部分,先判断是模板问题还是内容问题,再决定用 noindex 还是 canonical。
- 改动后不必期待立刻生效,观察几周到一个月,看索引量的趋势而不是单日数字。
收录取舍是一件需要持续做的事。站点结构变了、内容量上来了、栏目改版了,原来的判断可能就不再适用。定期回头看一眼索引里都躺着哪些页面,比一次性做完所有设置更有用。