很多站点在做收录检查时,习惯把所有URL放在一张表里,用同一个标准判断“该不该被索引”。结果往往是两种极端:一类页面明明只是入口或过渡页,却被要求必须收录;另一类真正承载搜索需求的内容页,因为与其它页面混在一起看,问题被平均掉了。收录策略如果能先按页面类型分组,判断会清楚很多。
统一标准为什么容易失效
不同类型页面的存在目的本来就不同。详情页解决的是“用户想了解具体事物”的需求,列表页解决的是“浏览与筛选”的需求,而登录页、购物车、结果页、参数页更多是功能路径上的一环,用户从搜索结果直接进入的意义并不大。
如果对这些页面使用同一套“必须有内容、必须被收录”的标准,要么会为了凑内容给功能页硬加文字,要么会因为功能页没收录而误判整站健康度。
先把站内URL分成三类
核心页
通常是与主要搜索需求直接对应的页面,例如商品详情、文章详情、主要分类页。它们的判断重点是内容是否完整、是否有独立存在的必要、是否与其它页面高度重复。
辅助页
承担导航和分发作用,例如次级分类、标签页、系列页。它们的价值取决于是否提供了独特的浏览路径。如果只是堆积相似条目,与主分类高度重叠,被索引的意义就有限。
边界页
包括筛选结果、排序参数、站内搜索结果、分页、会话类URL等。这类页面的数量往往最大,也最容易出问题:参数组合产生的重复版本,会把抓取预算和索引位占用掉。
分组之后,每类看什么指标
- 核心页:看是否被索引、索引的版本是否为规范URL、内容是否与主体一致。
- 辅助页:看是否有独立入口、是否与上级页面内容重叠、是否存在大量近似页面互相稀释。
- 边界页:看参数是否可枚举、是否被robots或canonical约束、是否真的有必要让搜索引擎抓取。
这里要区分抓取与收录:被抓取不代表会被索引,边界页被抓取是正常的,关键是不让它生成大量无意义的索引版本。
落地步骤
- 从站点地图、日志和站内链接中导出一份URL清单,尽量覆盖真实存在的地址。
- 给每条URL打上类型标签,先粗分三类即可,不必追求绝对准确。
- 为每一类写下索引预期:希望被索引、可有可无、明确不希望被索引。
- 按预期检查现状,把差异归类:是没被发现、被发现但没索引,还是索引了错误的版本。
- 定期复核,尤其是站点改版、增加新模块之后,页面类型可能会发生变化。
几个容易忽略的点
边界页不是洪水猛兽。有些筛选组合确实有搜索需求,用一个可索引的固定URL承载它,比让它以无数组参数形式存在更清晰。关键是做选择,而不是全部放开或全部屏蔽。
收录不是越多越好,也不是越少越干净。真正需要回答的是:这个页面在搜索结果里出现时,是否比站内其它页面更适合承接这个需求。
把页面分组之后,你会更容易看出问题出在哪一层:是入口没铺好导致没被发现,是重复版本太多导致代表URL不明确,还是页面本身内容不足。三种原因对应的处理方式完全不同,混在一起看,只会让收录问题一直悬着。