很多站点把收录量当成成绩,但搜索索引不是仓库,它要筛选。蜘蛛抓取是发现和读取,收录是索引系统判断这个页面是否值得保留。一个 URL 该不该留在索引里,可以先问三个问题。
问题一:这个 URL 有没有独立的搜索需求
如果用户不会单独搜它,它可能只是路径、筛选结果或功能入口。比如颜色筛选、排序参数、会话 ID、打印页,这些 URL 最好用 canonical 或 robots noindex 处理,不要指望靠收录获得流量。
但参数页不全是没用的。有些筛选组合本身有稳定搜索量,比如某个品类加颜色或场景,用户会直接搜。判断的关键不是“带没带参数”,而是它有没有独立搜索需求,以及内容是否真的不同。
- 有稳定搜索词对应,且不是主页面已经覆盖的同义词
- 内容随参数变化有明显不同,不是只换了排序
- 不是用户注册、购物车、打印页等功能页
- 不依赖会话或临时参数才能显示
问题二:内容是不是完整独立
索引系统会评估页面主体内容、原创度,以及和站内其他页面的关系。如果页面只是聚合摘要、复制其他页面,或者由模板拼出很少文字,它可能被归为重复或薄页面。不是绝对不能收录,但优先级通常较低。
常见情况
- 列表页只显示标题和一句摘要,没有独立说明,容易和详情页重叠
- 标签页和分类页内容高度重合,只差筛选条件
- 同一内容有多个 URL 版本,比如带参数、带尾斜杠、大小写不同
- 空结果页、错误提示页、站内搜索结果页
处理方式不是一刀切删除。可以把多个相似 URL 合并到主版本,也可以保留页面但用 noindex 标记,或者补充独立内容后再考虑提交。
问题三:能否稳定访问并指向规范版本
即使内容好,如果页面经常超时、返回 5xx、需要登录,或者被 robots.txt 挡住,索引系统也无法稳定保留。URL 规范同样重要:同一页面最好只有一个主版本,其他版本通过 301 或 canonical 指向它。
抓取是收录的前提,但抓取成功不等于一定收录;收录后如果页面长期不可访问,也可能被移除。
检查点包括:状态码是否 200,主内容是否在 HTML 或渲染后可见,canonical 是否自指或指向正确版本,内链是否使用规范 URL,robots 是否允许抓取。
三个问题之后,怎么处理
根据答案决定下一步,而不是先大批量提交再事后清理:
- 三个都过关:保留在索引,继续维护内容和内链。
- 有独立需求但内容薄:补充信息,先观察,不急着提交大量 URL。
- 无独立需求、内容重复:合并到主页面,或设置 noindex。
- 已下线、不再需要:返回 410 或 301 到相关页面,而不是留 200 空页。
- 暂时不想收录但不删除:用 noindex,注意 noindex 页面仍可能被抓取。
收录不是越多越好。把不值得单独存在的 URL 清理掉,能让抓取更集中在有价值页面上,也让索引里的页面更接近用户真正需要的结果。定期用索引报告和 site 查询抽查,比一次性大规模提交更稳妥。