做站点运营时,很容易把“收录”当成一个越多越好的指标。实际上,索引容量和抓取资源都有限,把不该收录的页面大量送进索引,反而会稀释真正重要页面的信号。更实际的做法是:先给页面分角色,再决定去留。抓取与收录是两件事,蜘蛛来过、URL 被发现,都不等于会进入索引;而进入索引之后,页面是否该留下,需要单独判断。
一、先按页面角色分层
同一个站点里,页面承担的任务不同,收录策略也不该一样。可以用下面几类先做粗分:
- 核心内容页:产品、服务、主要栏目、支柱文章。目标是稳定留在索引里,并参与排名。
- 长尾内容页:文章、问答、案例、地区页。只要内容独立、有搜索需求,就值得收录,不要因为流量低就急着 noindex。
- 功能页:登录、注册、购物车、个人中心、站内搜索结果。通常没有独立搜索价值,不该占用索引名额。
- 过滤与排序页:颜色、价格、排序、分页参数组合。容易产生大量近似重复,需要控制。
- 历史与归档页:过期活动、旧版本、测试页。按是否仍有访问价值决定保留、合并还是清理。
二、核心页和长尾页:尽量保证 URL 唯一
这些页面要进索引,前提是地址规范。同一篇内容只保留一个主 URL,其余写法用 301 指向主版本。常见的不规范包括大小写混用、带与不带尾斜杠、参数顺序不一致、http 与 https 并存。canonical 可以辅助表达主版本,但它不是万能的,能通过服务器和链接直接统一时,优先做直接统一。
同时检查内链。一个页面如果只能从站点地图里找到,蜘蛛可能很久才来一次。把重要页面放进导航、栏目页或相关推荐,比反复提交更实际。
三、功能页与过滤页:多数情况下不该进索引
站内搜索结果页、排序参数页、会话 ID 页面,通常不建议收录。处理方法要分情况:
- 如果页面完全不需要被抓取,可以在 robots.txt 中屏蔽,减少抓取浪费。
- 如果希望蜘蛛看到页面但不索引,可以使用 noindex,但注意不要和 robots.txt 屏蔽同时用,否则 noindex 可能永远读不到。
- 过滤参数如果对用户有价值,可以保留一个主筛选路径,其余参数规范到主路径,而不是全部 noindex。
四、重复内容先合并,再谈收录取舍
重复内容大致分三层:完全重复、近似重复、模板重复。完全重复的页面应合并并 301;近似重复可以用 canonical 指向主版本,同时逐步收敛内链;模板重复往往来自分类页、标签页和分页,需要改模板或只保留有独立价值的入口。没有处理重复之前,单独讨论某个 URL 该不该收录,往往会出现反复:今天被收录,明天又被替换。
五、判断一个 URL 去留的检查顺序
- 它是否有独立的搜索价值?没有的话,优先考虑功能页或过滤页的处理方式。
- 它是否有唯一的规范 URL?没有就先统一地址,而不是急着提交收录。
- 它是否可被抓取?robots、登录墙、大量 JS 都可能让页面无法被正常读取。
- 它是否与已有页面高度重复?重复的先合并或 canonical,再决定是否保留。
- 进入索引后是否有人维护?长期无人更新、内容过期的页面,要有退出机制。
- 最后才是决定:保留在索引、合并、301、noindex,还是删除。
六、抓取与收录的区别,决定了你该做什么
蜘蛛池、外链、站点地图能帮助 URL 被发现和抓取,但索引是否接纳,取决于页面质量、重复程度和站点整体结构。被大量抓取却没有收录的页面,通常不是蜘蛛没来,而是页面本身不具备独立索引价值。把抓取资源留给核心页和长尾页,把功能页、过滤页和重复页挡在索引之外,索引结构会更干净,后续排查收录问题也更容易定位。
收录不是把所有 URL 都塞进索引,而是让该出现的页面稳定出现,不该出现的页面不占位置。