很多站点的收录问题并不是从被抓取那一刻才开始的,而是在页面设计阶段就已经埋下。同一个站点里,有的页面天生该进索引,有的页面进去只是占位置。与其等到索引膨胀了再回头收拾,不如在上线前就按页面类型定好收录策略。
先分清三种收录档位
把站内每一类页面往三个档位里放,判断会清晰很多。
- 必须被收录:有独立搜索需求、内容自成一体、用户会直接搜到它的页面。
- 可收可不收:有一定聚合价值,但和别的页面高度相似,收不收取决于站内是否缺这一类入口。
- 不该进索引:只服务于站内流程、内容重复,或者由参数组合爆炸产生的页面。
关键在于:这个判断要按模板来做,而不是按单条 URL。模板决定了成百上千个页面的命运。
常见页面类型的归属
内容页
文章、商品、问答这类主体内容页,通常属于必须收录的一档。前提是内容确实独立——同一篇内容出现在多个 URL 上时,要先收敛再谈收录。
栏目页与分类页
处在可收可不收与必须收录之间。如果分类页只有一列标题,价值接近导航;如果它带有筛选后的独立信息,比如价格区间、地区、规格,则值得收录。判断标准是:用户会不会为了这一类内容专门去搜。
标签页与作者页
标签数量少、每个标签下有足够内容时,可以留少量进索引;一旦标签由系统自动生成、动辄上千个且每个只挂着两三篇,通常更接近不该进索引那一档。
筛选、排序与追踪参数
这些 URL 本身不承载新内容,只是同一批内容的排列组合。默认不进索引,靠 canonical 标签或 robots meta 表达。
站内搜索结果页
属于典型的不该收录。它随查询词无限生成内容,既不稳定也没有独立价值。
附件与打印页
PDF、图片、打印版本本身不是问题,问题是有没有一个 HTML 页面承担了同样的信息。如果已经有,附件通常不需要单独去争索引位置。
判断一个页面该不该收,先问四个问题
- 有没有人会把它当作搜索的终点?
- 它有没有本站其他页面无法替代的内容?
- 它会不会长期稳定存在,还是随参数、库存、会话变化?
- 如果把它从索引里拿掉,用户的搜索结果会不会变差?
前两个问题答否,基本就可以放进不收录那一档。
决定之后,要在几个地方同时表达
收录策略不是写在文档里就算数的,它需要在多个信号上保持一致:
- 内链:不该被收录的页面,不必从导航和正文里反复给出入口。
- sitemap:只提交你希望进索引的地址,不要把站内所有 URL 一股脑塞进去。
- 页面标记:用 canonical 标明首选版本,用 robots meta 的 noindex 明确排除。
- robots.txt:它管的是抓取,不是收录,不要拿它当排索引的工具。
一个常见误区是:既写了 noindex,又在 sitemap 里提交同一个地址,还在内链里大量指向它。信号互相打架,最终只能靠搜索引擎自己猜。
上线之后怎么回头看
策略定完不代表一劳永逸。上线一段时间后,可以按模板抽查:被索引的 URL 数量是否和预期量级接近;有没有本该 noindex 的页面出现在索引里;反过来,该收录的页面是否长期停在已发现、未编入索引的状态。发现问题先检查信号是否一致,再考虑内容本身。
需要说明的是,这些动作的作用是让希望被收录的页面更清楚地表达自己,减少无谓消耗,并不等于提交了就一定被收录。索引的最终取舍权在搜索引擎手里,我们能做的只是把判断依据给足。