网站收录

按页面类型定收录策略:不是每个 URL 都值得进索引

收录问题往往在页面设计阶段就已埋下。与其等索引膨胀后再收拾,不如按模板给每类页面定好收录档位:哪些必须进索引,哪些可收可不收,哪些应当排除。本文给出判断页面的四个问题、常见页面类型的归属,以及内链、sitemap、canonical 与 robots meta 该如何保持一致。

网站收录

按页面类型定收录策略:不是每个 URL 都值得进索引

很多站点的收录问题并不是从被抓取那一刻才开始的,而是在页面设计阶段就已经埋下。同一个站点里,有的页面天生该进索引,有的页面进去只是占位置。与其等到索引膨胀了再回头收拾,不如在上线前就按页面类型定好收录策略。

先分清三种收录档位

把站内每一类页面往三个档位里放,判断会清晰很多。

  • 必须被收录:有独立搜索需求、内容自成一体、用户会直接搜到它的页面。
  • 可收可不收:有一定聚合价值,但和别的页面高度相似,收不收取决于站内是否缺这一类入口。
  • 不该进索引:只服务于站内流程、内容重复,或者由参数组合爆炸产生的页面。

关键在于:这个判断要按模板来做,而不是按单条 URL。模板决定了成百上千个页面的命运。

常见页面类型的归属

内容页

文章、商品、问答这类主体内容页,通常属于必须收录的一档。前提是内容确实独立——同一篇内容出现在多个 URL 上时,要先收敛再谈收录。

栏目页与分类页

处在可收可不收与必须收录之间。如果分类页只有一列标题,价值接近导航;如果它带有筛选后的独立信息,比如价格区间、地区、规格,则值得收录。判断标准是:用户会不会为了这一类内容专门去搜。

标签页与作者页

标签数量少、每个标签下有足够内容时,可以留少量进索引;一旦标签由系统自动生成、动辄上千个且每个只挂着两三篇,通常更接近不该进索引那一档。

筛选、排序与追踪参数

这些 URL 本身不承载新内容,只是同一批内容的排列组合。默认不进索引,靠 canonical 标签或 robots meta 表达。

站内搜索结果页

属于典型的不该收录。它随查询词无限生成内容,既不稳定也没有独立价值。

附件与打印页

PDF、图片、打印版本本身不是问题,问题是有没有一个 HTML 页面承担了同样的信息。如果已经有,附件通常不需要单独去争索引位置。

判断一个页面该不该收,先问四个问题

  1. 有没有人会把它当作搜索的终点?
  2. 它有没有本站其他页面无法替代的内容?
  3. 它会不会长期稳定存在,还是随参数、库存、会话变化?
  4. 如果把它从索引里拿掉,用户的搜索结果会不会变差?

前两个问题答否,基本就可以放进不收录那一档。

决定之后,要在几个地方同时表达

收录策略不是写在文档里就算数的,它需要在多个信号上保持一致:

  • 内链:不该被收录的页面,不必从导航和正文里反复给出入口。
  • sitemap:只提交你希望进索引的地址,不要把站内所有 URL 一股脑塞进去。
  • 页面标记:用 canonical 标明首选版本,用 robots meta 的 noindex 明确排除。
  • robots.txt:它管的是抓取,不是收录,不要拿它当排索引的工具。
一个常见误区是:既写了 noindex,又在 sitemap 里提交同一个地址,还在内链里大量指向它。信号互相打架,最终只能靠搜索引擎自己猜。

上线之后怎么回头看

策略定完不代表一劳永逸。上线一段时间后,可以按模板抽查:被索引的 URL 数量是否和预期量级接近;有没有本该 noindex 的页面出现在索引里;反过来,该收录的页面是否长期停在已发现、未编入索引的状态。发现问题先检查信号是否一致,再考虑内容本身。

需要说明的是,这些动作的作用是让希望被收录的页面更清楚地表达自己,减少无谓消耗,并不等于提交了就一定被收录。索引的最终取舍权在搜索引擎手里,我们能做的只是把判断依据给足。