网站收录

归档页、标签页与作者页:聚合列表页的收录取舍与核对顺序

标签页、日期归档和作者页往往由模板批量生成,内容高度相似,既容易被收录成大量低价值页面,也可能因为屏蔽方式不当影响内链传递。本文按路径分组统计、页面内容抽查、参数变体、canonical 与 robots 处理、抓取占比几条线,给出一套可执行的核对顺序与取舍建议。

网站收录

归档页、标签页与作者页:聚合列表页的收录取舍与核对顺序

标签页、日期归档、作者页、分类页这类聚合列表页,通常由模板批量生成,一个站点几百上千个很常见。它们既可能是内链的重要节点,也可能成为索引里大量内容雷同的页面。要不要让它们进索引,不能只凭感觉,得按顺序核对。

先分清三类聚合页的差异

  • 标签页 / 话题页:按主题聚合,同一篇内容可能同时出现在多个标签下,页面之间的差异很小。
  • 日期归档页:按年月归档,排序依据只有时间,内容与栏目页基本重合。
  • 作者页 / 分类页:作者页内容随发文更新,分类页通常承担主要导航职能,价值差异较大。

三类页面的处理方式不该一样,核对时也要分开统计,不要混在一个数字里看。

判断标准:页面本身有没有独立价值

核心问题只有一个:用户直接落到这个页面,能不能得到别处得不到的东西。可以从几个角度判断:

  • 列表条目是否少于三五个,条目太少时页面近似空壳;
  • 列表是否只有标题加链接,没有摘要、说明或任何筛选维度;
  • 同一批内容能否通过排序、筛选、页码生成多个 URL;
  • 页面是否在站内导航路径上,还是只能靠内链偶然到达。
聚合页被收录本身不是问题,问题是它有没有带来新的信息或导航价值。判断依据应该是内容差异,而不是页面类型。

一条可执行的核对顺序

  1. 按路径分组统计:在索引报表里按 /tag/、/date/、/author/ 这类目录前缀分组,看被收录的数量和占全站的比例。
  2. 抽查页面返回内容:抓取几个已被收录的聚合页,确认 HTML 里是否有实质文字,还是只有一串标题链接。
  3. 检查参数变体:看排序、筛选、分页参数能否生成同一内容的多个 URL,这些版本是否也进了索引。
  4. 确认 canonical 与机器人指令:聚合页指向的规范版本是否稳定,分页序列有没有统一处理。
  5. 看抓取占比:用日志统计爬虫在这类路径上的抓取比例,如果占用明显偏高,说明需要收敛。
  6. 决定去留并留出观察期:改动后不要立刻下结论,等一轮重抓完成后再看索引状态。

去留对应的处理方式

  • 保留:有编辑说明、有独立筛选维度、被站内导航实际使用的标签页,可以正常放开,并把分页序列处理好。
  • 收敛:同主题标签过多时,只保留被内链和导航实际使用的少数几个,其余合并或下线。
  • 不进索引:纯日期归档、内容完全重合的列表页,可以用 noindex, follow 保留链接传递,同时不在索引里占位。
  • 屏蔽参数:无意义的排序、筛选组合可以通过参数规则处理,避免同一批内容生成大量 URL。

容易被忽略的几点

第一,用 robots.txt 屏蔽某个目录后,页面虽然不再被抓取,但 canonical 也不会被读取,索引里可能长期保留旧版本,这种情况下更适合用 noindex 或移除工具处理。

第二,屏蔽聚合页不等于可以删掉站内链接。列表页承担着发现新内容的作用,直接断链会让位置更深的正文更难被发现。

第三,改完之后旧 URL 不会马上消失,索引更新需要时间。核对时要用同一口径对比改动前后的数据,避免把时间差当成处理效果。

聚合页的取舍没有统一答案,关键是先统计、再抽查、最后按价值决定保留还是收敛,同时让 URL 规范和机器人指令保持一致。