网站收录

聚合页与详情页抢同一批词:收录主次该怎么定

聚合页和详情页经常覆盖同一批关键词,标题摘要大量重合,索引里留谁就成了需要提前设计的事。本文给出判断真重复的方法、主次页面的排序顺序、canonical 与内链的适用边界,以及一份可以直接照着走的自查清单。

网站收录

聚合页与详情页抢同一批词:收录主次该怎么定

站内做聚合页很常见:把同类商品、同主题文章、同地区服务汇总在一页,既能承接偏宽的词,也方便用户横向比较。问题在于,聚合页和详情页往往描述的是同一批内容,标题、摘要、正文段落大量重合。搜索蜘蛛抓取之后,索引里到底留谁、以谁为主,就成了需要提前设计的事,而不是等收录异常了再回头改。

先确认是不是真重复

很多站点的问题是没判断清楚就开始改。判断方法并不复杂:把两页正文抽出来,去掉导航、页脚、推荐位这些模板部分,看剩余正文的重合比例;再看标题与 H1 是否指向同一个搜索意图;最后看有没有独立的信息增量,比如规格参数、价格区间、用户评价、更新时间。

  • 聚合页只输出列表和摘要,详情页是完整内容——重合度偏高,需要分主次。
  • 聚合页带有详情页没有的对比维度或结构化字段——两页可以并存,但要有分工。
  • 两页 URL 不同、内容几乎逐字一致——这属于同一页面的多种写法,先做收口再说其他。

这三类情况处理方式完全不同。把它们混在一起,往往会出现“改了很多地方,索引状态却没变化”的局面。

主次关系的判断顺序

确认存在重复之后,不要凭感觉选主页面,按下面这个顺序过一遍,通常能得出比较稳定的结论:

  1. 搜索意图:用户搜这个词时,更可能想先看列表,还是直接看某一个具体条目?
  2. 信息不可替代性:哪一页有别的页面拿不到的稳定内容,而不是靠模板拼接。
  3. 站内入口与外链:哪一页被更多内链指向,外链也更集中。
  4. 可维护性:哪一页能长期更新,不会几个月后变成一批死链或空列表。

四项都指向同一页时,结论很清楚。如果出现分歧,优先看第一项和第四项——意图决定用户价值,可维护性决定它能不能长期撑住收录。

常见处理方式与边界

用 canonical 指定规范页

canonical 更适用于“同一内容多种 URL 写法”的收口,例如带参数、带排序、带追踪码的版本。如果两页内容确实不同,只是想人为决定谁被收录,硬指 canonical 的效果有限,提示也可能被忽略。指向之前,先确认两页真的表达同一内容。

用内链和锚文本表态

内链是最温和也最直接的表态方式。想让聚合页承担收录,就从更多相关页面用描述性锚文本指向它;想让详情页为主,就别在每个列表项上都堆同样的锚文本。站内链接的分布,会直接影响蜘蛛对页面重要程度的判断。

noindex 与 robots.txt 的取舍

不要用 robots.txt 去屏蔽一个你还希望被索引的页面,那样蜘蛛连内容都读不到,更谈不上判断。至于 noindex,也不要在聚合页上随手加——先确认它是否真的没有独立价值。真正该 noindex 的,通常是排序参数、筛选组合、会话追踪这类批量生成的页面。

分页与筛选参数

第 2 页之后的分页 URL,如果只是同一批内容的排列变化,一般不需要单独作为收录目标;筛选参数则要看是否有稳定的搜索需求,有需求就给它一个干净的静态路径,没有就收口掉。两者都不适合靠“数量堆收录”。

自查清单

  • 是否比对过两页去模板后的正文重合度,而不是只看标题像不像?
  • 主页面的选择是否写下来过,团队里其他人的理解是否一致?
  • canonical 指向的是同内容页面,还是内容不同的两个页面?
  • 内链锚文本是否在无意中把权重分散给了辅助页?
  • 有没有页面同时被 robots.txt 屏蔽、又期望它出现在索引里?
  • 参数页是否已经收敛到干净路径,还是仍在持续生成新 URL?

改动之后怎么观察

调整之后不要每天盯着看数字波动。索引状态、规范页的选中情况、抓取频次这几项,通常需要数周才能看出趋势,中间还会有反复。建议按页面类型建一个小台账,记录改动时间、改动内容、当时的状态,几周后再回看,比凭印象判断可靠得多。

主次关系是设计出来的,不是等搜索引擎替你决定。越早把分工写清楚,后面越少出现两页互相稀释的情况。