不少站点会用模板批量生成页面:不同城市各一页、不同型号各一页、不同参数组合各一页。上线一段时间后常见现象是:少数页面进了索引,其余长期停在“已发现,尚未编入索引”,或者压根没被稳定抓取。这个时候先去加蜘蛛池、堆外链,往往救不回来,因为问题出在页面本身——它们彼此之间几乎没有区别。
一、先确认是不是真的低差异
判断同质化不要凭感觉,做一次抽样对比更靠谱。从同一批页面里随机抽 8 到 10 个,把正文主体(去掉导航、页脚、推荐位、广告位)复制到纯文本里,逐段比对。
- 有三段以上完全一字不差:可以按高度同质处理。
- 只有地名、型号、数字被替换,句式结构一致:属于轻度改写,实质仍是同一份内容。
- 各自有独立的数据、说明、问答、注意事项:属于有差异,通常不需要大动。
判断重复不只看字符重合度,还要看这段内容是否只在你这一条 URL 上出现过。别处已经有的段落,即使句式换了,也很难带来增量。
二、把差异拆成三层来判断
1. 主体内容差异
这是最核心的一层。看每个页面有没有只属于自己的信息:本地价格区间、实际库存与时效、特定型号的规格差异、常见问题的具体答复。如果这些都没有,页面就只是模板换皮。
2. 结构化数据与参数
参数本身不是内容,但可以让页面之间形成区分:价格、规格、适用场景、服务范围。前提是这些字段真实、可核对,不能为了“看起来不一样”而编造。
3. 页面级信号
标题、H1、面包屑、内链锚文本是否与页面主题一致。常见错误是标题里堆地名和型号,正文却还是通用文案,等于告诉搜索引擎“这页没什么可给的”。
三、入口分配:不是所有页面都值得同等对待
sitemap 全量提交,只代表你愿意让它们被发现,不代表每一个都需要被重点抓取。抓取预算是有限的,把入口集中到差异度高的页面上,通常比平均分配更有效。
- 按差异度把页面分成高、中、低三档。
- 高差异页面:进主要栏目列表、相关推荐、面包屑,保证从首页出发三跳内可达。
- 中差异页面:靠 sitemap 加少量内链,不做重点推荐位。
- 低差异页面:先考虑合并或收敛,而不是继续加内链。
四、低差异页面的几种处理方式
- 合并:把几个高度同质的页面并成一个,其余做 301 指向主页面,主页面再补充各自独有的信息。
- 收敛:参数组合过多时,只保留有搜索需求、有独立价值的组合,其余通过规范链接或参数规则归到主 URL。
- noindex:确实没有独立价值但需要保留给用户访问的页面,可以用 noindex 阻止进入索引,同时保持可抓取,让爬虫能读到这个指令。
- 下线:既没有用户价值也没有搜索价值的页面,直接返回 404 或 410,比留在站内当僵尸页更干净。
这里要分清两件事:noindex 是告诉搜索引擎“可以抓,但别收录”;robots.txt 屏蔽是“别来抓”。如果屏蔽了抓取,爬虫读不到 noindex,索引里的旧记录反而可能长期留着。
五、改完之后看什么
- 索引报告里按页面类型分组的变化,而不是只看总索引量。
- 抓取日志里这批 URL 的出现频次,判断入口调整有没有传导到抓取。
- 这批页面的自然点击与站内入口点击,判断哪些确实有人用。
观察周期建议按周看,别按天盯。索引和抓取的调整本身就是慢变量,一两天没动静很正常。
六、几个容易踩的坑
- 只改标题和 H1,正文照旧,差异度并没有提升。
- 为了“差异化”把关键词硬塞进正文,可读性反而下降。
- 同一内容存在多个 URL 变体,却没有做规范化,等于把信号分散掉。
- 把低差异页面全量塞进 sitemap 和栏目列表,进一步摊薄本来就有限的抓取。
整体思路可以先简单记成一句:先判断差异度,再决定入口,最后才谈收录。批量页面的收录问题,多数不是爬虫不来,而是来了也看不出这一页和上一页有什么不同。