做站点运营的人常有一种体验:通过蜘蛛池或站内链接,把一批 URL 送进抓取队列,日志里访问记录很热闹,过一段时间去查索引,真正被收录的却只有一小部分。原因通常不在“蜘蛛来没来”,而在页面是否让搜索引擎觉得值得收、以及该收哪一个。抓取与收录是两条不同的流程,中间隔着判断层,而重复内容和 URL 规范是最常见的两道坎。
抓取与收录是两回事
抓取解决的是“能不能拿到内容”,收录解决的是“要不要放进索引并参与展现”。蜘蛛访问一次,只说明 URL 被发现并进入了抓取队列;能否收录,还要看内容质量、是否重复、结构是否清晰、站点整体是否可信。把抓取量当成收录量,很容易做出错误判断。
- 抓取:蜘蛛读取页面,可能只读一部分,也可能过几天再来。
- 收录:搜索引擎决定把哪个 URL 作为该内容的代表,并建立索引。
- 展现:即使被收录,也不代表每条相关查询都有排名。
重复内容是收录路上的减速带
同一份内容如果存在多个可访问地址,搜索引擎需要在其中挑选一个作为规范版本。挑选过程会消耗判断成本,结果也未必符合预期;严重时,多个地址互相分散权重,谁都难以进入索引。
常见的重复来源
- 带参数 URL:排序、筛选、追踪参数、会话 ID 等生成大量同内容页面。
- 协议与域名变体:http 与 https、www 与非 www、大小写混用。
- 路径细节:结尾斜杠、默认首页与首页、静态化地址与原始地址并存。
- 功能页面:打印页、移动端独立域名、站内搜索结果页、空标签聚合页。
URL 规范:告诉搜索引擎哪个是“正本”
规范化的核心,是让所有等价入口都指向同一个代表地址。常用手段是 301 跳转与 canonical 标签,两者可以配合使用,但要注意方向一致。
- canonical 优先指向自身所在页;只有内容确实重复时,才指向另一个规范地址。
- 避免链式 canonical(A 指 B,B 又指 C),也不要把不相关页面强行合并。
- canonical 地址应与 sitemap、站内链接、301 目标保持一致,减少矛盾信号。
- robots 屏蔽与 canonical 不要互相打架:想收录就让它可抓取,别用屏蔽去解决重复。
减少重复、提高被收录概率的实操
- 统一主域名与协议,其余变体全站 301 到唯一版本。
- 筛选、排序、追踪类参数,尽量不让其出现在可抓取链接中;确有需要时做好规范声明。
- 分页保留可抓取,但每页给予可区分的内容与标题,规范指向自身,不要全部压到第一页。
- sitemap 只提交规范 URL,并随内容更新及时维护。
- 控制站内搜索、标签聚合、日历归档等页面的生成量,避免低价值页面挤占抓取资源。
- 页面本身要有独立信息量,模板、导航、页脚之外的正文应能被清楚识别。
用数据验证,而不是凭感觉
处理完规范问题后,可以通过抓取日志、站点地图的收录反馈,以及用不同地址做站内搜索时的返回结果,观察规范页面是否被选中。对比处理前后的抓取分布,比单看某一天的访问量更有意义。
收录是搜索引擎的判断结果,不是站点可以单方面承诺的目标。运营能做的是减少干扰项,让页面更容易被正确理解。
当重复内容被收敛、规范地址变得清楚,蜘蛛池或内链带来的抓取才更可能转化为有效收录。接下来要看的,是页面内容本身能否回答用户的问题。