先按页型拆分,再看收录数据
站点收录量出现波动时,很多人的第一反应是去查某一批 URL 或者某个模板改坏了。更省事的做法是先把站内页面按页型分一分:列表页、详情页、专题聚合页、标签页、分页页。它们被蜘蛛抓取的频率、被索引的理由、内容更新的节奏都不太一样,混在一起看平均收录率,往往看不出问题出在哪一层。
搜索蜘蛛对不同页型的预期本来就不同。列表页会随新内容上线持续变化,蜘蛛来的次数通常更多;详情页一旦定稿,改动有限,抓取频率自然低。抓得勤不等于容易被收录,抓得少也不代表被放弃,这两个指标要拆开看。
列表页:抓得多,但要给出收录理由
列表页最常见的问题是“只有标题和链接”。这种页面在蜘蛛看来缺少独立内容,即使被频繁抓取,也可能长期停留在“已抓取但未编入索引”的状态。
- 给栏目补上简短的编辑说明或分类描述,让页面本身有可读文本;
- 空栏目、只有一两条内容的列表页,先别急着让它进索引;
- 分页链接用规范的 URL 形式,避免参数拼接出大量近似页面;
- 翻页页面的索引策略保持一致,别让第二页、第三页各自为政。
如果日志里列表页的抓取很频繁、收录比例却一直不高,通常不是抓取出现问题,而是页面本身缺少能被判断为“有独立价值”的依据。
详情页:内容主体能不能提取,决定结果
详情页的核心矛盾在内容侧。蜘蛛能不能顺利拿到正文,直接影响它对页面的判断。
- 正文是否被模板、推荐位、评论、广告稀释,主体部分要足够集中;
- 内容靠前端渲染时,先确认蜘蛛拿到的是完整 HTML 还是空壳;
- 同一商品或同一主题下参数只差一点点的页面,容易互相稀释;
- 正文过短、结构高度雷同的页面,收录后也容易被判定为低价值。
这一类页面的典型信号是:抓取次数正常,收录率却明显低于同类页面。此时调整模板结构、补充正文,通常比反复提交 URL 更有用。
专题页与标签页:聚合要有边界
聚合页的价值在于把零散内容组织成新的入口,但标签最容易失控——每加一个关键词就多一个页面,几十个标签页里可能只有几个有稳定需求。
比较稳妥的做法是给聚合页设一条门槛:内容量达到一定规模、有明确的组织逻辑,再让它进索引;长期只有一两条内容的标签页可以先用 noindex 处理。这里要注意它和 robots.txt 的区别——noindex 是阻止收录,robots.txt 是阻止抓取,用反了会挡住蜘蛛读取 noindex 标签。
按页型排查的四个步骤
- 把蜘蛛日志按 URL 目录或模式分组,算出各页型每天的抓取频次;
- 抽样检查各页型的索引状态,估算大致收录比例;
- 对比各页型的入口数量、内容量和更新频率,找出明显掉队的那一类;
- 只针对这一类做调整,观察两到四周,而不是同时改所有页型。
两个容易混淆的判断
一是把抓取频次当成收录指标。蜘蛛频繁来访只说明 URL 被发现得勤,和是否进索引是两件事。二是把单页波动当成整体趋势——某几个 URL 掉出索引很常见,只有当同一页型的收录率一起往下走,才值得系统排查。
按页型拆分数据,比盯着全站平均收录率更容易找到真正的原因。
收录本身没有统一的通关标准,不同页型承担的角色不同,判断标准也应该不同。先把页型分清楚,再回头去看抓取、内容质量和 URL 规范,排查方向会清晰很多。