网站收录

整站只收录了一小部分:按目录和模板分组看,比盯着总量有用

收录总量偏低时,先别急着改内容。把收录情况按目录拆开、再按模板分组,通常能看出是入口缺失、模板重复还是内容本身的问题。本文给出一个从分组到定处理顺序的排查思路,并说明抓取和收录要分开看。

网站收录

整站只收录了一小部分:按目录和模板分组看,比盯着总量有用

站点查询出来的收录数字只是一个粗略信号。它可能混进一些你并不想要的 URL,也可能漏掉一部分其实已经进索引的页面。所以当它看起来“很少”时,第一步不是去改内容,而是先确认:到底是整体都没被收录,还是某几类页面被系统性地排除在外。

先按目录拆开看

用 site: 查询逐个目录试一遍:首页、主要栏目、文章详情、标签页、搜索页、用户中心路径。记录每个目录下大致有多少页面、能被查出来多少。多数站点会呈现明显的分层:

  • 首页和一级栏目基本都在;
  • 详情页收了一部分,越老的越容易被收;
  • 某个目录几乎全军覆没,比如 /search/、/tag/、/user/。

如果某个目录整体缺席,问题通常不在单篇内容的质量,而在这一层 URL 的生成方式和入口设计。

再按模板分组

同一个目录里,不同模板的页面表现也会差很多。比如文章页和专题页共用一个栏目,但文章页收得很少、专题页收得不错,那问题大概率出在文章页模板上。按模板分组时,重点看三件事。

入口够不够

每个页面从首页出发要点几次才能到达?如果只能靠 sitemap 或者站内搜索进入,蜘蛛能发现,但缺乏持续爬取的动力。列表页翻页是否正常输出链接、相关推荐是否为静态链接,都影响这一层。

模板本身是否重复

大量页面除了标题和正文之外,其余区域完全一致,包括导航、推荐位、评论占位、页脚链接。这类页面在算法眼里区分度很低,收一部分、丢掉一部分是常见结果。做模板分组时,可以用两三个页面的正文比例、唯一文本字数做对比。

内容是否真的独立

聚合页、标签页、分页的摘要页容易扎堆。它们不是低质,但同质化严重,收进来对用户帮助有限。这类页面的取舍可以单独定规则,不必和详情页绑在一起处理。

把“抓了没收”和“没抓”分开

服务器日志能回答一个关键问题:蜘蛛到底来没来过。如果某个目录的 URL 在日志里几乎不出现,说明卡在发现和调度环节,改内容没用;如果日志里频繁出现、状态码 200、HTML 也正常输出,但迟迟不进索引,那才轮到内容和质量层面的判断。这一步分清楚,后面的动作才不会白做。

抓取次数多不代表收录会跟上,收录少也不代表蜘蛛没来。这两个指标分开看,排查方向会清晰很多。

处理顺序建议

  1. 先修入口:把重要页面挂到有实际抓取频率的列表页上,保证链接是普通的 a 标签,而不是脚本点击后才生成。
  2. 再修模板:拉开同类页面的区分度,减少全站统一的模块占位,让正文成为页面主体。
  3. 最后动内容:确实没有独立价值的页面,合并到更有代表性的页面上,或者用 noindex 明确退出索引,而不是放着不管。

观察节奏

调整之后不要每小时看一次收录数。指数级的收录变化通常以周为单位,索引报告里的数字也有延迟。建议固定一个观察周期,比如每两周记录一次各目录的收录比例,看趋势而不是看单点。如果比例在缓慢回升,说明方向对;如果三四周毫无变化,就回到入口和模板这两层再检查一遍。

最后提醒一句:收录数量本身不是目标。真正要盯的是“该被收录的页面有没有被收录”,剩下的部分,留在索引外边反而是更干净的结果。