站点查询出来的收录数字只是一个粗略信号。它可能混进一些你并不想要的 URL,也可能漏掉一部分其实已经进索引的页面。所以当它看起来“很少”时,第一步不是去改内容,而是先确认:到底是整体都没被收录,还是某几类页面被系统性地排除在外。
先按目录拆开看
用 site: 查询逐个目录试一遍:首页、主要栏目、文章详情、标签页、搜索页、用户中心路径。记录每个目录下大致有多少页面、能被查出来多少。多数站点会呈现明显的分层:
- 首页和一级栏目基本都在;
- 详情页收了一部分,越老的越容易被收;
- 某个目录几乎全军覆没,比如 /search/、/tag/、/user/。
如果某个目录整体缺席,问题通常不在单篇内容的质量,而在这一层 URL 的生成方式和入口设计。
再按模板分组
同一个目录里,不同模板的页面表现也会差很多。比如文章页和专题页共用一个栏目,但文章页收得很少、专题页收得不错,那问题大概率出在文章页模板上。按模板分组时,重点看三件事。
入口够不够
每个页面从首页出发要点几次才能到达?如果只能靠 sitemap 或者站内搜索进入,蜘蛛能发现,但缺乏持续爬取的动力。列表页翻页是否正常输出链接、相关推荐是否为静态链接,都影响这一层。
模板本身是否重复
大量页面除了标题和正文之外,其余区域完全一致,包括导航、推荐位、评论占位、页脚链接。这类页面在算法眼里区分度很低,收一部分、丢掉一部分是常见结果。做模板分组时,可以用两三个页面的正文比例、唯一文本字数做对比。
内容是否真的独立
聚合页、标签页、分页的摘要页容易扎堆。它们不是低质,但同质化严重,收进来对用户帮助有限。这类页面的取舍可以单独定规则,不必和详情页绑在一起处理。
把“抓了没收”和“没抓”分开
服务器日志能回答一个关键问题:蜘蛛到底来没来过。如果某个目录的 URL 在日志里几乎不出现,说明卡在发现和调度环节,改内容没用;如果日志里频繁出现、状态码 200、HTML 也正常输出,但迟迟不进索引,那才轮到内容和质量层面的判断。这一步分清楚,后面的动作才不会白做。
抓取次数多不代表收录会跟上,收录少也不代表蜘蛛没来。这两个指标分开看,排查方向会清晰很多。
处理顺序建议
- 先修入口:把重要页面挂到有实际抓取频率的列表页上,保证链接是普通的 a 标签,而不是脚本点击后才生成。
- 再修模板:拉开同类页面的区分度,减少全站统一的模块占位,让正文成为页面主体。
- 最后动内容:确实没有独立价值的页面,合并到更有代表性的页面上,或者用 noindex 明确退出索引,而不是放着不管。
观察节奏
调整之后不要每小时看一次收录数。指数级的收录变化通常以周为单位,索引报告里的数字也有延迟。建议固定一个观察周期,比如每两周记录一次各目录的收录比例,看趋势而不是看单点。如果比例在缓慢回升,说明方向对;如果三四周毫无变化,就回到入口和模板这两层再检查一遍。
最后提醒一句:收录数量本身不是目标。真正要盯的是“该被收录的页面有没有被收录”,剩下的部分,留在索引外边反而是更干净的结果。