先分清两个阶段:发现和抓取
收录链条大致是这样的:发现 URL、排入抓取队列、完成抓取、再判断是否编入索引。很多“一直不收录”的页面,其实卡在最前面一步。如果抓取日志里查不到这个 URL 的任何请求记录,说明它没有被发现,而不是被抓取之后被淘汰。这两种情况的处理方式完全不同:前者要补入口,后者要看抓取预算和页面本身的质量。
所以核对的第一步不是改内容,而是先确认这个 URL 到底有没有被抓过。
内链是最稳定的发现路径,sitemap 只是补充
搜索引擎发现 URL 的方式有很多,但最稳定、最持续的仍然是站内链接。sitemap 能帮忙发现,但它更像一份提交清单,不决定抓取优先级。一个从首页点三下就能到达的页面,通常比只出现在 sitemap 里的页面更容易排进抓取队列。这也解释了一个常见现象:同一批新建的详情页,有内链的那部分先被收录,剩下的迟迟没有动静。
核对顺序
- 确认抓取记录。在服务器日志里按 URL 路径搜索,看有没有来自搜索蜘蛛的请求。一条都没有,就是发现环节的问题;有记录但只有一两次,可能是抓取后判断不值得保留。
- 找出所有指向它的入口。除了导航和列表页,还要看相关推荐、上一篇/下一篇、标签页、专题页这些位置。注意区分真正的 a 标签链接和只写了文本的 URL,后者通常不构成入口。
- 数一下点击层级。从首页出发到目标页最少需要几次点击。如果只有通过搜索框、站内搜索或者表单才能到达,那基本可以当作没有入口。
- 检查列表页和分页。不少内容其实躺在栏目的第二页、第三页之后,而分页链接本身又是用按钮或者无限滚动实现的,没有可抓取的链接。这种情况下,深层内容会整体“消失”。
- 看链接是不是渲染后才出现。如果入口由 JavaScript 在客户端注入,先确认原始 HTML 里是否包含链接。渲染后的链接有机会被发现,但稳定性和效率都不如直接输出。
- 最后再看 sitemap。确认目标 URL 是否在 sitemap 中、格式是否规范、有没有被 robots.txt 挡住。这一步是补漏,不是主力手段。
补内链时容易踩的坑
- 把大量链接堆在页脚,页脚链接的权重和可信度都有限,短期看不出效果。
- 锚文本统一写成“点击这里”“了解更多”,对判断页面主题几乎没有帮助。
- 给入口链接加了 nofollow,等于主动放弃了这条发现路径。
- 一批孤立页面互相链接,形成一个小圈子,仍然没有连回主站结构。
- 为了补内链,在正文里硬塞不相关的链接,最终影响的是阅读体验和页面质量。
有些页面不值得补内链
补入口之前,先问一句:这个页面单独存在有没有价值。如果它只是筛选结果的组合、与另一个页面内容高度重合、或者信息量极低,那更合理的做法是合并、下线或者做规范化处理,而不是硬把它推给搜索引擎。硬推上去的页面,即便被抓取,也可能因为质量原因停留在索引之外,反而增加维护成本。
小结
页面不被收录,先别急着改标题和正文。按“日志有没有抓取记录、有没有真实内链入口、点击层级是几跳、列表页是否输出链接、链接是否依赖渲染、sitemap 是否完整”这个顺序走一遍,多数孤儿页面的断点都能定位到具体位置。
发现是收录的前提。一个找不到入口的 URL,内容再好也不会自动进入抓取队列。把入口补齐,往往比反复修改页面本身更有效。