页面收录慢,很多人第一反应是改内容、调质量。但收录这条链路其实分成三段:搜索引擎先要发现这个 URL,然后才安排抓取,抓取回来解析合格才会进入索引。发现是最前面的一环,也最容易被跳过——如果一个 URL 从来没被任何入口暴露过,后面两步根本不会发生。
发现和抓取不是一回事
发现指的是搜索引擎知道“这个地址存在”。抓取是它真的来取内容。索引是取完内容后判断是否值得收录。三者有时间差,也有先后顺序。
常见的误解是:只要站点提交了 sitemap,就等于告诉搜索引擎有新页面了。提交确实是一个通知动作,但搜索引擎对 sitemap 里的 URL 更多是“待处理”,处理节奏受整体抓取资源、站点权重、URL 质量等因素影响。相比之下,从一个已经被频繁抓取的页面上顺着链接爬过去,往往是更直接的发现路径。
一个 URL 可能被发现的几个入口
- 站内链接:导航、分类页、列表页、相关推荐、正文里的锚文本,这是最稳定的入口。
- sitemap:作为补充和兜底,尤其适合内链覆盖不到的页面。
- 外部链接:其他站点指向你的链接,哪怕只是普通引用。
- 已有页面的更新:老页面新增的链接,蜘蛛再次抓取时会一并看到。
把这些入口列出来会发现:如果新页面只在后台存在、只出现在 sitemap 里,而站内没有任何链接指向它,它的发现速度就会明显慢于同类页面。
内链入口单一,问题往往出在这几点
点击深度太深
从首页出发要点很多层才能到,蜘蛛不一定每次都走那么深。重要页面尽量控制在较浅层级,或者从多个层级都留出入口。
链接只在易变区块
如果链接只出现在首页轮播、限时活动这类很快被替换的位置,链接存活时间短,被发现的机会也随之减少。稳定区块(分类、专题、正文相关推荐)更可靠。
链接靠脚本生成、需要交互才出现
下拉加载、点击展开后才出现的链接,抓取时不一定触发。重要入口最好在初始 HTML 里就有可点击的 a 标签。
孤岛页面
只靠 sitemap 或外链,站内没有路径直达。这类页面不一定不会被收录,但通常更慢,也更难获得稳定抓取。
怎么确认一个 URL 有没有被发现
- 看服务器日志里有没有该 URL 的抓取记录,或者至少有没有蜘蛛访问过它的上级列表页。
- 用站点管理工具里的 URL 检查,看它是“已发现但未抓取”还是“尚未发现”。
- 核对 sitemap 是否真的包含这个地址,且文件格式可解析、里面没有 404 或重定向地址。
- 在站内搜索这个页面的关键词,确认是否有正常内链指向它。
如果日志里连一次访问都没有,问题多半在发现环节,而不是内容质量。
补发现入口的几个做法
- 给新页面至少加一条来自稳定区块的内链,锚文本写清主题。
- 把新 URL 放进合适的 sitemap,并保持文件可访问、只列可索引的地址。
- 相关文章、上一篇/下一篇在改版时优先保留。
- 批量上线新页面时分批推进,别一次放出远超日常量级的 URL。
- 发现之后仍要观察抓取和索引结果,发现只是起点。
最后提醒一句:补上发现入口,不代表页面一定被收录,它只是把 URL 送进了抓取队列。后续还要看页面是否可正常访问、内容是否与其他页面高度重复、是否被 robots 或 noindex 挡住等。排查收录问题时按“发现 → 抓取 → 索引”的顺序走一遍,通常比上来就改内容更省时间。