先分清三步:发现、抓取、索引
新页面从发布到出现在搜索结果里,走的是三个相对独立的环节。URL 发现是蜘蛛知道有这个地址;抓取是蜘蛛真的来取了一次 HTML;索引是内容进入索引库,并通过了质量与重复判断。这三步任何一步卡住,页面都不会出现在搜索结果中,而它们的排查方法完全不同。
- 发现:内链、导航、sitemap、外链、站长工具提交,都是蜘蛛获取 URL 的入口。
- 抓取:受服务器响应速度、robots.txt、抓取预算、返回码影响。
- 索引:受内容质量、重复度、canonical、noindex 指令影响。
提交 sitemap 只解决发现这一步,它不代表蜘蛛会优先抓取,也不代表页面会被索引。
一条大致的时间线
不同站点差异很大,但可以先建立一个粗糙的参照,用来判断是正常延迟还是真有问题。
- 几小时到 1 天:更新频繁、层级较浅的栏目下的新页面,可能当天就被抓取。
- 3 到 7 天:多数站点的常规新页面,被发现并抓取属于正常范围。
- 2 到 4 周:新站、新目录、缺少内链入口的页面,抓取和索引都可能拖到这个量级。
- 超过 1 个月仍未抓取:通常不是慢,而是发现或抓取环节被挡住了。
要留意的是,抓取和索引之间存在明显滞后。蜘蛛来过、返回 200,也常见几天甚至几周后才进索引。
三个卡点,分别怎么判断
卡在发现
页面是孤儿页,或者只有首页上一处临时链接,链接很快被新内容顶掉。sitemap 没有更新、导航依赖客户端渲染,也会让蜘蛛拿不到地址。
卡在抓取
服务器响应过慢、间歇性 5xx、连接被重置,都会让蜘蛛降低抓取频率。robots.txt 误挡、大量参数页消耗抓取预算,也会让新页面排在后面。
卡在索引
内容过薄、与站内已有页面高度相似、模板重复、canonical 指向了别处、页面带了 noindex,都会让页面抓取成功却不进索引。
自己验证卡在哪一步
- 查服务器日志,确认蜘蛛是否访问过该 URL;没有记录,问题多半在发现环节。
- 看返回码是否稳定为 200,以及是否存在超时或 5xx。
- 检查渲染后的 HTML 里正文是否真的存在,而不是只靠前端脚本拼接。
- 核对 noindex、canonical、robots.txt 之间是否有冲突指令。
- 找同模板下已被收录的页面做对比,看差异在内容还是链接入口。
可以做的几件小事
- 给新页面一个稳定、长期存在的内链入口,而不是只挂在列表第一屏。
- 及时更新 sitemap 并在站长工具提交,不必反复提交同一批 URL。
- 同一内容只保留一个规范版本,参数、大小写、尾斜杠统一到一个 URL。
- 让正文核心内容在服务端就能输出,减少对渲染的依赖。
- 避免一次性批量上线大量同质页面,这会把抓取预算摊薄。
预期放平一点
新页面一天没收录就反复修改标题、URL 和 canonical,往往让状态更混乱。建议以周为观察窗口,先确认卡在发现、抓取还是索引,再针对性处理。收录是结果,不是靠提交动作就能换来的开关。