新頁面發布之後,最常被問到的一句话是:多久能收錄?這個問题没有标准答案,但有一個可以自己建立的心理区間。预期建對了,後面每一次延迟都不會被当成事故;预期建错了,就會反复做無用功。
收錄是三件事串起来的结果
搜尋引擎看到一個頁面,到它出現在索引里,中間至少经過三步:知道這個 URL 存在、抓取队列排到它並完成抓取、抓完之後判断它值得進索引。三步里任何一步慢,最终時間都會拉長。
所以別人的站三天收錄,對你的站没有參考價值。真正该看的不是總天數,而是這三步里哪一步在你這里偏慢。
第一步:URL 被發現
這一步通常最快,前提是入口够清晰。常见的發現路径包括:站内連結、更新的 sitemap、頁面之間的相關推荐、外部連結。如果一個新頁面在站内没有任何連結指向它,只躺在 sitemap 里,發現速度就會明顯慢一截。
自查方法很简單:從首頁出發,点几下能到這個新頁面?如果超過四五跳,或者只有 sitemap 一條路,那就是入口设計的問题,不是搜尋引擎的問题。
第二步:排队與抓取
被發現不等于马上抓。抓取是有成本的,站点越大、歷史抓取表現越不稳定,排队時間越長。几類情况會让這一步明顯變慢:
- 站点整体返回大量 5xx 或超时,抓取频率被下調;
- robots.txt 里存在大范围屏蔽規則,抓取工具主動减少来訪;
- 新頁面所在的目錄歷史抓取量本来就少;
- 頁面依赖脚本渲染,需要額外的渲染资源,抓取成本更高。
這一步的观察窗口通常是發布後的一到两周。判断依據是服務器日誌里有没有對應的抓取记錄,而不是索引报告。没有抓取记錄,谈收錄就是空谈。
第三步:值不值得進索引
抓到了,也不一定收。搜尋引擎會對頁面做一次质量判断,常见的影响因素有:
- 内容是否與站内已有頁面高度相似,比如同一個商品的不同排序參數頁;
- 頁面上有没有足够的正文,還是只有标题加几張图;
- 頁面是否解决了某個具体問题,而不是纯粹的栏目壳;
- 站点整体内容是否稳定,長期靠采集或拼接的站,新頁面被收的意愿也低。
這一步没有固定时長,它取决于搜尋引擎對整站的判断。這也是為什么同一批發布的十個頁面,可能只收了七個。
把收錄当成一次审核结果,而不是一次提交動作。提交只负责让 URL 被看见,审核通不通過是另一回事。
發布後的自查节点
與其每天刷新索引查询,不如按下面几個节点看,效率更高:
- 發布当天:確認頁面返回 200、没有被 robots.txt 挡住、canonical 指向自己、sitemap 已更新、站内至少有一條内鏈指向它。
- 24 到 72 小时:看服務器日誌,確認抓取工具来過。這一步只看有没有来,不看结果。
- 一周左右:查看索引狀態,看頁面是被收錄、被判為重复、還是仍處于已發現未抓取。
- 两到三周:仍然没有收錄,再回头看内容层面和站点整体抓取量的變化。
哪些催收錄的做法是真有用
有效並且可以持續推進的,通常只有几件:给新頁面加高质量的内鏈入口、保持 sitemap 與真實頁面一致、维持站点整体的可抓取稳定性、把頁面的正文寫清楚。這些都是長期動作,见效靠积累。
相比之下,反复提交同一個 URL、把希望押在第三方收錄工具上、為了催收錄临时堆砌外鏈,都没有稳定效果,還容易带来別的麻烦。
预期落空时先排查什么
如果超過三周仍無動静,按這個顺序看一遍,基本能定位問题:
- 頁面本身是不是被 noindex 或 canonical 指向了別處;
- 是否與站内已有頁面内容重复,属于该被合並的那一類;
- 頁面正文是否主要靠脚本渲染,抓取时拿到的是空壳;
- 站点近期的抓取總量是否整体下滑,問题可能不在單個頁面;
- URL 本身是否属于參數頁、篩選頁這類本来就不适合單獨立索引的類型。
把這几項過一遍,大多數延迟都能解释清楚。解释不清的,先別急着改頁面,观察一到两周再動,避免把正常波動当成故障處理。