新頁面發布之後,最常被問到的一句话是:多久能被收錄?這個問题没有统一答案,因為收錄速度取决于搜尋引擎什么时候發現這個 URL、愿意為它安排一次抓取、以及抓取之後判断它是否值得進索引。這三步里任何一步卡住,時間都會被拉長。與其盯着一個具体天數,不如先判断自己遇到的是正常等待,還是有什么東西挡住了。
收錄是三個环节串起来的
把過程拆開看會清楚很多:發現(URL 被蜘蛛知道)、抓取(蜘蛛真的来取了一次)、索引(内容被判定為可收錄並入库)。很多站点只看最後一步的结果,忽略了前面两步的狀態,于是把還没被發現当成内容质量不行来處理,方向從一開始就错了。
影响收錄速度的常见因素
- 有没有内鏈指向。新頁面如果只存在于 sitemap,没有任何站内入口,被發現的時間通常比有正常内鏈的頁面晚很多。
- 站点整体的抓取活跃度。抓取频率高的站点,新頁面被掃到的概率更大;長期不更新、蜘蛛来得少的站点,等待時間會更長。
- URL 是否稳定。頁面刚上线就換目錄、改參數、加带跟踪參數的版本,會让蜘蛛反复從头認识這個地址。
- 技術层面的拦截。robots.txt 屏蔽、meta noindex、canonical 指到別處、返回 4xx 或 5xx,都會让頁面停在抓取之後、索引之前。
- 内容本身是否太薄或高度重复。正文只有一两句话,或者大部分内容和其他頁面一致的頁面,即使被抓取,也不一定會進入索引。
- 服務器响應情况。响應慢、经常超时,蜘蛛可能取到一半就放弃,下一次再来又要等。
先分清该等和该修
判断依據不是時間長短,而是日誌里有没有蜘蛛的痕迹:
- 日誌里没有這個 URL 的抓取记錄,大概率還没被發現,優先补内鏈、检查 sitemap 是否包含,而不是改文案。
- 日誌里已经抓取,但索引里没有,检查 noindex、canonical、狀態碼,以及内容是否過薄,問题出在抓取之後的环节。
- 日誌里有抓取、狀態碼正常、内容也不薄,只是還没進索引,這類情况多數只需要繼續观察,频繁改動反而會让蜘蛛不断重新评估。
一個可执行的排查顺序
- 確認 URL 只有一個規范版本,且返回 200。
- 確認 robots.txt 和頁面 meta 没有被誤拦。
- 確認頁面上至少有一條来自相關頁面的站内連結。
- 在 sitemap 中確認该 URL 存在,且 lastmod 是真實修改時間。
- 查服務器日誌,看蜘蛛是否来過、来的频率、返回狀態。
- 已经抓取但未收錄时,回到内容层面看是否存在重复或信息量不足的問题。
几個常见的催收錄誤区
把這些動作当成必收錄的開關,通常會失望:反复提交 URL、短時間内大批量提交、给頁面堆外鏈、為了让它被抓而複製出一堆近似頁面。這些做法最多影响被發現的速度,改變不了抓取之後的判断。
- 频繁改動刚上线的頁面,會让蜘蛛每次看到的都是新版本,反而延長稳定判断的時間。
- 把收錄慢全部归因于内容质量,忽略了内鏈和日誌這两條更直接的线索。
- 只看索引量這一個數字,不看具体是哪些 URL 被收錄、哪些没被收錄。
合理的预期
對大部分有正常更新和站内連結的站点来说,新頁面在一段時間内被發現並抓取是常態,但具体多快,受抓取频率和頁面優先級影响,波動很大。與其设定一個固定天數,不如建立一套观察机制:记錄發布日、首次抓取日、首次收錄日,积累一段時間後,你會對自家站点的正常节奏有判断,也更容易看出某一個頁面是真的異常,還是只是還没轮到。
收錄速度是结果,不是可以直接控制的動作。能控制的是把發現路径打通、把技術拦截排除、把内容做扎實,剩下的交给時間。