新頁面發布之後,最常见的問题就是「為什么還没收錄」。這個問题没有统一答案,因為收錄並不是一次提交就能触發的動作,而是發現、抓取、索引三個阶段依次完成後的结果。其中任何一段卡住,時間都會被拉長。理解每一段的變量,比记住某個「通常几天」的说法更有用。
先分清自己等的是哪一段
同样是「没收錄」,落在不同阶段,處理方式完全不同:
- 發現:蜘蛛是否知道這個 URL 存在,主要靠内鏈、sitemap、外部連結和歷史上的抓取路径。
- 抓取:蜘蛛是否真的来取了頁面,取决于抓取预算、站点响應速度和服務器稳定性。
- 索引:抓到的内容是否被判定值得保留,以及最终選定哪一個版本作為規范頁。
如果日誌里從来没有出現過這個 URL,問题基本在發現這一段;如果来過一两次就没了,或者抓取时返回超时、5xx,問题在抓取;如果反复抓取但站内查询始终没有结果,那要看索引判断這一环。先分清段落,再動手,能省掉大量無效操作。
影响時間長短的几個變量
頁面有没有稳定的入口
只靠 sitemap 提交的頁面,被發現的速度通常慢于「已经在栏目頁或相關推荐里有一條正常内鏈」的頁面。sitemap 是补充线索,内鏈才是主要通路。新頁面發布後,把它接進真正相關的列表頁、上一篇下一篇、相關内容模块,往往比反复提交更直接。
站点被抓取的节奏
服務器响應時間、歷史稳定性、更新频率,都會影响蜘蛛回訪的密度。長期更新很少、或者经常超时的站点,新頁面被發現的間隔自然更長,這不是针對某一個頁面的判断。
頁面本身是否值得占一個索引位
内容完整、與站点主题一致、和站内已有頁面不构成重复,是基本條件。只有几行字的占位頁、與已有内容高度相似的頁、正文主要靠客戶端脚本拼出来的頁,即使被抓到,也更容易停在索引判断這一步。
URL 是否干净可訪問
直接返回 200、没有多跳重定向、没有多余的跟踪參數,會降低判断成本。同一個頁面同时存在 www 與非 www、带與不带末尾斜杠、带參數與不带參數等多個版本,信号就會分散,最终落到哪個版本也不确定。
内容是否已经定稿
刚發布就反复改标题、改结构,會让已经抓到的版本频繁作废。比較稳妥的做法是内容基本定稿後再放出入口,後續更新以补充和修订的方式進行,而不是推倒重来。
等待期可以做的事情
- 確認 URL 能正常打開、狀態碼正常、没有被 robots 規則挡住。
- 在相關頁面加一條真正有用的内鏈,锚文本说清目标頁讲的是什么。
- 检查 sitemap 是否包含该 URL,最後修改時間是否與實际情况一致。
- 翻服務器日誌,看這個 URL 有没有被抓取记錄,记錄返回碼和抓取時間。
- 不要為了「催」而反复提交,也不要频繁改動時間戳。
观察方式:別只靠站内查询
站内查询的结果只是一個粗略抽样,不等于完整的索引清單,用它来判断「到底收錄了没有」容易誤判。更可靠的做法是把日誌里的抓取记錄、索引類报告和站内查询结果放在一起看,三者相互印證。日誌能告诉你蜘蛛来没来、什么时候来、拿到了什么狀態碼;报告能告诉你頁面處在哪一段流程里。
把「没收錄」当成一個需要定位的現象,而不是一個必须立刻消除的错誤,排查過程會顺畅很多。
超過合理時間還没有動静
先判断是站点級還是頁面級的問题。如果同一時間段發布的多個頁面都没有被抓取,應该去看看服務器狀態、robots 設定、整体抓取量是否有異常;如果只是個別頁面進不来,就回到頁面本身和入口設定上找原因。這两種情况的處理顺序完全不同,混在一起查只會浪費時間。
另外需要接受一個現實:新站或者長期更新很少的站点,被抓取的频率本来就低,等待時間會更長。這種阶段里,稳定輸出内容、保持站点可抓取、给新頁面留出清晰的内鏈入口,比任何單点技巧都更有用。