網站收錄

發現、抓取、索引:URL 從提交到收錄要過的三道關

提交 URL 只是通知,蜘蛛要先發現入口、再决定抓取、最後才判断是否值得進入索引。本文把這三個环节拆開,說明每一步常见的卡点、可执行的排查顺序,以及日誌與索引狀態資料该怎么配合着看。

網站收錄

發現、抓取、索引:URL 從提交到收錄要過的三道關

發現、抓取、索引是三件不同的事

很多人把“提交了 URL”当成收錄的第一步,其實在這之前還有一段更長的鏈路:蜘蛛要先發現這個 URL,再决定去抓取,抓回来之後才谈得上索引。這三步各有各的失敗方式,混在一起看,就容易得出“提交没用”或“蜘蛛不抓我”這類模糊结论。

把三個环节拆開,排查才有落点:發現失敗通常是入口問题,抓取失敗多半是服務器或抓取額度問题,索引失敗則一般要回到頁面内容本身。

蜘蛛發現新 URL 的几條常见路径

  • 站内連結:最常见的路径。首頁、栏目頁、文章相關推荐里如果都通不到,這個 URL 基本等于孤立。
  • 外部連結:別人鏈過来时,蜘蛛顺着爬進来,連結所在頁面的可抓取性同样重要。
  • sitemap:它声明“我這里有這些 URL”,但只是一份候選清單,既不保證被抓,也不保證被收錄。
  • 推送接口:多數搜尋引擎提供主動提交入口,适合新發布或刚改過的頁面。
  • 歷史抓取记錄:以前抓過的 URL 再次更新时往往會被優先回訪,所以老頁面改内容常常比全新頁面更快被看到。

“提交了”為什么還是顯示未被發現

提交只是把 URL 放進一個待處理池。真正决定它能否被發現的,是這個 URL 在站内是否有可爬到的入口、入口頁面本身是否在正常被抓取、以及整站是否處在正常的訪問狀態。如果首頁或栏目頁响應異常、robots 挡住了入口、或者大量參數頁把抓取額度消耗掉,提交的 URL 很可能長期排在後面。

提交解决的是“通知”,入口解决的是“能不能到”。很多等待,其實卡在後面這件事上。

被發現却長期不抓取,先看這几点

  1. 服務器返回是否稳定。超时、5xx、频繁跳轉都會降低抓取意愿。
  2. URL 是否重复。同一内容靠參數、大小寫、尾斜杠生成多個版本,等于自己制造了排队。
  3. 頁面重要性信号是否足够。没有内鏈、没有外鏈、也没有歷史資料的全新 URL,優先級自然靠後。
  4. 站点整体抓取是否被低價值頁面占满,導致新頁面迟迟轮不到。

抓取了却不出現在索引里

到這一步,問题基本不在入口,而在頁面本身。常见原因包括:正文内容過少或與模板比例失衡,頁面與其他 URL 高度相似,返回了 noindex,canonical 指向了別的地址,或者内容属于搜尋引擎明确不處理的類型。抓取是拿到内容,索引是判断值不值得留,两者的标准並不相同。

一個可执行的排查顺序

  1. 先用日誌確認蜘蛛最近是否訪問過這個 URL,以及返回的狀態碼。
  2. 若没有訪問记錄,就先补入口:内鏈、sitemap、相關推荐位。
  3. 若有訪問但狀態碼異常,先修服務器响應和跳轉鏈路。
  4. 若返回正常但不收錄,检查内容重复度、noindex、canonical 與模板占比。
  5. 以上都正常,就繼續观察,不要反复改 URL 或重复提交,频繁改動本身會重置判断。

哪些資料更有參考價值

與其盯着某一天的收錄數量,不如分開看:日誌里蜘蛛的到達量和狀態碼分布、sitemap 里被實际訪問的比例,以及索引狀態中“已發現未抓取”與“已抓取未索引”各自的數量變化。前面的數字反映發現和抓取是否顺畅,後面的數字才反映内容层面的取舍。几項一起看,更容易判断問题出在哪一段。