發現、抓取、索引是三件不同的事
很多人把“提交了 URL”当成收錄的第一步,其實在這之前還有一段更長的鏈路:蜘蛛要先發現這個 URL,再决定去抓取,抓回来之後才谈得上索引。這三步各有各的失敗方式,混在一起看,就容易得出“提交没用”或“蜘蛛不抓我”這類模糊结论。
把三個环节拆開,排查才有落点:發現失敗通常是入口問题,抓取失敗多半是服務器或抓取額度問题,索引失敗則一般要回到頁面内容本身。
蜘蛛發現新 URL 的几條常见路径
- 站内連結:最常见的路径。首頁、栏目頁、文章相關推荐里如果都通不到,這個 URL 基本等于孤立。
- 外部連結:別人鏈過来时,蜘蛛顺着爬進来,連結所在頁面的可抓取性同样重要。
- sitemap:它声明“我這里有這些 URL”,但只是一份候選清單,既不保證被抓,也不保證被收錄。
- 推送接口:多數搜尋引擎提供主動提交入口,适合新發布或刚改過的頁面。
- 歷史抓取记錄:以前抓過的 URL 再次更新时往往會被優先回訪,所以老頁面改内容常常比全新頁面更快被看到。
“提交了”為什么還是顯示未被發現
提交只是把 URL 放進一個待處理池。真正决定它能否被發現的,是這個 URL 在站内是否有可爬到的入口、入口頁面本身是否在正常被抓取、以及整站是否處在正常的訪問狀態。如果首頁或栏目頁响應異常、robots 挡住了入口、或者大量參數頁把抓取額度消耗掉,提交的 URL 很可能長期排在後面。
提交解决的是“通知”,入口解决的是“能不能到”。很多等待,其實卡在後面這件事上。
被發現却長期不抓取,先看這几点
- 服務器返回是否稳定。超时、5xx、频繁跳轉都會降低抓取意愿。
- URL 是否重复。同一内容靠參數、大小寫、尾斜杠生成多個版本,等于自己制造了排队。
- 頁面重要性信号是否足够。没有内鏈、没有外鏈、也没有歷史資料的全新 URL,優先級自然靠後。
- 站点整体抓取是否被低價值頁面占满,導致新頁面迟迟轮不到。
抓取了却不出現在索引里
到這一步,問题基本不在入口,而在頁面本身。常见原因包括:正文内容過少或與模板比例失衡,頁面與其他 URL 高度相似,返回了 noindex,canonical 指向了別的地址,或者内容属于搜尋引擎明确不處理的類型。抓取是拿到内容,索引是判断值不值得留,两者的标准並不相同。
一個可执行的排查顺序
- 先用日誌確認蜘蛛最近是否訪問過這個 URL,以及返回的狀態碼。
- 若没有訪問记錄,就先补入口:内鏈、sitemap、相關推荐位。
- 若有訪問但狀態碼異常,先修服務器响應和跳轉鏈路。
- 若返回正常但不收錄,检查内容重复度、noindex、canonical 與模板占比。
- 以上都正常,就繼續观察,不要反复改 URL 或重复提交,频繁改動本身會重置判断。
哪些資料更有參考價值
與其盯着某一天的收錄數量,不如分開看:日誌里蜘蛛的到達量和狀態碼分布、sitemap 里被實际訪問的比例,以及索引狀態中“已發現未抓取”與“已抓取未索引”各自的數量變化。前面的數字反映發現和抓取是否顺畅,後面的數字才反映内容层面的取舍。几項一起看,更容易判断問题出在哪一段。