網站收錄

被發現、被抓取、被索引:三段鏈路上最容易断的地方

收錄相關的排查,常把發現、抓取、索引三件事混在一起看。URL 是否被蜘蛛知道、抓取返回的响應是否正确、頁面是否值得單獨建索引,是三道獨立關卡。本文按這個顺序给出可执行的核對清單,帮你在出問题时快速定位卡点,而不是反复提交地图或改标题。

網站收錄

被發現、被抓取、被索引:三段鏈路上最容易断的地方

收錄相關的排查最容易绕圈,是因為把三件事混在一起看:URL 有没有被發現、頁面有没有被抓取、頁面有没有進入索引。它們是先後關系,前一步没通,後面做多少優化都不會有變化。把鏈路拆成三段,問题通常很快就能定位到具体环节。

一、發現:蜘蛛是否知道這個 URL 存在

發現是收錄的起点。一個 URL 如果從来没出現在蜘蛛能讀到的地方,它连抓取的机會都没有。常见入口有這几類:

  • 站内連結:首頁、栏目頁、相關推荐、上一頁下一頁,都能把路径和權重传下去。孤岛頁面通常排在最末位。
  • 站点地图:sitemap 解决的是“知道有這條 URL”,不等于“马上會抓”,也不保證收錄。
  • 外部連結:能带来發現机會,但抓取频次和優先級仍由站点自身情况决定。
  • 其他入口:RSS、结构化資料、提交接口,作用都是同一件事——让 URL 進入待抓取队列。

核對動作:把目标 URL 放進 sitemap,同时确保站内至少有一條可点击路径指向它。两種入口都没有时,先补入口,再谈抓取。

二、抓取:蜘蛛来了,拿到的响應對不對

日誌里出現蜘蛛不代表抓取成功。需要確認的是返回狀態、内容是否完整、有没有被拦截。常见断点:

  • 狀態碼:5xx 會让蜘蛛暂时放弃,429 代表請求過密,两者處理方式不同,前者查服務,後者查频次。
  • robots.txt:Disallow 直接挡在抓取之前,頁面即使有内鏈也進不来。
  • 渲染:内容由前端异步加载时,要確認抓取端拿到的是完整正文還是空壳。
  • 响應速度與体积:長時間不返回或体积過大,可能被中途放弃。

這一段的结论只能来自日誌或抓取工具里的實际响應,而不是頁面在浏览器里打開正常。

三、索引:被抓取了為什么還是不進索引

抓取成功只是拿到了内容,是否建索引還要看頁面值不值得單獨存在。常见原因:

  • 信息增量不足:正文太薄、模板占比過高,或與站内其他頁高度相似。
  • 重复版本:參數、大小寫、协议、尾斜杠造成多份副本,索引只會保留其中代表版本。
  • 指令冲突:meta robots、canonical、HTTP 头之間给出不一致的信号。
  • 頁面類型本身不适合單獨收錄:篩選组合頁、站内搜尋结果頁、空列表頁。
抓取成功不等于收錄,收錄也不等于有排名。三者是三道獨立關卡,分別對應入口、可訪問性和頁面價值。

四、建议的核對顺序

  1. 確認目标 URL 至少有一個内鏈入口,並已進入 sitemap。
  2. 在日誌中確認该 URL 有過抓取請求,且狀態碼為 200。
  3. 核對 robots.txt 與 meta robots,排除指令层面的阻断。
  4. 對比抓取端拿到的正文與頁面實际展示是否一致。
  5. 检查重复版本與内容厚度,判断它是否具备獨立收錄的價值。

按這個顺序走,大多數“不收錄”都能落到某一环上。接下来只需针對那一环做具体處理,而不是反复提交、反复改标题。