收錄相關的排查最容易绕圈,是因為把三件事混在一起看:URL 有没有被發現、頁面有没有被抓取、頁面有没有進入索引。它們是先後關系,前一步没通,後面做多少優化都不會有變化。把鏈路拆成三段,問题通常很快就能定位到具体环节。
一、發現:蜘蛛是否知道這個 URL 存在
發現是收錄的起点。一個 URL 如果從来没出現在蜘蛛能讀到的地方,它连抓取的机會都没有。常见入口有這几類:
- 站内連結:首頁、栏目頁、相關推荐、上一頁下一頁,都能把路径和權重传下去。孤岛頁面通常排在最末位。
- 站点地图:sitemap 解决的是“知道有這條 URL”,不等于“马上會抓”,也不保證收錄。
- 外部連結:能带来發現机會,但抓取频次和優先級仍由站点自身情况决定。
- 其他入口:RSS、结构化資料、提交接口,作用都是同一件事——让 URL 進入待抓取队列。
核對動作:把目标 URL 放進 sitemap,同时确保站内至少有一條可点击路径指向它。两種入口都没有时,先补入口,再谈抓取。
二、抓取:蜘蛛来了,拿到的响應對不對
日誌里出現蜘蛛不代表抓取成功。需要確認的是返回狀態、内容是否完整、有没有被拦截。常见断点:
- 狀態碼:5xx 會让蜘蛛暂时放弃,429 代表請求過密,两者處理方式不同,前者查服務,後者查频次。
- robots.txt:Disallow 直接挡在抓取之前,頁面即使有内鏈也進不来。
- 渲染:内容由前端异步加载时,要確認抓取端拿到的是完整正文還是空壳。
- 响應速度與体积:長時間不返回或体积過大,可能被中途放弃。
這一段的结论只能来自日誌或抓取工具里的實际响應,而不是頁面在浏览器里打開正常。
三、索引:被抓取了為什么還是不進索引
抓取成功只是拿到了内容,是否建索引還要看頁面值不值得單獨存在。常见原因:
- 信息增量不足:正文太薄、模板占比過高,或與站内其他頁高度相似。
- 重复版本:參數、大小寫、协议、尾斜杠造成多份副本,索引只會保留其中代表版本。
- 指令冲突:meta robots、canonical、HTTP 头之間给出不一致的信号。
- 頁面類型本身不适合單獨收錄:篩選组合頁、站内搜尋结果頁、空列表頁。
抓取成功不等于收錄,收錄也不等于有排名。三者是三道獨立關卡,分別對應入口、可訪問性和頁面價值。
四、建议的核對顺序
- 確認目标 URL 至少有一個内鏈入口,並已進入 sitemap。
- 在日誌中確認该 URL 有過抓取請求,且狀態碼為 200。
- 核對 robots.txt 與 meta robots,排除指令层面的阻断。
- 對比抓取端拿到的正文與頁面實际展示是否一致。
- 检查重复版本與内容厚度,判断它是否具备獨立收錄的價值。
按這個顺序走,大多數“不收錄”都能落到某一环上。接下来只需针對那一环做具体處理,而不是反复提交、反复改标题。