在站点运营里,“搜尋蜘蛛来過”和“頁面被收錄”是两件事。日誌里出現目标 URL 的抓取记錄,只能說明蜘蛛取回過這個地址,至于放不放進索引,還要看頁面本身和站点整体情况。下面按排查顺序整理几個常见原因。
先確認抓取的是不是目标 URL 本身
日誌里经常混着入口頁、带參數版本、重定向中間地址。先看三点:
- 請求的 URL 是否和目标頁面完全一致,包括协议、域名、路径和结尾斜杠。
- 返回狀態碼是不是 200,内容是不是目标頁面的正文,而不是驗證頁、跳轉頁或空模板。
- 蜘蛛 UA 是否真實。伪装蜘蛛的爬虫很多,必要时用反向 DNS 或公開 IP 段核對。
如果蜘蛛抓的是 301/302 中間地址,或者只抓了入口頁没有跟到目标 URL,那問题在 URL 發現环节,不在收錄判断。
頁面层面:這些設定會直接挡住收錄
抓取正常但没收錄,先查頁面头信息和正文:
- meta robots 或 X-Robots-Tag:出現 noindex 时,蜘蛛仍可能抓取,但不會索引。確認没有誤加。
- canonical:如果 canonical 指向另一個 URL,目前頁面會被当作重复版本。检查是不是寫错或模板统一輸出。
- 狀態碼:4xx、5xx、软 404 都會影响。返回 200 但正文是错誤提示,也属于软 404。
- 正文质量:内容太薄、拼接明顯、和站内其他頁面高度相似,搜尋系統可能抓了但不收。
- JS 渲染:重要内容只在客戶端渲染,而蜘蛛没有执行或执行不完整时,看到的是空壳。
可以用 URL 检查工具看“已抓取”和“已编入索引”分別是什么狀態,比只看日誌更直接。
URL 层面:重复版本和參數會分散信号
同一個目标 URL 如果存在多個可訪問版本,比如 http 和 https、带 www 和不带 www、带跟踪參數和不带參數,搜尋系統需要先做归一。常见表現是抓取次數不少,但收錄的是另一個版本,或者干脆不展示。
- 用 301 把非首選版本统一跳轉到首選版本。
- 站内連結、sitemap、canonical 尽量保持同一個 URL 寫法。
- 跟踪參數能不用就不用,必须用时不要作為主要入口。
站点和入口頁层面:抓取预算與信任度
如果目标 URL 在蜘蛛池入口頁里,入口頁本身的质量也會影响蜘蛛愿不愿意繼續跟。入口頁如果内容空洞、連結數量異常、大量跳轉到低质頁面,蜘蛛可能降低抓取频率。這时候目标 URL 不是“不被收錄”,而是“還没被稳定抓取”。
可以做的動作:
- 先保證入口頁能正常訪問,返回 200,有基本正文和清晰的連結。
- 把目标 URL 放進 sitemap,並保持 sitemap 與實际連結一致。
- 给目标 URL 增加站内正常入口,不要只靠單一入口頁。
- 观察一段時間日誌,確認蜘蛛抓的是最终 URL,而不是跳轉鏈或參數版本。
抓取和收錄都有延迟,不同站点、不同頁面差异很大。不要因為一两天没收錄就反复改 URL、重复提交或堆入口頁,這反而會让信号更乱。
排查顺序建议
可以按這個顺序走:日誌確認目标 URL 被抓取 → 狀態碼和正文是否正常 → meta robots / canonical 是否有誤 → 是否存在重复版本 → 内容是否足够獨立 → 内鏈和 sitemap 是否指向同一地址 → 最後再看站点整体抓取情况。每一步只改一個變量,方便對比。
如果這些检查都正常,剩下的就是等待搜尋系統自己判断。收錄不是提交或抓取後必然發生的结果,能做的是把阻碍因素排除掉,让頁面具备被收錄的條件。