發現、抓取、收錄是三件不同的事
很多运营把“提交了 Sitemap”和“蜘蛛来了”画等号,其實中間隔着至少三個环节:蜘蛛在某個頁面或 Sitemap 里讀到你的 URL(發現),把它放進待抓队列並實际發起請求(抓取),最後评估内容质量决定是否放入索引(收錄)。每一步都可能断掉,而断点不同,處理方式也完全不同。
發現只是拿到了地址,抓取才是真正讀了頁面,收錄是另一场评估。三者混在一起看,就容易得出“提交没用”的错誤结论。
先看服務器日誌:最硬的證據
日誌是唯一能證明蜘蛛真的来過的東西。按下面的字段筛一遍,通常十分钟就能看清狀態:
- UA 里带 Googlebot、Bingbot 等标识的請求,按時間倒序看最近几天;
- 目标 URL 是否出現過 200,還是被 301、404、503 拦住;
- 同一個 URL 被訪問的次數和間隔,判断是偶尔路過還是已经進入常規抓取;
- 返回体大小是否正常,返回 0 字节往往是超时或服務端中断。
如果日誌里完全没有目标地址,說明問题還停在發現环节,重点應放在内鏈、Sitemap 和入口頁面,而不是急着去改頁面本身。
後台資料做交叉驗證
站長工具里的抓取統計、已發現但未抓取的 URL 數量、URL 检查工具的單條測試,可以和日誌互相印證。注意几点:統計有延迟,通常滞後一两天;URL 检查工具發起的是實时抓取,它成功不代表常規抓取队列已经排上;“已發現未抓取”本身是一個會長期存在的狀態,少量正常,持續增長才需要警惕。
主動提交能缩短哪一段等待
Sitemap 提交、IndexNow、站長工具的單個 URL 提交,解决的都是“發現”這一段,让蜘蛛更快知道地址存在,它們替代不了抓取和收錄判断。一個常见誤区是:頁面本身返回 503,或者内容需要登入才能看到,却反复提交几十次,结果每次抓取都失敗,反而拉低了整站的抓取效率。
提交之後没動静,通常卡在這几處
- 入口頁面本身没被抓過,内鏈再合理也走不到目标頁;
- Sitemap 里的 URL 與實际可訪問地址不一致,比如带了跟踪參數或大小寫不同;
- 服務器對蜘蛛的响應時間明顯長于普通用戶,抓取被超时打断;
- 同一批新 URL 一次抛出太多,超出了目前站点能拿到的抓取額度。
一套可复用的检查顺序
- 確認地址本身返回 200,且内容不是空壳或跳轉頁;
- 在站内找到一條真實可点击的連結指向它,检查是否被 nofollow 或脚本阻断;
- 查日誌,確認蜘蛛是否訪問過入口頁和目标頁;
- 對比後台“已發現未抓取”的趋势,判断是排队還是被卡住;
- 若長期無動静,優先检查服務器稳定性和响應速度,再考虑内鏈层級是否需要提浅。
把這套顺序固定下来,你會發現大部分“URL 不被抓取”的問题並不神秘,只是环节搞混了。發現靠連結和 Sitemap,抓取靠服務器和額度,收錄靠内容本身,三者分開排查,效率會高很多。