提交成功不等于會被抓取
在後台看到 sitemap 狀態是「成功」,只說明搜尋引擎讀取了這個文件,並不代表里面每個 URL 都會進入抓取队列。提交動作解决的是「告诉對方這里有東西」,抓取與否還要看站点整体情况、抓取预算、URL 本身的质量,以及入口頁是否還在被訪問。把這两件事混在一起,很容易在错誤的方向上反复折腾。
第一层:sitemap 文件本身是否合格
- 文件是否能直接訪問,返回 200,而不是跳轉、需要登入或被 CDN 拦截;
- 编碼與格式是否正确,标簽閉合、時間格式規范,压缩文件没有损坏;
- 單文件 URL 數量是否超出建议上限,超出後應拆分並用索引文件串联;
- lastmod 是否被批量改成目前時間,長期乱寫會让這個字段失去參考價值;
- robots.txt 是否誤屏蔽了 sitemap 路径,或屏蔽了里面大量 URL。
這几項都很基础,但實际排查中占比不低。尤其是全站 lastmod 同一天更新,會让抓取端难以判断哪些是新内容、哪些只是被重新寫了一遍。
第二层:抓取预算被谁占用了
一個站点每天能被抓取的次數大致有上限。如果大量抓取被消耗在下面這些地址上,sitemap 里的新 URL 自然排不上队:
- 带各種篩選、排序、跟踪參數的頁面,同一份内容生成出無數 URL;
- 返回 404、410 或软 404 的舊地址;
- 需要多次跳轉才能到達目标的鏈式重定向;
- 内容几乎相同的列表頁、标簽頁、分頁尾部。
可以在日誌里統計抓取請求的分布,看抓取量集中在哪些路径上。通常不是「蜘蛛不来」,而是来了之後在原地打轉。抓取量高但集中在低價值地址上,比抓取量低更值得警惕。
第三层:URL 自身是否具备被抓的理由
即使地址被提交,抓取端也會做一轮预判:這個 URL 是否和已有内容重复,是否有實际内容,是否只是一個跳轉壳。如果 sitemap 里塞進了大量空頁面、聚合頁、無内容頁,抓取率低是正常结果。與其不断增加提交數量,不如先保證提交進去的每一個地址都能打開、有内容、能獨立成頁。
第四层:入口頁和内鏈是否還在正常工作
sitemap 是辅助手段,真實的内鏈路径仍然是發現 URL 的主要方式。需要检查入口頁是否還在被訪問、連結是否可点、是否被 nofollow 或脚本阻断。如果入口頁本身已经不再被抓取,那么挂在它下面的目标 URL 也會跟着失去被發現的机會。
做蜘蛛池或入口頁维護时,同样要注意定期检查可達性,而不是只堆數量。入口頁數量翻倍、质量却下降,往往會導致整体抓取效率變差。
建议的排查顺序
- 先確認 sitemap 可訪問、格式正确、没有批量错誤的時間戳;
- 在日誌里看抓取總量與分布,找出被浪費的地址;
- 清理參數頁、软 404、無内容頁,减少無效抓取;
- 检查入口頁與内鏈是否可達,連結是否真實存在;
- 確認新 URL 确實有獨立内容,再考虑重新提交或調整提交方式。
抓取量上升不等于收錄量上升,两者之間還隔着内容质量與去重判断。任何提交方式和工具都只能帮助發現 URL,不能代替頁面本身的價值。
多數「提交了却不抓」的情况,原因集中在抓取预算被浪費和 URL 质量不足這两点上。先把這两處處理好,再谈提交频率和入口頁數量,结果會稳定一些。