新頁面發布後迟迟没有收錄反馈时,很多人第一反應是“蜘蛛没来”。但看日誌往往會發現,蜘蛛其實一直在抓,只是把抓取机會花在了別的地方。與其反复提交 URL,不如先做一次抓取盘点:看清蜘蛛最近抓了什么、為什么抓、這些 URL 值不值得抓。
抓取预算不是一個固定數字
搜尋引擎不會给每個站点發一個額度表式的東西。更接近實际的描述是:站点能承受多少並發請求、响應有多快、内容更新频率如何,共同决定了蜘蛛在一段時間内愿意来多少趟。业内习惯把這部分抓取能力叫“抓取预算”,它没有官方口径,但拿来做排查框架是够用的。
需要提醒的是,预算並不是越多越好。让蜘蛛把時間花在低價值 URL 上,和减少抓取次數,本质上是同一件事的两種表現。
先看日誌:蜘蛛到底在抓什么
取最近一到两周的服務器日誌,篩選主流蜘蛛的 UA,把抓取 URL 按目錄和路径特征分组。重点不是總量,而是比例。
- 參數组合頁占比:带 sort、filter、page 這類參數的 URL 占了多少抓取次數。
- 分頁與列表:列表頁、翻頁頁、归档頁被抓的深度和频次。
- 重复路径:同一篇内容是否存在多個 URL 變体被反复抓取。
- 狀態碼分布:200、301、404、5xx 各占多少,响應時間集中在哪個区間。
- 新頁面:最近發布的内容有没有出現在日誌里,第一次被抓是什么时候。
別忘了拉長時間维度
只看一天的日誌容易被誤導。建议按周對比:如果總抓取量下降但新頁面抓取量没變,說明能力被压缩了;如果總量不變而參數頁占比上升,說明站内暴露的入口變多了。
常见的抓取消耗源
- 站内搜尋结果頁允许被抓,且能被外部連結或站内入口触達。
- 篩選與排序组合在列表頁上無限制生成可点击連結。
- 日歷、标簽、作者等聚合頁數量大、内容稀薄,却能無限翻頁。
- 软 404:错誤頁返回 200,蜘蛛會反复回头確認。
- 重定向鏈條:内部連結指向舊地址,跳一次才到目标頁。
- 响應偏慢:同样的並發下,能抓完的頁面數量被拖低。
- 站点地图推送里混進了大量低價值 URL,等于主動邀請抓取。
核對顺序建议
- 按目錄統計抓取分布,找出占比最高的低價值類型。
- 確認這些 URL 有没有站内入口,尤其是有没有可点击連結或站点地图條目。
- 检查服務端响應時間與错誤率,技術問题優先于内容問题處理。
- 對不需要被抓的類型,先收口入口,再考虑 robots 或 noindex。
- 處理後再观察一到两周日誌,看抓取是否向重要目錄迁移。
不要一邊在 robots.txt 里放開參數頁,一邊期待蜘蛛優先抓正文頁。入口在哪里,抓取就會跟到哪里。
處理时容易忽略的几点
第一,收口不等于屏蔽。很多參數頁是用戶正常浏览路径的一部分,動手前要確認會不會影响站内体驗。第二,lastmod 频繁變動會让蜘蛛重复回訪,站点地图里的時間最好反映真實的内容變更。第三,抓取量上升不等于收錄上升,抓得勤但頁面质量不够,依然會停在“已發現”阶段。
小结
收錄慢的时候,先別急着提高提交频率。用日誌做一次抓取盘点,把蜘蛛實际消耗掉的机會列出来,通常比盲目提交更容易定位問题。抓取结构的調整是長期活,观察周期至少以周為單位,而不是以天為單位。