抓取能力不是無限的
搜尋引擎的蜘蛛不會因為你的站点 URL 多,就無限投入资源。它在一個站点上分配的時間與請求數大致有上限,业内通常称為抓取配額或抓取预算。站点 URL 總量越大、响應越慢、低價值頁面越多,單個有價值頁面能分到的抓取次數就越少。所以当你發現新頁面迟迟不被抓取,問题往往不在“蜘蛛不喜欢這個站”,而在于抓取能力被別的東西占掉了。
哪些頁面在争夺同一份资源
同一份抓取能力,通常會被這几類 URL 分走:
- 參數组合生成的頁面。篩選、排序、分頁參數可以组合出成千上萬個 URL,内容却高度相似。
- 有效期很短的頁面。活動頁、临时专题,上线几天就下线,蜘蛛抓完就没用了。
- 重复入口。同一篇内容通過不同域名、http 與 https、带 www 與不带 www 同时開放抓取。
- 低價值的分頁和归档。一個标簽下面挂几十頁,翻到第八頁已经没人看,蜘蛛仍可能逐頁抓取。
- 站点地图里混進的废弃地址。已经 404 或重定向的 URL 還留在 sitemap 中,每抓一次就浪費一次請求。
先做减法,再做加法
想提升收錄效率,第一步往往不是催蜘蛛多来,而是让它少去没用的地方。可以按下面的顺序處理:
- 把站点 URL 拉成一張清單,按“有搜尋價值 / 有用戶價值 / 两者都没有”粗略分层。
- 對確認無價值的參數頁做收敛。robots.txt 與 noindex 效果不同:前者不让抓取,後者抓取後不進索引,要看清楚再選。
- 把 sitemap 精简到只放需要收錄的規范 URL,並保證里面的地址都能正常訪問。
- 检查内鏈是否把大量入口導向無關頁面,比如頁脚的全站标簽云。
- 確認服務器响應時間稳定,慢响應會直接压缩同样時間里蜘蛛能抓的頁數。
抓取問题與收錄問题要分開看
“蜘蛛没来”和“来了没收”是两類問题,處理手段不同。日誌里完全没有该 URL 的請求记錄,說明它還没被發現,或者被 robots 拦住了,這时要解决的是入口和可發現性;日誌里有請求、但索引里查不到,說明頁面已经被拿到,接下来是内容质量與規范层面的判断。把两件事混在一起,容易做出無效動作,比如為了催收錄反复提交同一個地址,實际並没有改變蜘蛛對頁面的评估。
几個容易被忽略的细节
- 抓取次數下降有时是正常的。重复 URL 清理干净、站点结构收敛之後,蜘蛛来的次數反而會變少,但每次抓的頁面更准。
- 新站或新目錄前期抓取慢很常见。與其频繁改動结构,不如保持稳定,持續輸出有獨立價值的頁面。
- 重要頁面應该有稳定入口,点击深度過深,在配額竞争里就會排在後面。
- 不要把“提交了 URL”等同于“已经抓取”。提交只是把地址放進待办队列,何时轮到它,仍取决于站点的整体狀態。
抓取配額這件事,能優化的部分主要是减少浪費,而不是逼蜘蛛多投入。把無效 URL 收敛干净、把入口理顺,剩下的交给内容本身。