網站收錄

抓取预算被谁吃掉了:收錄上不去时先排查這几類 URL

收錄停滞时,很多站長第一反應是繼續提交更多頁面,但搜尋引擎每天的抓取次數大致有限,站内可抓的無效 URL 越多,好頁面分到的比例就越小。這篇文章從日誌入手,讲清哪些 URL 在消耗抓取量、如何做减法,以及腾出来的预算该留给谁。

網站收錄

抓取预算被谁吃掉了:收錄上不去时先排查這几類 URL

很多站点收錄上不去,第一反應是「提交得還不够多」,于是繼續加頁面、加栏目、加參數组合。但如果搜尋引擎每天来抓的次數大致固定,站内可抓的 URL 却翻了几倍,新頁面反而更难排上队。這篇文章讲的是:在收錄停滞时,先把被浪費掉的抓取次數找回来。

抓取预算不是玄学,就是有限的訪問次數

搜尋引擎對每個站点分配的抓取量,取决于站点体量、响應速度、内容更新频率和整体质量。它不是一個可以申請調高的固定配額,而是一個動態估算值:站点响應越快、返回的有效内容越多,這個值通常越容易往上走。

關键在于,抓取量分给谁由算法决定,但站内存在多少「可抓但没價值」的 URL,是由我們自己决定的。無效 URL 越多,正文頁分到的比例就越小。

先看日誌:抓取量被哪几類 URL 吃掉了

把最近一個月的服務器日誌按狀態碼、路径規則、抓取频次做一次聚合,通常會看到下面几類占了大头。

带參數的篩選與排序

排序方式、價格区間、颜色尺碼等參數组合,動辄生成成百上千個 URL。它們内容高度相似,却每次都要占用一次抓取和一次渲染。

已经失效的歷史 URL

改版、下架、栏目調整後留下的地址,如果一直返回 200 的空壳頁或 302 到首頁,蜘蛛會反复回来確認。持續的無效抓取比直接报错更浪費。

重定向鏈與跳轉中間頁

一個地址跳三次才到最终頁面,中間每個环节都可能被單獨抓取。鏈條越長,浪費越明顯。

内容几乎相同的列表頁

标簽、归档、日期、作者等自動列表頁,如果彼此内容差异很小,又都在站内互相連結,也會形成一轮轮重复抓取。

做减法的三個動作

  1. 屏蔽没有獨立價值的參數组合。用 robots.txt 或站内規則限制篩選、排序類參數,但要注意別把带參數的正文頁一起屏蔽掉,那會直接把可收錄内容挡在门外。
  2. 失效地址直接返回 404 或 410。不要让已经不存在的頁面長期 302 到首頁,也不要用 200 返回一個「内容不存在」的空頁。
  3. 收窄自動列表頁的入口。對分頁、篩選、归档類頁面,選擇 noindex 或减少站内連結暴露,避免它們和正文頁争夺同一份抓取量。

腾出来的预算留给谁

做减法不是目的,把抓取量轉移到真正需要收錄的頁面上才是。

  • 新發布且内容完整的正文頁。
  • 需要更新舊版本信息的核心頁面,這類頁面重新抓取後往往能直接刷新搜尋结果。
  • 有站内入口或站外連結支撑、但長期停留在「已發現未编入索引」的頁面。

如果顺序反過来,先把预算花在低價值頁面上,正文頁就只能排队。

两個容易踩的誤区

第一,蜘蛛来訪次數變多,不等于收錄會變快。日誌里抓取量上涨,可能只是它在反复確認一批無效 URL,正文頁的抓取次數並没有變化。

第二,屏蔽參數不等于屏蔽參數頁上的内容。很多正文頁本身带參數,屏蔽前務必先用少量 URL 測試,確認不會誤伤。

怎么判断有没有效果

調整之後,不要只看「收錄總量」這一個數字,而是观察两項结构變化:日誌里正文頁抓取占比是否上升,以及「已發現未编入索引」的數量是否在下降。這两項通常需要两到四周才能看出趋势,短期的波動說明不了什么。收錄本质上是抓取、内容质量和站内结构共同作用的结果,把無效抓取减下去,只是把机會腾出来,並不能保證每個頁面都被收錄。