網站收錄

站点規模變大之後收錄變差:先分清抓取跟不上還是质量被稀释

小站点几乎發一篇收一篇,規模上去之後收錄率反而下降。本文把原因拆成四层:新增 URL 速度是否超過抓取速度、頁面入口是否變深變少、批量生成的頁面是否稀释了整体质量、重复與近重复是否變多,並给出先收敛 URL、再理顺入口的處理顺序。

網站收錄

站点規模變大之後收錄變差:先分清抓取跟不上還是质量被稀释

站点還小的时候,几十上百個頁面,發一篇收一篇,很容易让人以為收錄是預設结果。等到栏目變成十几個、URL 涨到几萬,同样的更新节奏下,新頁面被收錄的比例反而往下掉。這通常不是蜘蛛突然變懒,而是站点自身的變化没有被處理。

第一层:新增 URL 的速度超過了抓取速度

蜘蛛在同一站点上的抓取频次,受站点体量、更新节奏、服務器响應速度以及歷史抓取表現影响。当每天新增的 URL 數量長期高于被抓取的數量,未抓取的队列就會越积越長,表現出来就是“已發現但尚未抓取”的比例上升,而站長看到的只是“收錄變慢了”。

  • 把近 30 天新增的 URL 數量,和服務器日誌中蜘蛛抓取的 URL 數量做個對比,看是否長期入大于出。
  • 看新頁面從出現在站点地图到第一次被抓取,間隔是否在拉長。
  • 看抓取是集中在少數几個栏目,還是按大致比例分散到各栏目。

一個常见的错誤做法是:一次性把上萬條 URL 推到站点地图或提交接口里。抓取节奏並不會因為提交量骤增而等比提升,更稳妥的方式是分批推進,让新增速度和被抓取的速度大致匹配。

第二层:頁面入口變深、變少

站小的时候,所有頁面首頁几步就能点到;站大了之後,新頁面往往只挂在列表頁第七頁,或者某個标簽頁下面,甚至只有站内搜尋才找得到。對蜘蛛来说,入口深度和入口數量直接决定了它會不會走到那里。

  • 需要点击超過三层才能到達的頁面,被抓取的概率明顯偏低。
  • 分頁列表越翻越深,後面的條目几乎没有外部入口。
  • 只在篩選结果里出現的參數组合頁,等于没有稳定入口。

處理方向是给重要栏目保留固定、浅层的入口,控制列表分頁的深度,並確認没有只靠參數篩選才能到達的頁面。入口理顺之後,再谈内容才有意义。

第三层:批量生成的頁面稀释了整体质量

規模上去之後,很多站点會批量生成标簽頁、地区頁、參數组合頁。這些頁面單獨看不一定差,但數量占比一大,站点整体的可抓取價值就被摊薄了,重要頁面也會跟着受影响。

判断标准可以简單一点:這個頁面如果被用戶從搜尋结果点進来,會不會觉得它确實在回答自己的問题?如果答案是否定的,就不该指望它能稳定被收錄。
  • 空标簽頁、只有一两條内容的聚合頁。
  • 同一個商品或文章的不同排序參數頁。
  • 内容几乎相同的多語言頁或多城市頁。

顺序是先收敛、再優化:不值得獨立成頁的就合並或加 noindex,剩下确實值得獨立的,再逐個补信息密度。

第四层:重复與近重复變多

站点變大後,同一份内容经常存在多個版本:列表頁與詳情頁、PC 與移動、带參數與不带參數、协议或域名迁移的残留。這些版本互相竞争,會稀释入口的價值,也让站長难以判断真實的收錄情况。

  • 先统一 URL 規范:协议、域名、大小寫、尾斜杠。
  • 用 canonical 指向主版本,並確認它指向的 URL 确實返回 200。
  • 内鏈只指向主版本,不要让不同入口指向不同版本。

處理顺序:先做减法,再做加法

  1. 先减:把不该被收錄的 URL 收敛掉,减少分母里的無效部分。
  2. 再理入口:確認重要頁面都有稳定、浅层的内鏈入口。
  3. 看抓取:對照日誌,確認抓取量和新 URL 出現速度是否匹配。
  4. 最後补内容:對留下来的頁面逐個提高信息密度。

顺序反了會很累:内容還没补完就去扩入口,只會让更多薄頁面進入抓取队列,把有限的抓取配額分走。

一條自查清單

  • 新增 URL 數與抓取 URL 數的比值是否健康。
  • 重要頁面是否能在三次点击内到達。
  • 聚合頁、參數頁在整体 URL 中占多大比例。
  • 同一内容是否存在多個可訪問版本。
  • 收敛動作是否已经在日誌里体現出效果。

收錄是過程指标,不是開關。站点規模變化之後,先弄清是抓取跟不上,還是质量被稀释,再决定動手方向,通常比反复提交 URL 更有效。