網站收錄

收錄數量虚高的那些来源:索引膨胀该按什么顺序收敛

site 查询數字很大,不代表收錄健康。參數组合、深度分頁、标簽归档、域名與大小寫變体,都會把低價值 URL 塞進索引。本文讲怎么判断是否已经膨胀、從源头到移除的收敛顺序,以及收錄數下降之後该盯哪些指标。

網站收錄

收錄數量虚高的那些来源:索引膨胀该按什么顺序收敛

收錄數字往上走,很多时候並不代表站点在變好。当索引里塞進大量低價值 URL,真正重要的頁面反而可能排不上队去抓取和评估,這就是常说的索引膨胀。它不會立刻带来惩罚,但會慢慢消耗站点的抓取预算,也让後續的收錄判断變得模糊。

先把“收錄多”和“收錄好”分開

site 查询看到一個很大的數字,第一反應如果是“還行”,就容易漏掉問题。索引里的 URL 數量只是一個口径,它不区分頁面重要程度。一個只有几十頁核心内容的站点,索引里躺着几千條參數 URL,本质上不是资产,而是负担。

這里還要重复一個容易混的点:被抓取不等于被索引,被索引也不等于有展示。收敛的目标不是把數字压到某個阈值,而是让索引里留下的 URL,尽量都是你愿意让人看到的那一批。

索引膨胀常见的几個来源

  • 篩選、排序、價格区間等參數组合生成的 URL,尤其是可以無限翻頁的那種。
  • 分頁列表的第 N 頁,頁碼越深,内容重复度越高,單獨看几乎没有價值。
  • 标簽頁、作者頁、日期归档頁,單頁内容單薄,但數量可以轻易過千。
  • 站内搜尋结果頁被内鏈或外鏈放出来之後,被蜘蛛顺着抓走。
  • 測試域名、舊版本目錄、www 與非 www、http 與 https 的變体没有做归一。
  • 大小寫、结尾斜杠、session id 等同一頁面的多種寫法各自進了一份索引。

怎么確認自己是不是已经膨胀了

不用把全站都翻一遍,抽样就够了。從索引里随手抽 50 到 100 條 URL,逐條問一句:這個頁面如果出現在搜尋结果里,我會不會觉得尴尬?如果尴尬的比例超過两三成,基本可以確認有膨胀。

  • 看服務器日誌,蜘蛛大部分時間抓的是不是參數頁和归档頁。
  • 看索引狀態分布,是否有大量頁面停在“已抓取,尚未编入索引”。
  • 把 sitemap 里的 URL 和索引里的 URL 做一次對比,看差集長什么样。
  • 看内鏈,低價值 URL 是不是從導航、侧栏、正文里被大量引用。

收敛的顺序:先堵源头,再谈移除

  1. 先堵源头。内鏈、sitemap、對外投放的連結,不要再指向低價值 URL。源头不断,後面清多少都會長回来。
  2. 再统一規范。能归一的用 301 归一,同一份内容的多種寫法用 canonical 指向主版本,參數規則在服務端或 CDN 层做统一處理。
  3. 控制抓取。确實不需要被訪問的路径,可以用 robots.txt 屏蔽。但要留意,被屏蔽的頁面蜘蛛看不到頁内指令,所以別指望用 noindex 去配合它。
  4. 明确移除。确定要下线的頁面返回 404 或 410;還需要保留但不该進索引的,用 noindex。整批處理比零散處理更容易观察效果。
  5. 持續观察。索引更新是分阶段的,给它几周到几個月,看日誌里核心頁的抓取频次有没有上来。

几個容易踩的坑

  • robots 屏蔽和 noindex 混用,结果两邊都不生效。
  • canonical 指向了一個 404 或重定向鏈上的地址,等于没指。
  • 為了压數字一刀切,把本来還有搜尋需求的辅助頁一起誤伤。
  • 把收錄數当成唯一 KPI,忽略了核心頁的抓取频次和展現變化。

收敛之後,收錄數下降是正常的

清理完一段時間内,site 查询的數字大概率會掉,甚至掉得有点多。這不一定是坏事。抓取预算被释放出来之後,核心頁面的重抓間隔通常會缩短,日誌里能明顯看到變化。真正要盯的是核心頁的索引狀態、展現量和点击,而不是那個總數。

收敛是個慢過程,規則定清楚、执行保持一致,比追求短期數字變化更重要。任何一方都無法保證具体的處理時間或最终结果。