網站收錄

收錄率算不准,先看分母:哪些 URL 本来就不该參與統計

統計收錄率之前,先要确定分母。參數頁、站内搜尋结果、測試目錄、已下架的舊地址如果都算進去,得到的比例無法反映真實情况。本文按 URL 意图分成必须收錄、可選收錄和應当排除三類,给出剔除干扰項的核對顺序,並說明剔除之後如何按模板定位差异。

網站收錄

收錄率算不准,先看分母:哪些 URL 本来就不该參與統計

很多站長把“收錄率”当作站点健康的体温計,但真正能說明問题的前提是:分母要定得對。如果把參數頁、站内搜尋结果、測試目錄、已下架的舊地址全都算進去,得到的比例既不能反映内容质量,也没法用来指導改版。先把分母定清楚,再去看差在哪。

一、先分清三類 URL 的意图

同一個站点里,URL 並不是生来平等的。按“是否希望它出現在搜尋结果里”可以先粗分成三類。

  • 必须收錄:有獨立主题的詳情頁、稿件頁、商品頁、問答頁等,用戶會直接搜尋到它們。
  • 可選收錄:栏目頁、标簽頁、分頁列表。是否保留取决于它本身有没有獨立價值,比如是否有獨特的内容摘要與描述。
  • 不该參與統計:站内搜尋结果、篩選參數组合、跟踪參數、測試目錄、已下架頁、後台與接口地址。

這三類的處理方式完全不同。統計收錄率时,只有第一類和明确保留的第二類應当進入分母。

二、把不该統計的 URL 先剔出去

常见的干扰項有几類,剔除时按下面的顺序核對,能省下很多解释成本。

  1. 被 robots.txt 屏蔽或带 noindex 的目錄,本身就不指望收錄。
  2. 跳轉鏈里的舊地址,比如 301 指向新頁的舊 URL,属于迁移痕迹。
  3. Sitemap 中已经刪除、但抓取日誌里仍有记錄的 URL。
  4. 带 session、ref、排序、篩選等參數的同义頁面。
  5. 已经返回 404 / 410 的歷史地址。

三、剔除之後再看差在哪

分母干净了,剩下的差异才有分析價值。此时建议按模板而不是按單個 URL 去看,因為同一模板的頁面通常共享同一套問题。

1. 抓取正常但没進索引

先確認頁面是否被判定為低價值或重复,再检查 canonical 是否指向了別的地址、正文是否主要靠 JavaScript 渲染。

2. 抓取都很少

這類問题通常不在内容,而在發現路径:内鏈深度太深、列表頁没有把詳情頁鏈出去、Sitemap 更新滞後,都會让頁面長期停在“已發現”狀態。

3. 收錄後又被移除

多见于空壳頁或内容大量重复的頁面。可以對照同一模板中仍然保留索引的样本,看差异集中在正文長度、结构化信息還是模板区域。

收錄率不是越高越好,而是“该收錄的那部分是否稳定收錄”。把不该收錄的頁面硬塞進統計,只會让數字變好看或變难看,却解决不了真實問题。

四、把分母固定下来,再做長期對比

建议给站点维護一份简單的 URL 分层清單:按目錄和模板归档,标出“必须收錄”“可選”“排除”三種狀態,並让 Sitemap、robots、canonical 三處保持一致。這样每次統計时,分母是可复現的,相邻两次的資料才有可比性。

当分母稳定、样本固定之後,再去看抓取频率、索引狀態和頁面质量之間的對應關系,會比單纯盯一個百分數有用得多。