很多站長把“收錄率”当作站点健康的体温計,但真正能說明問题的前提是:分母要定得對。如果把參數頁、站内搜尋结果、測試目錄、已下架的舊地址全都算進去,得到的比例既不能反映内容质量,也没法用来指導改版。先把分母定清楚,再去看差在哪。
一、先分清三類 URL 的意图
同一個站点里,URL 並不是生来平等的。按“是否希望它出現在搜尋结果里”可以先粗分成三類。
- 必须收錄:有獨立主题的詳情頁、稿件頁、商品頁、問答頁等,用戶會直接搜尋到它們。
- 可選收錄:栏目頁、标簽頁、分頁列表。是否保留取决于它本身有没有獨立價值,比如是否有獨特的内容摘要與描述。
- 不该參與統計:站内搜尋结果、篩選參數组合、跟踪參數、測試目錄、已下架頁、後台與接口地址。
這三類的處理方式完全不同。統計收錄率时,只有第一類和明确保留的第二類應当進入分母。
二、把不该統計的 URL 先剔出去
常见的干扰項有几類,剔除时按下面的顺序核對,能省下很多解释成本。
- 被 robots.txt 屏蔽或带 noindex 的目錄,本身就不指望收錄。
- 跳轉鏈里的舊地址,比如 301 指向新頁的舊 URL,属于迁移痕迹。
- Sitemap 中已经刪除、但抓取日誌里仍有记錄的 URL。
- 带 session、ref、排序、篩選等參數的同义頁面。
- 已经返回 404 / 410 的歷史地址。
三、剔除之後再看差在哪
分母干净了,剩下的差异才有分析價值。此时建议按模板而不是按單個 URL 去看,因為同一模板的頁面通常共享同一套問题。
1. 抓取正常但没進索引
先確認頁面是否被判定為低價值或重复,再检查 canonical 是否指向了別的地址、正文是否主要靠 JavaScript 渲染。
2. 抓取都很少
這類問题通常不在内容,而在發現路径:内鏈深度太深、列表頁没有把詳情頁鏈出去、Sitemap 更新滞後,都會让頁面長期停在“已發現”狀態。
3. 收錄後又被移除
多见于空壳頁或内容大量重复的頁面。可以對照同一模板中仍然保留索引的样本,看差异集中在正文長度、结构化信息還是模板区域。
收錄率不是越高越好,而是“该收錄的那部分是否稳定收錄”。把不该收錄的頁面硬塞進統計,只會让數字變好看或變难看,却解决不了真實問题。
四、把分母固定下来,再做長期對比
建议给站点维護一份简單的 URL 分层清單:按目錄和模板归档,标出“必须收錄”“可選”“排除”三種狀態,並让 Sitemap、robots、canonical 三處保持一致。這样每次統計时,分母是可复現的,相邻两次的資料才有可比性。
当分母稳定、样本固定之後,再去看抓取频率、索引狀態和頁面质量之間的對應關系,會比單纯盯一個百分數有用得多。