做收錄检查时,最常见的做法是看一個總比例:站点地图里有多少 URL,索引里有多少 URL。這個數字有參考價值,但它是一個平均數。好模板和坏模板混在一起时,坏的那部分很容易被稀释掉。比如文章詳情頁九成能收錄,商品篩選頁只有百分之几,整站算下来還有七八成,看起来“還行”,實际上一整類頁面在持續浪費抓取。
先分组,再看比例
比較實用的做法,是按頁面模板把 URL 分成几组,每组單獨看。分组维度可以包括:URL 路径特征、頁面類型、是否带參數、内鏈层級、首屏是否依赖 JS 渲染。分组之後往往會發現,問题集中在某一两组,而不是均匀分布。
分组後常见的三種结论
- 整组几乎都不收錄:大概率是模板級問题,和單篇内容關系不大。
- 整组收錄忽高忽低:多见于内容量差异大、内鏈位置不固定的模板,比如标簽聚合頁。
- 只有少數頁面不收錄:更可能是單頁問题——内容太薄、與已有頁面高度重复,或被某條規則排除。
区分這两類問题很重要,因為處理方式完全不同。模板級問题改一次模板就能覆盖成百上千個 URL,單頁問题只能逐頁看。
模板級問题,通常是這几類原因
1. 頁面之間重复度太高
篩選頁、标簽頁、分頁、排序參數頁最容易出現這種情况:換個條件,正文几乎没變,标题和描述也是模板套出来的。這類頁面會被大量抓取,但進入索引的價值很低。判断方法很简單:随机抽几個 URL,把正文提取出来對比,如果差异只有十几二十個字,基本可以確認。
2. 正文在頁面里的占比過低
導航、推荐位、广告、评论区把正文挤到很後面,或者首屏几乎全是模块。抓取工具能拿到 HTML,但很难判断這個頁面的主体信息是什么。
3. 抓取入口太深,或者内鏈太少
先把抓取和收錄分開看:翻蜘蛛日誌,確認這一類 URL 到底有没有被抓過。没抓過,是發現和調度的問题;抓過多次仍不進索引,才是頁面质量或規則的問题。两者的處理方向完全相反。
4. URL 變体没收敛
大小寫、尾斜杠、排序參數、追踪參數,都可能让同一個頁面裂成多個地址。這些變体會互相分散信号,也让人难以判断哪個是主版本。同一類頁面尽量保持一種 URL 形態。
5. 渲染依赖過重
如果正文只有 JS 执行後才出現,而渲染环节又出了問题,抓到的 HTML 就是空壳。判断时可以看抓取工具拿到的原始 HTML 里有没有正文,而不是只看浏览器里的效果。
建议的排查顺序
- 按模板分组,算出每组的收錄比例,找出異常的那一两组。
- 對異常组先查日誌:有没有被抓,抓的是哪種 URL 形態。
- 抓過但不收,就看頁面本身:正文長度、與同類頁面的重复度、原始 HTML 里有没有内容。
- 再查規則:robots、noindex、canonical 是否在模板层面统一指向了別處。
- 改完模板後留出一個观察周期,再看這一组的變化,而不是盯全站總數。
整站收錄率适合做趋势观察,不适合用来定位問题。真正有價值的信息,往往藏在某個具体模板的那一组資料里。
一個容易被忽略的点
分组統計不需要很复杂的工具。把站点地图或日誌里的 URL 按路径前缀導出,用表格做一次简單归類,就能看出明顯差异。關键是养成“按類型看”的习惯,而不是每次都被一個總數带着走。
另外,不是所有低收錄的模板都需要救。有些頁面的定位本来就是供站内浏览使用,不進入索引並不會带来损失,把它們挡在索引之外反而更干净。分组之後要做的第一件事,是先判断這一组應不應该進索引,再去解决為什么没進。