網站收錄

整站收錄上不去:先分清是站点級問题還是頁面級問题

收錄率長期偏低时,逐頁排查往往效率不高。抓取和索引是两個层面的判断:抓取意愿更多取决于站点,能否入索引才落到頁面。本文给出把两者拆開看的方法,以及從 URL 總量、無效頁面、内容区分度到内鏈的自查顺序,帮你判断该修站点還是修頁面。

網站收錄

整站收錄上不去:先分清是站点級問题還是頁面級問题

收錄這件事,很多人习惯一頁一頁去查。但如果整站收錄率長期偏低,逐頁排查往往效率不高——因為問题可能根本不在單個頁面上。

抓取和索引是两套判断。爬虫愿不愿意来、愿不愿意抓,更多是站点层面的结果;抓到之後编不编入索引,才落到頁面层面。把這两层混在一起看,很容易把站点問题当成頁面問题反复折腾。

先看比例,再看绝對數

已收錄數量本身說明不了什么。一個 500 頁的站收錄 300 頁,和一個 5 萬頁的站收錄 3 萬頁,前者的問题通常更值得先處理。

  • 已提交的 URL 數 對比 實际被發現的 URL 數
  • 被發現的 URL 數 對比 被抓取的 URL 數
  • 被抓取的 URL 數 對比 编入索引的 URL 數

每一段落差對應的原因不一样。發現多、抓取少,問题多半在站点;抓取多、索引少,問题更可能在頁面。

站点級問题的常见表現

抓取量被無效 URL 吃掉

參數頁、篩選頁、日歷頁、站内搜尋结果,這類 URL 數量容易在短時間内膨胀。爬虫的抓取量是有限的,被這些頁面占满之後,真正需要收錄的内容頁反而排不上队。

整体质量评價偏低

搜尋引擎對站点有一個整体判断。当站内大量頁面内容稀薄、模板高度雷同、或者主要靠拼凑整合而成时,這個判断會影响到新頁面的收錄速度,即使新頁面本身做得不错。

單頁质量决定它值不值得被收錄,站点质量影响它多快被考虑到。两者不是替換關系。

怎么区分是站点問题還是頁面問题

一個简單的办法:拿站内几個结构、内容深度都正常的老頁面,看它們的收錄狀態。

  • 老頁面收錄正常,只有新頁面進不去,更可能是抓取节奏或新頁面自身的問题
  • 老頁面也開始掉,或者一直没收全,更可能是站点层面的問题
  • 同類模板的頁面收錄情况高度一致,說明模板层面有共性問题
  • 表現零散、没有規律,逐頁看反而更有效率

自查顺序

  1. 先用站点地图和日誌,把發現、抓取、索引三段資料分開看,不要混着判断。
  2. 確認 robots.txt、noindex、canonical 没有拦住不该拦的頁面。
  3. 統計站内 URL 總量,看看有多少是參數、排序、篩選這類低價值頁面,该收敛的收敛。
  4. 抽查内容頁的正文是否有實质性差异,模板重复度過高的部分考虑合並或改寫。
  5. 再看内鏈:重要頁面是否還有足够入口,层級是否過深。

這個顺序的逻辑是先排除被挡住和被稀释两種情况,再去動頁面本身。反過来做,很容易在頁面上改了一轮,站点结构的問题仍然摆在那里。

不要指望一步到位

站点层面的信号調整,见效周期通常以月計,而且不會因為做對一件事就立刻改變。與其盯着收錄數字每天波動,不如把注意力放在 URL 總量是否收敛、内容是否有区分度這两件事上。

另外,收錄數量也不是越多越好。一批本身没有检索價值的頁面進了索引,對整站未必是加分項。该收的收全,不该收的挡在外面,這個平衡比單纯追求數量更有意义。