收錄這件事,很多人习惯一頁一頁去查。但如果整站收錄率長期偏低,逐頁排查往往效率不高——因為問题可能根本不在單個頁面上。
抓取和索引是两套判断。爬虫愿不愿意来、愿不愿意抓,更多是站点层面的结果;抓到之後编不编入索引,才落到頁面层面。把這两层混在一起看,很容易把站点問题当成頁面問题反复折腾。
先看比例,再看绝對數
已收錄數量本身說明不了什么。一個 500 頁的站收錄 300 頁,和一個 5 萬頁的站收錄 3 萬頁,前者的問题通常更值得先處理。
- 已提交的 URL 數 對比 實际被發現的 URL 數
- 被發現的 URL 數 對比 被抓取的 URL 數
- 被抓取的 URL 數 對比 编入索引的 URL 數
每一段落差對應的原因不一样。發現多、抓取少,問题多半在站点;抓取多、索引少,問题更可能在頁面。
站点級問题的常见表現
抓取量被無效 URL 吃掉
參數頁、篩選頁、日歷頁、站内搜尋结果,這類 URL 數量容易在短時間内膨胀。爬虫的抓取量是有限的,被這些頁面占满之後,真正需要收錄的内容頁反而排不上队。
整体质量评價偏低
搜尋引擎對站点有一個整体判断。当站内大量頁面内容稀薄、模板高度雷同、或者主要靠拼凑整合而成时,這個判断會影响到新頁面的收錄速度,即使新頁面本身做得不错。
單頁质量决定它值不值得被收錄,站点质量影响它多快被考虑到。两者不是替換關系。
怎么区分是站点問题還是頁面問题
一個简單的办法:拿站内几個结构、内容深度都正常的老頁面,看它們的收錄狀態。
- 老頁面收錄正常,只有新頁面進不去,更可能是抓取节奏或新頁面自身的問题
- 老頁面也開始掉,或者一直没收全,更可能是站点层面的問题
- 同類模板的頁面收錄情况高度一致,說明模板层面有共性問题
- 表現零散、没有規律,逐頁看反而更有效率
自查顺序
- 先用站点地图和日誌,把發現、抓取、索引三段資料分開看,不要混着判断。
- 確認 robots.txt、noindex、canonical 没有拦住不该拦的頁面。
- 統計站内 URL 總量,看看有多少是參數、排序、篩選這類低價值頁面,该收敛的收敛。
- 抽查内容頁的正文是否有實质性差异,模板重复度過高的部分考虑合並或改寫。
- 再看内鏈:重要頁面是否還有足够入口,层級是否過深。
這個顺序的逻辑是先排除被挡住和被稀释两種情况,再去動頁面本身。反過来做,很容易在頁面上改了一轮,站点结构的問题仍然摆在那里。
不要指望一步到位
站点层面的信号調整,见效周期通常以月計,而且不會因為做對一件事就立刻改變。與其盯着收錄數字每天波動,不如把注意力放在 URL 總量是否收敛、内容是否有区分度這两件事上。
另外,收錄數量也不是越多越好。一批本身没有检索價值的頁面進了索引,對整站未必是加分項。该收的收全,不该收的挡在外面,這個平衡比單纯追求數量更有意义。