收錄量上涨,不一定代表站点變好
很多站点把「收錄了多少條」当成运营指标,看到索引數上涨就觉得内容起作用了。但索引是一個池子,池子里装的不只是你希望被搜到的頁面。站内搜尋结果頁、篩選组合頁、空的分類頁、重复的标簽归档,都可能在某次抓取之後悄悄落了進去。它們很少带来流量,却會占用抓取時間、混淆同類内容的地址,也让後台的收錄數字看起来在涨、實际没什么用。
這些頁面是怎么進索引的
大多數情况不是被谁提交進去的,而是被蜘蛛顺着連結走到的。
- 站内搜尋结果頁:只要结果地址可以被外部訪問,任何一個带查询參數的地址都可能被抓到。
- 參數组合頁:排序、篩選、分頁參數互相叠加,能生成成百上千個地址,其中大部分组合的结果是空的,或者高度重复。
- 标簽頁與归档頁:同一批文章在标簽、日期、作者等维度反复出現,如果每個维度都保留獨立地址,索引里就出現了多份相似内容。
- 舊版残留:改版後遗留的測試頁、临时目錄、舊模板地址,如果没有及时處理,仍然可能挂在索引里。
這些頁面的共同点很明确:有地址、能被連結到、能正常返回 200。對蜘蛛来说,它們和内容頁没有区別。
堆進索引之後會發生什么
影响通常不是立刻顯現的,而是在一段時間里慢慢累积。
- 抓取時間被分散:蜘蛛每次来訪的容量有限,花在參數组合上的時間,就是從新内容和重点頁面上拿走的。
- 同類内容出現多個地址:搜尋引擎需要在多個相似頁面里選一個作為代表,選中的不一定是你希望的那個版本。
- 資料統計失真:收錄數在涨,自然流量却没變化,看报表时容易誤判内容方向。
- 用戶落地体驗變差:真的有人点進空篩選頁,看到的是一片空白和一堆篩選條件。
收錄本身不是成绩,能被搜到、並且對用戶有用的收錄才是。
收敛的顺序:先分類,再動手
- 把已知的低價值地址列出来,按「保留、合並、屏蔽、刪除」四類归档。分類没做完就動手,很容易把有用的頁面一起關掉。
- 能合並的先合並。多個地址指向同一批内容时,保留一個主版本,其余用 canonical 指向它,同时把内鏈统一改到主版本上。
- 還需要让用戶訪問的頁面用 noindex 處理,例如站内搜尋结果頁、需要登入的列表頁。抓取仍可能發生,但不會再進索引。
- 整個目錄都不需要被抓的,用 robots.txt 挡在抓取之外。注意它只阻止抓取,已经進索引的地址不會因此消失。
- 确實不再需要的頁面直接刪除,返回 404 或 410,不要長期挂着「正在建设中」的空頁面。
- 最後更新 sitemap 和内鏈,把入口從低價值地址上撤掉,避免蜘蛛再次被引過去。
不要一次性全屏蔽
一次改動過大,之後很难判断效果来自哪一步。可以先處理其中一類,观察一段時間的抓取分布和索引狀態,再繼續下一類。改動前後各留一份資料,之後才方便對比。
收敛之後怎么確認有效
可以看几個方向:索引里的地址數量有没有回落,蜘蛛的抓取是否更多落在内容頁上,站内搜尋和篩選是否已经不产生新的可訪問地址。這個過程通常不快,頁面登出索引也需要時間,不要指望几天内看到完整结果。
回到更根本的問题
索引膨胀的根源,往往是同一批内容被拆成了太多地址,或者頁面上本来就没有足够的内容值得拥有一個獨立 URL。與其事後一個個屏蔽,不如在建站和改版时就想清楚:這個地址獨立存在,理由是什么。想不清楚的,通常也就不该被收錄。