索引量突然涨了一截,很多时候不是内容變多了,而是有一批本来不该進索引的頁面被收錄了。這種“虚高”不會带来流量,反而會占用抓取額度、分散站内連結的传递方向,让真正想被搜到的頁面排队更久。與其盯着數字焦虑,不如先弄清楚多出来的到底是哪些地址。
先把多出来的部分归归類
用索引报告、抓取日誌或站内 URL 清單,把新增的部分按目錄和參數结构分组。常见的几類大致是:
- 站内搜尋结果頁,以及篩選、排序的组合地址;
- 标簽、专题、作者等聚合頁的空结果版本和翻頁版本;
- 打印頁、手机版、舊模板留下的歷史地址;
- 附件、缩略图、接口返回的 JSON、XML 或纯文本;
- 測試目錄、临时路径、調试參數被外部連結带進来的地址。
归完類通常會發現問题並不复杂:它們大多不是獨立内容,而是同一批内容的不同入口,或者同一批資料的另一個壳子。
判断标准:這個頁面能不能獨立回答一個問题
分類之後需要一個取舍标准,否則容易一刀切。比較實用的問法是:把模板、導航、推荐位全部去掉之後,這個地址上還剩什么?
如果剩下的是一段完整的正文、一组有整理逻辑的條目,或者能獨立回答某個具体問题,那它值得保留;如果剩下的是零散字段、空结果提示、和別人完全一样的摘要,那它更接近工具頁或入口頁,本身不该占用索引位置。
還要注意一点:聚合頁不是天生低质。带編輯說明的分類頁、有新舊排序逻辑的专题頁,很多时候是有搜尋需求的;真正该收的是机械生成、内容重复、没有人工取舍的那一批。判断时按列表逐條看,不要按目錄整個砍掉。
收口的顺序:先断入口,再改狀態
顺序错了會白忙一场。建议按下面几步走:
- 先停住入口。检查内鏈、面包屑、分頁组件、站点地图里有没有指向這些地址的連結,先把不该放的入口去掉,减少新地址被發現的可能。
- 再處理被發現但没價值的地址。能合並的用規范化指向主版本,確認不再需要的用 robots 規則阻止抓取,注意 robots 只是挡住抓取,不等于立刻從索引里刪除。
- 對确實要下线的頁面用合适的狀態。永久不再提供的返回 404,整体迁移的用 301,只是不希望被索引但頁面仍要服務用戶的,用 noindex 並保證頁面本身可訪問。
- 最後核對站点地图與提交入口。把已经收口的地址從地图里清掉,避免一邊屏蔽一邊提交。
每一步之間留几天观察,抓取日誌里這些地址的訪問量下降,說明入口這部分起作用了。
索引清理本来就是慢活,設定改對之後按周看趋势就够了,不需要每天刷新數字给自己添压力。
几個容易做過头的地方
- 把整個栏目一刀切 noindex,连带砍掉本来有搜尋需求的頁面;
- 屏蔽了抓取又指望索引立刻消失,忽略了移除需要時間;
- 只改 robots 不改内鏈,站内還在持續产生新的同類型地址;
- 反复調整規則,導致同一批地址一會儿放開一會儿屏蔽,反而让抓取調度變得更乱。
把多出来的頁面看成一件事来處理,而不是一堆需要消灭的數字,取舍會清晰很多。分類、判断、按顺序收口,再给足够的時間观察,索引结构自然會回到更接近真實内容規模的狀態。