站点的索引數量在涨,自然搜尋訪問却没有跟着變,甚至略有下滑,這是很多运营者都會遇到的情况。數量本身不說明問题,多出来的是什么類型的頁面才說明問题。在動手清理之前,先把索引里的 URL 归一次類,再决定動谁、按什么顺序動。
第一步:把“多出来的”归類,而不是先下结论
從索引資料或站点地图的對比里抽样 50 到 100 條新出現的 URL,看它們的路径和參數特征。常见的几類大致是:
- 站内搜尋结果頁,比如 search 或 q 參數;
- 篩選、排序、视图切換參數组合出来的頁面;
- 标簽頁、作者頁、日期归档這類聚合入口;
- 列表分頁的深层頁面;
- 同一内容的不同 URL 版本:协议、大小寫、结尾斜杠、參數顺序不一致;
- 測試目錄、废弃頁面、带會话标识的連結。
先只統計類型和占比,不解释原因。占比最高的那一類,往往就是處理收益最大的地方。
處理顺序:影响面大、改動成本低的先做
第一层:本来就不该存在的 URL
測試頁、已废弃的目錄、带 session 參數的連結、内部搜尋结果,這類頁面既没有搜尋需求,也没有内容價值。如果頁面确實要下线,返回 404 或 410 是最干净的做法;如果目錄還要保留,用 robots.txt 屏蔽爬取也可以,但要注意別同时给這些頁面加 noindex——被 robots 屏蔽之後,爬虫讀不到 noindex 指令。
第二层:同一内容的多個 URL 版本
先统一訪問規則:协议、域名前缀、大小寫、结尾斜杠、參數顺序,只保留一個可訪問版本,其余做 301。這一步不直接解决收錄數量,但能避免同一篇内容分散成多個索引條目,也方便後面統計。
第三层:參數頁與分頁
篩選组合頁里,通常只有少數几種组合真的有人搜。可以保留這部分,其余用 canonical 指向主列表頁,或者用 noindex,follow 保留連結传递。分頁則常见做法是只让第一頁進入索引,翻頁頁面不索引但保持可抓取,让爬虫能顺着走到更深的條目。
第四层:模板化、内容單薄的頁面
内容少、段落重复、缺少主内容的頁面,問题不在索引指令,而在頁面本身。要么补足内容让它值得被搜到,要么和相近頁面合並。合並之前先確認這個 URL 有没有外部連結和真實訪問,別把有用的入口一起關掉。
判断“该不该被索引”的三個問题
- 它有没有獨立價值?和站内其他頁面高度重复,用戶進来看到的都是同样的東西,倾向不索引。
- 會不會有人搜到它?没有對應的搜尋需求,收錄了也基本不會有訪問。
- 進来的人满不满意?内容不完整、信息過时,即使能排上去,停留和回退資料也不會好看。
三個問题都答不上来的頁面,處理優先級可以往後排;三個都不满足的,基本可以進入清理名單。
動作做完,怎么核對
指令類的改動(noindex、canonical、屏蔽)需要時間生效,別指望第二天就看到索引數下降。可以先用 URL 检查工具確認爬虫拿到的指令是预期的那一條,然後按 2 到 4 周的节奏观察索引數量和结构變化。
改的时候建议分批,留一部分頁面作為對照。一次性把整個目錄處理掉,之後出現波動就分不清是改動生效還是別的原因。
收錄數量本身不是目标。能被搜到、並且带来有效訪問的頁面有多少,才是更值得盯的數字。
几個常见誤区
- 想用 robots.txt 屏蔽某個頁面,却又指望它不再出現在索引里——屏蔽爬取和從索引移除不是一回事。
- 為了压收錄數量,把整個目錄整块屏蔽,连带把有用的頁面一起挡掉。
- 只看索引總數,不看目錄和頁面類型的结构變化,结果數字降了但問题頁還在。
索引數量的變化,多數时候是頁面结构問题的结果,而不是原因。把 URL 按類型拆開,先處理成本最低、影响最明确的那一层,剩下的再慢慢看。