網站收錄

站内搜尋頁與篩選頁被收錄:先從生成端控制,再谈索引收敛

站内搜尋頁和參數篩選頁常常先于核心頁面被蜘蛛抓走,既占抓取額度又容易進入索引。本文按生成端、抓取端、索引端三层顺序,說明如何判断哪些值得保留、哪些需要收敛,並提醒 robots 屏蔽與 noindex 移除的区別,避免两邊互相抵消。

網站收錄

站内搜尋頁與篩選頁被收錄:先從生成端控制,再谈索引收敛

站内搜尋頁、篩選頁、排序组合頁,是很多站点收錄结构里最容易被忽略的一類 URL。它們往往不是編輯主動建立的,而是用戶点一次篩選、輸一個關鍵詞就生成一條新地址。蜘蛛顺着内鏈爬几轮,這類地址就會成批出現在抓取日誌和索引里。

為什么這類頁面總是先被爬走

原因通常有三個。一是入口太浅,篩選按钮、热门搜尋词、标簽云常常放在所有頁面都能看到的公共区域,等于给每個頁面都加了一條通向無限參數组合的出口。二是連結稳定,同一個篩選條件每次都生成同样的 URL,蜘蛛第二次、第三次訪問都能正常打開,自然被当成正常頁面。三是内容看着有货,列表里确實带出了十几條标题和摘要,從纯文本角度看不算空頁面。

结果是:真正需要被抓取和评估的栏目頁、詳情頁還没被完整處理,篩選组合頁已经先占掉了抓取額度。

先判断:哪些需要處理

  • 有保留價值的:有稳定需求、内容能覆盖一定數量條目的品類篩選頁,通常不需要急着清理。
  • 可以存在但不该被收錄的:用戶輸入型搜尋结果頁,内容随關鍵詞變化,主要服務站内訪客。
  • 應当切断的:多參數自由组合、排序參數、會话參數、篩選叠加翻頁产生的 URL。

判断标准不需要太复杂:這條 URL 是否可能被真實用戶搜到,以及它是否在消耗核心頁面的抓取机會。两個問题都答否,就属于要收敛的部分。

處理顺序:生成端 → 抓取端 → 索引端

顺序颠倒會白花時間。常见情况是先在 robots.txt 里封了一批路径,過几周發現索引里還在,于是又加 noindex,但 robots 屏蔽後蜘蛛根本讀不到 noindex,两邊互相抵消。

第一步:從生成端减少數量

能不開的入口就不開。篩選按钮如果只對登入用戶展示、或只在用戶点击後由前端渲染,蜘蛛就看不到那條連結。排序、视图切換這類參數通常没有獨立的检索價值,可以统一到預設视图。用戶輸入的搜尋頁建议只保留入口,不保留可被抓取的連結形式。

第二步:在抓取端明确邊界

需要完全屏蔽的组合參數,用 robots.txt 拦截;但要注意,被屏蔽的 URL 無法通過 noindex 移除已有索引。如果目标只是不希望新地址繼續产生,用 robots;目标是已经收錄的要清掉,robots 就不合适。

第三步:再處理已收錄部分

對已经進入索引、又确實没有保留價值的 URL,用 noindex 加正常返回,並保證蜘蛛能抓到、能讀到這個标簽。同时把發現路径断掉:公共区域不再輸出這類連結,sitemap 里如果混入了這些地址,一並剔除。

抓取端的屏蔽和索引端的移除是两件事。先把以後不再产生和現在要清掉分開,再决定用哪一层的工具,能少走很多弯路。

几個容易被忽略的点

  1. 分頁與篩選叠加。篩選结果再翻頁,URL 會成倍增長,這類地址几乎不會带来搜尋流量,優先收敛。
  2. 空结果頁。篩選後没有條目,却返回 200 並展示暂無结果,容易被当成薄頁面,建议返回合适的狀態或至少加 noindex。
  3. 内鏈深度。篩選連結放在頁脚、侧栏,等于给全站每個頁面增加出鏈,蜘蛛的抓取重心會被拉到參數頁上。

驗證與後續监测

調整之後,观察抓取日誌里這類 URL 的訪問占比是否下降,以及索引量是否逐步回落。索引移除不是即时的,通常要经過几轮重新抓取才生效,中間出現反复属于正常現象。同时留意核心頁面的抓取频次有没有回升,這才是這次調整的目的。

最後提醒一点,收錄數量本身不是目标。篩選頁、搜尋頁被收錄並不等于出問题,關键在于它們是否占用了本應分给核心頁面的抓取资源,以及是否在搜尋结果里挤占了更该出現的頁面。