網站收錄

标簽頁、归档頁、搜尋结果頁:自動生成列表頁的收錄取舍

标簽頁、归档頁、作者頁和搜尋结果頁常由系統自動生成,數量大却不一定都该進索引。本文按内容聚合、站内導航、無差別组合三類拆分,說明 noindex、robots.txt 與 canonical 的适用邊界,並给出從索引現状、流量價值和抓取占用入手的排查顺序。

網站收錄

标簽頁、归档頁、搜尋结果頁:自動生成列表頁的收錄取舍

站内總有一些頁面不是編輯一條條寫的,而是系統按規則自動生成的:标簽頁、日期归档頁、作者頁、搜尋结果頁、篩選组合頁。它們數量大、互相連結多,往往比内容頁更早被抓取。問题在于,這些頁面並不都值得進入搜尋索引。判断标准不是“能不能被抓”,而是“有没有獨立價值”。

先分清三種列表頁

同样叫列表頁,用途差別很大。可以先把它們分成三類,再决定收錄策略。

  • 内容聚合頁:围绕一個明确主题,把相關内容集中展示,用戶會主動搜尋這個主题。例如“某類产品的選购指南”或“某位作者的专栏”。這類頁面有獨立检索需求,可以考虑保留在索引里。
  • 站内導航頁:主要為了方便站内跳轉,例如按年份归档、按字母排序的作者索引。用戶很少通過搜尋引擎专门找它,它的價值更多在站内。可以保留给用戶,但不必强求被索引。
  • 無差別组合頁:搜尋结果頁、多條件篩選頁、空标簽頁、重复參數頁。它們通常由站内搜尋或篩選产生,内容随查询變化,重复度高,也容易無限生成。這類頁面一般應该收口。

收口方式不同,结果也不同

决定不让某個列表頁進索引後,還要選對方法。不同方法對抓取和索引的影响不一样。

noindex 适合“给用戶看,但不進索引”

如果頁面本身有用,只是不希望出現在搜尋结果里,用 noindex 比較合适。搜尋引擎仍能抓取頁面,也能看到 noindex 指令,從而把它排除在索引之外。注意不要同时用 robots.txt 屏蔽抓取,否則抓取不到,noindex 也可能看不到。

robots.txt 屏蔽要更谨慎

robots.txt 阻止的是抓取,不是索引。已经被索引的 URL,即使後来被 robots.txt 屏蔽,也可能因為缺少更新信息而繼續留在索引里。通常只在确實不需要抓取、且不介意索引残留时使用。

canonical 解决的是重复變体

如果多個 URL 展示的是同一批内容,只是排序參數或分頁參數不同,可以用 canonical 指向主版本。canonical 不是“刪除”指令,它是给搜尋引擎的合並建议。内容本身不同的列表頁,不要硬指到同一個 URL。

排查顺序:從實际收錄情况開始

不要凭感觉批量處理。按下面顺序看一遍,通常能分清哪些该留、哪些该收。

  1. 查索引:用 site 查询或搜尋控制台的覆盖率报告,看實际被收錄的列表頁有哪些。先處理數量大、明顯無價值的類型。
  2. 看流量與轉化:如果某類标簽頁或归档頁有稳定搜尋流量,說明它可能满足了一部分检索需求,不要一刀切屏蔽。
  3. 看抓取占用:從服務器日誌里观察,列表頁是否占用了大量抓取次數,而内容頁更新却迟迟不被抓取。如果是,優先收口無差別组合頁。
  4. 定策略:保留有價值的聚合頁,合並重复變体,對導航頁和组合頁使用 noindex 或 canonical。一次改一類,观察几周再繼續。

保留的列表頁也要有基本质量

决定保留在索引里的列表頁,不能只是一個标题加連結的清單。至少應该做到:

  • 标题和描述能說明這個列表的主题,而不是只顯示“标簽:某某”。
  • 每個條目有摘要、缩略图或時間等辅助信息,让用戶能判断是否点击。
  • 分頁有清晰的上一頁、下一頁關系,避免第 2 頁之後被当成獨立内容大量收錄。
  • 空结果頁、只有一两條内容的标簽頁,不要生成可索引的 URL。
收口的目标不是让收錄量看起来變少,而是让真正有内容、能满足搜尋需求的頁面更容易被發現和更新。不要為了减少列表頁收錄,把整站抓取都堵住。

自動生成列表頁本身不是問题。問题在于是否给了它們與價值匹配的索引身份。先把類型分清,再選收口方式,最後用資料和日誌驗證,通常比一次性批量 noindex 更稳妥。