站内總有一些頁面不是編輯一條條寫的,而是系統按規則自動生成的:标簽頁、日期归档頁、作者頁、搜尋结果頁、篩選组合頁。它們數量大、互相連結多,往往比内容頁更早被抓取。問题在于,這些頁面並不都值得進入搜尋索引。判断标准不是“能不能被抓”,而是“有没有獨立價值”。
先分清三種列表頁
同样叫列表頁,用途差別很大。可以先把它們分成三類,再决定收錄策略。
- 内容聚合頁:围绕一個明确主题,把相關内容集中展示,用戶會主動搜尋這個主题。例如“某類产品的選购指南”或“某位作者的专栏”。這類頁面有獨立检索需求,可以考虑保留在索引里。
- 站内導航頁:主要為了方便站内跳轉,例如按年份归档、按字母排序的作者索引。用戶很少通過搜尋引擎专门找它,它的價值更多在站内。可以保留给用戶,但不必强求被索引。
- 無差別组合頁:搜尋结果頁、多條件篩選頁、空标簽頁、重复參數頁。它們通常由站内搜尋或篩選产生,内容随查询變化,重复度高,也容易無限生成。這類頁面一般應该收口。
收口方式不同,结果也不同
决定不让某個列表頁進索引後,還要選對方法。不同方法對抓取和索引的影响不一样。
noindex 适合“给用戶看,但不進索引”
如果頁面本身有用,只是不希望出現在搜尋结果里,用 noindex 比較合适。搜尋引擎仍能抓取頁面,也能看到 noindex 指令,從而把它排除在索引之外。注意不要同时用 robots.txt 屏蔽抓取,否則抓取不到,noindex 也可能看不到。
robots.txt 屏蔽要更谨慎
robots.txt 阻止的是抓取,不是索引。已经被索引的 URL,即使後来被 robots.txt 屏蔽,也可能因為缺少更新信息而繼續留在索引里。通常只在确實不需要抓取、且不介意索引残留时使用。
canonical 解决的是重复變体
如果多個 URL 展示的是同一批内容,只是排序參數或分頁參數不同,可以用 canonical 指向主版本。canonical 不是“刪除”指令,它是给搜尋引擎的合並建议。内容本身不同的列表頁,不要硬指到同一個 URL。
排查顺序:從實际收錄情况開始
不要凭感觉批量處理。按下面顺序看一遍,通常能分清哪些该留、哪些该收。
- 查索引:用 site 查询或搜尋控制台的覆盖率报告,看實际被收錄的列表頁有哪些。先處理數量大、明顯無價值的類型。
- 看流量與轉化:如果某類标簽頁或归档頁有稳定搜尋流量,說明它可能满足了一部分检索需求,不要一刀切屏蔽。
- 看抓取占用:從服務器日誌里观察,列表頁是否占用了大量抓取次數,而内容頁更新却迟迟不被抓取。如果是,優先收口無差別组合頁。
- 定策略:保留有價值的聚合頁,合並重复變体,對導航頁和组合頁使用 noindex 或 canonical。一次改一類,观察几周再繼續。
保留的列表頁也要有基本质量
决定保留在索引里的列表頁,不能只是一個标题加連結的清單。至少應该做到:
- 标题和描述能說明這個列表的主题,而不是只顯示“标簽:某某”。
- 每個條目有摘要、缩略图或時間等辅助信息,让用戶能判断是否点击。
- 分頁有清晰的上一頁、下一頁關系,避免第 2 頁之後被当成獨立内容大量收錄。
- 空结果頁、只有一两條内容的标簽頁,不要生成可索引的 URL。
收口的目标不是让收錄量看起来變少,而是让真正有内容、能满足搜尋需求的頁面更容易被發現和更新。不要為了减少列表頁收錄,把整站抓取都堵住。
自動生成列表頁本身不是問题。問题在于是否给了它們與價值匹配的索引身份。先把類型分清,再選收口方式,最後用資料和日誌驗證,通常比一次性批量 noindex 更稳妥。