整理站点索引时常见一個現象:被收錄的地址里,正文頁只占一部分,剩下的是站内搜尋结果頁、标簽頁、日期归档頁這類由模板批量生成的地址。它們並不都是垃圾,但也不该全部進索引。判断的核心只有一個問题——這個頁面有没有獨立存在的理由。
這些頁面是怎么被生成出来的
大多數自動頁面不是人工寫的,而是系統按規則拼出来的。搞清楚来源,才谈得上處理。
站内搜尋生成的頁面
用戶輸入關鍵詞後跳轉到一個带參數的 URL,例如 /search?q=xxx。如果這個地址可以被外部訪問、又没有做限制,蜘蛛顺着内鏈或外部連結就可能抓到一個。這類頁面的問题在于:内容完全由查询词决定,同一批结果會在無數個關鍵詞下重复出現,正文词句大量雷同,而且搜尋结果本身往往就是站内已有頁面的摘要,没有新增信息。
标簽與分類聚合頁
标簽頁介于两者之間。如果标簽是編輯挑選的,頁面上有一段說明、几個精選條目,它就带有獨立主题,可以当成一個小的频道頁来用。反之,如果标簽由作者随手打、頁面只有标题加連結列表,主题又和分類頁高度重合,那它更像一個入口,而不是一個頁面。
日期归档和作者頁
日归档、月归档的價值通常很低,尤其当分類和标簽已经覆盖了同样内容的时候。作者頁則要看是否附带作者介绍、负责领域等有区分度的信息;只有文章列表的作者頁,和标簽頁没有本质差別。
能站住脚的自動頁面,一般有三個特征
- 有獨立的主题:頁面在讲一件別處没讲的事,而不是同一批内容換個排列顺序。
- 有新增信息:一段人工撰寫的說明、一组編輯挑選的條目、一個統計或對比,都算。
- 有真實需求:這個组合词有人會搜,或者站内用戶會反复訪問它。
三個都不满足,基本可以判断它是在消耗抓取资源,而不是在贡献索引價值。
處理方式不只是屏蔽
遇到低價值頁面,很多人的第一反應是扔進 robots.txt。但 robots 只是阻止抓取,已经收錄的地址不會因此消失,而且被屏蔽的頁面仍可能以只有連結、没有摘要的形式出現在结果里。更贴合目的的做法是:
- 不想让它占索引位置,用 noindex 更直接,同时保留可抓取,让蜘蛛能看到這條指令。
- 想彻底断掉入口,再配合内鏈調整、robots 或參數限制一起做。
- 如果這批頁面确實有獨立價值,就別屏蔽,而是补一段說明、控制數量,把它們做厚。
一個可以照着走的判断顺序
- 先看這個地址有没有外部和站内入口,入口越少,問题通常越小。
- 再看同類頁面之間的重复度有多高,随机抽十個對比正文,看有多少内容是共有的。
- 然後看它是否對應真實搜尋需求,可以在搜尋框或關鍵詞工具里驗證。
- 最後决定:做厚保留、合並到已有頁面,還是用 noindex 處理。
站内搜尋頁尤其值得單獨拎出来看。通用做法是给搜尋结果頁加 noindex,避免關鍵詞组合無限扩張;但如果發現某些查询词長期有稳定訪問,可以把它們整理成固定的专题頁或導航頁,用人工内容承接。這才是把需求變成頁面,而不是让模板自動生成一堆地址。
判断自動頁面值不值得留,不是看它能带来多少流量,而是看它有没有提供別的地方没有的信息。
處理這類頁面没有统一答案,數量、更新频率、站点本身的規模都會影响判断。比較稳妥的方式是先圈定一小批样本,處理完观察一到两個抓取周期,再决定要不要扩大到全站。改動前後都记得留一份地址清單,方便對比哪些地址真的登出了索引。