收錄數量本身不是目标。一個頁面進索引要有意义,前提是它有机會獨立承接某個搜尋需求。如果它只是流程中的一环,或者内容和其他頁面高度重合,進索引往往只是给站点多添一條重复记錄,也會分散抓取和评估的注意力。所以做收錄管理,第一步不是“怎么让更多頁面被收錄”,而是给頁面分類,想清楚每一類各自该處于什么狀態。
把站点頁面分成几類
- 首頁:承载品牌與整体導航,通常必须收錄。
- 栏目頁 / 分類頁:一個主题下的入口,是否收錄取决于该栏目本身有没有稳定需求。
- 内容詳情頁:文章、商品、词條等,是收錄主体。
- 标簽頁 / 聚合頁:由規則拼出来的列表,價值取决于它是否提供了列表之外的信息。
- 篩選、排序、站内搜尋结果頁:多由參數组合生成,容易产出大量近似 URL。
- 功能與辅助頁:登入、购物车、感谢頁、隐私声明等,一般不需要出現在索引里。
判断标准:能不能獨立满足一個需求
同一套标准可以套到任何頁面上,問三個問题:
- 有人會直接搜這個頁面的主题吗?
- 這個頁面的内容,是否已经完整地存在于另一個頁面里?
- 頁面上有没有足够、且與主题一致的正文本信息?
第一個問题是需求,第二個是重复度,第三個是頁面质量。三個答案都偏向正面,就值得收錄;有一個明顯為否,就要考虑把它挡在索引之外。
各類頁面的常規處理
首頁和核心栏目頁
保持可抓取、可索引,标题和描述寫清楚。栏目頁如果内容量太少,只有几個連結、没有介绍文字,它和詳情頁的關系就變成了纯導航,可以先用内鏈和描述把它养起来,再考虑收錄。
内容詳情頁
收錄主体。要保證正文在 HTML 里就能讀到,不要只靠 JS 渲染;同时確認每篇内容有唯一的主版本 URL,別让同一篇内容以多個路径出現在索引里。
标簽頁與聚合頁
這類頁面争议最大。判断点在于:它是不是只是把已有連結重新排了一遍?如果标簽頁有獨立的說明文字、清晰的篩選逻辑,並且能覆盖一個詳情頁覆盖不到的需求,可以保留收錄;如果只是机械罗列,加 noindex 更稳妥。另外別把标簽頁做得比詳情頁還多,容易造成入口稀释。
篩選、排序和站内搜尋頁
預設不要索引。排序參數、價格区間、颜色篩選這些组合出来的 URL 數量是指數級的,内容彼此又高度近似。做法上,可以在模板层面统一加 noindex,或者用 robots.txt 屏蔽參數路径。要留意的是一旦某個 URL 已经被抓取並被索引,再上 robots.txt 並不能把它從索引中移除,需要靠 noindex 或 404、410 来推動下线。
功能與辅助頁
登入、註冊、购物车、訂單確認、站内搜尋、隐私政策這類頁面,對搜尋用戶没有獨立價值。统一 noindex 處理,同时不要让它們出現在站点地图和主導航里。
判断一個頁面该不该收錄,問的是“它作為一條搜尋结果是否合格”,而不是“它是不是我站点的一部分”。
落地时可以用的手段
- noindex:让頁面可抓取但不進索引,适合還没被大量抓取的頁面。
- robots.txt:减少抓取,但不能代替下线,也不能阻止已收錄頁面繼續出現。
- canonical:多個 URL 指向同一内容时,用来指定主版本。
- 内鏈與站点地图:决定哪些頁面被優先發現,間接影响收錄顺序。
自查顺序
- 用站点地图或服務器日誌導出全站 URL 列表,按上面的分類打标。
- 抽样查询一批 URL,看實际被索引的是哪几類頁面。
- 對比“希望被收錄”和“實际被收錄”两份清單,找出多出来的部分。
- 對多出来的部分,先判断是模板問题還是内容問题,再决定用 noindex 還是 canonical。
- 改動後不必期待立刻生效,观察几周到一個月,看索引量的趋势而不是單日數字。
收錄取舍是一件需要持續做的事。站点结构變了、内容量上来了、栏目改版了,原来的判断可能就不再适用。定期回头看一眼索引里都躺着哪些頁面,比一次性做完所有設定更有用。