網站收錄

标簽頁和聚合頁要不要進索引:先按三類頁面分開看

站点里的标簽頁、分類頁和篩選頁數量常常遠超原创内容,處理方式却经常一刀切。這篇文章把聚合類頁面分成三類,给出可以观察的判断信号,以及保留补内容、合並同類、限制收錄、直接挡掉四種處理办法,並提醒 noindex、内鏈和 canonical 之間容易互相打架的地方。

網站收錄

标簽頁和聚合頁要不要進索引:先按三類頁面分開看

很多站点里,分類頁、标簽頁、聚合頁的數量遠超原创内容本身。這些頁面本身不算错,但质量差別很大:有的是用戶真正會点的導航入口,有的只是把标题排成一列的空壳。把它們统统交给搜尋引擎,结果往往是索引里塞满低质頁面,真正重要的内容反而被稀释。

第一步:先把三類頁面分開看

  • 導航型聚合頁:分類頁、专题頁、系列文章目錄。有人手動维護,点進去能找到下一步。
  • 自動型聚合頁:标簽頁、作者頁、日期归档。由系統自動生成,數量随文章增加而膨胀。
  • 结果型頁面:站内搜尋頁、篩選與排序頁、组合條件頁。參數一多,數量可以接近無限。

三類的處理思路並不一样。導航型頁面通常值得留在索引里,前提是有實际内容支撑;自動型要看是否有獨立價值;结果型頁面绝大多數情况下不适合让蜘蛛大量抓取。

判断一個聚合頁值不值得收錄

不用太玄学,几個可以观察的信号:

  1. 有没有獨立的标题和描述。如果标簽頁只是把文章标题排成一列,頁面标题還是系統預設的“标簽:XXX”,它能表達的信息就很有限。
  2. 頁面内容是不是別處已经有了。分類頁如果只展示标题和摘要,和文章列表頁高度重合,價值就偏低。
  3. 它有没有被連結、被点击。内鏈入口没几個、服務器日誌里几乎没人訪問的聚合頁,通常也没必要强推進索引。
  4. 數量會不會失控。几百個标簽頁還看得過来,几萬個基本没法逐個监控,數量本身就是風險。

分档處理:四種做法

保留並补内容

核心分類頁、专题頁值得投入:加一段人工撰寫的導语、补充篩選說明、把最相關的几條内容放到前排。這样頁面才不只是一個列表。

合並同類

同义标簽、近义分類(比如“SEO”和“搜尋引擎優化”)應该合並成一個,而不是靠指向同一個地址硬凑。合並之後把舊地址 301 到保留的那個,入口统一,也少一堆重复。

限制而不是一刀切

如果标簽頁确實有一部分價值,可以只放開内容量足够的那部分,其余用 noindex 挡在索引外。noindex 只影响進索引,蜘蛛仍然可以抓取,便于顺着連結發現別的頁面。注意別用 robots.txt 屏蔽這些路径,否則蜘蛛讀不到 noindex 指令。

直接挡掉

站内搜尋结果頁、多條件篩選頁,建议從抓取入口上就断開:不進 sitemap、站内不要大量導鏈、必要时對參數做统一處理。如果已经大量被收錄,先看它們是怎么被抓到的,再逐步收回。

一個常见的誤解是:以為 noindex 加上就完事了。指令生效需要蜘蛛重新抓取那個頁面,在這之前,舊记錄仍會留在索引里。

几個容易踩的坑

  • 把 robots.txt 当成收錄開關,寫完才發現 noindex 根本没被讀到。
  • 给标簽頁加了 noindex,却仍在導航、侧栏里大量連結它們,等于白占抓取资源。
  • 用 canonical 指向一個本身也不该被收錄的頁面,問题只是換了個地方存在。
  • 聚合頁内容半年没更新,系統還在持續生成新的子頁面。

還有一個容易被忽略的细节:内鏈资源最好留给真正想推的頁面。如果大量連結都指向被挡住的聚合頁,蜘蛛顺着爬過去也拿不到有用的東西,反而分散了對核心内容的注意力。

最後,聚合頁的收錄狀態不是一次决定就完事。内容在增加、标簽在變化,隔一段時間去 GSC 的“已编入索引”和“已排除”报告里對一遍,看看有没有新的批量生成頁面冒出来。收錄這件事,本质上是持續做取舍,而不是设一次開關。