很多站点里,分類頁、标簽頁、聚合頁的數量遠超原创内容本身。這些頁面本身不算错,但质量差別很大:有的是用戶真正會点的導航入口,有的只是把标题排成一列的空壳。把它們统统交给搜尋引擎,结果往往是索引里塞满低质頁面,真正重要的内容反而被稀释。
第一步:先把三類頁面分開看
- 導航型聚合頁:分類頁、专题頁、系列文章目錄。有人手動维護,点進去能找到下一步。
- 自動型聚合頁:标簽頁、作者頁、日期归档。由系統自動生成,數量随文章增加而膨胀。
- 结果型頁面:站内搜尋頁、篩選與排序頁、组合條件頁。參數一多,數量可以接近無限。
三類的處理思路並不一样。導航型頁面通常值得留在索引里,前提是有實际内容支撑;自動型要看是否有獨立價值;结果型頁面绝大多數情况下不适合让蜘蛛大量抓取。
判断一個聚合頁值不值得收錄
不用太玄学,几個可以观察的信号:
- 有没有獨立的标题和描述。如果标簽頁只是把文章标题排成一列,頁面标题還是系統預設的“标簽:XXX”,它能表達的信息就很有限。
- 頁面内容是不是別處已经有了。分類頁如果只展示标题和摘要,和文章列表頁高度重合,價值就偏低。
- 它有没有被連結、被点击。内鏈入口没几個、服務器日誌里几乎没人訪問的聚合頁,通常也没必要强推進索引。
- 數量會不會失控。几百個标簽頁還看得過来,几萬個基本没法逐個监控,數量本身就是風險。
分档處理:四種做法
保留並补内容
核心分類頁、专题頁值得投入:加一段人工撰寫的導语、补充篩選說明、把最相關的几條内容放到前排。這样頁面才不只是一個列表。
合並同類
同义标簽、近义分類(比如“SEO”和“搜尋引擎優化”)應该合並成一個,而不是靠指向同一個地址硬凑。合並之後把舊地址 301 到保留的那個,入口统一,也少一堆重复。
限制而不是一刀切
如果标簽頁确實有一部分價值,可以只放開内容量足够的那部分,其余用 noindex 挡在索引外。noindex 只影响進索引,蜘蛛仍然可以抓取,便于顺着連結發現別的頁面。注意別用 robots.txt 屏蔽這些路径,否則蜘蛛讀不到 noindex 指令。
直接挡掉
站内搜尋结果頁、多條件篩選頁,建议從抓取入口上就断開:不進 sitemap、站内不要大量導鏈、必要时對參數做统一處理。如果已经大量被收錄,先看它們是怎么被抓到的,再逐步收回。
一個常见的誤解是:以為 noindex 加上就完事了。指令生效需要蜘蛛重新抓取那個頁面,在這之前,舊记錄仍會留在索引里。
几個容易踩的坑
- 把 robots.txt 当成收錄開關,寫完才發現 noindex 根本没被讀到。
- 给标簽頁加了 noindex,却仍在導航、侧栏里大量連結它們,等于白占抓取资源。
- 用 canonical 指向一個本身也不该被收錄的頁面,問题只是換了個地方存在。
- 聚合頁内容半年没更新,系統還在持續生成新的子頁面。
還有一個容易被忽略的细节:内鏈资源最好留给真正想推的頁面。如果大量連結都指向被挡住的聚合頁,蜘蛛顺着爬過去也拿不到有用的東西,反而分散了對核心内容的注意力。
最後,聚合頁的收錄狀態不是一次决定就完事。内容在增加、标簽在變化,隔一段時間去 GSC 的“已编入索引”和“已排除”报告里對一遍,看看有没有新的批量生成頁面冒出来。收錄這件事,本质上是持續做取舍,而不是设一次開關。