很多站点的收錄量里,真正的内容頁只占一部分,剩下的大头是自動生成的列表頁:分頁、篩選结果、标簽頁、時間归档。這類頁面该不该被收錄,没有统一答案,但有一個可以落地的判断顺序。處理得好,它們能带流量也能帮蜘蛛發現内容;處理不好,它們會稀释站内權重,還會产生大量近似重复的 URL。
先把自動生成的頁面分成三類
這三類的生成逻辑和風險点不同,混在一起處理容易做出错誤决定。
- 分頁:把同一列表拆成 ?page=2 或 /list/2 這样的多頁。它和第一頁是同一主题的延續,本身不产生新主题。
- 篩選與排序:由參數生成,比如颜色、價格区間、排序方式。组合數量可能爆炸,且大量组合的内容完全相同。
- 归档與标簽:按時間、作者、分類、标簽聚合。有的标簽是真實的主题入口,有的只是零散頁面的堆积。
判断标准:它能不能獨立满足一個搜尋意图
與其纠结技術细节,不如先問一句:用戶會不會专门搜這個词,並且落地到這個頁面?
- “耳机”這個分類頁可能有搜尋需求,“耳机 黑色 200-300 元 按销量排序”通常没有。
- 标簽“降噪耳机”可能有需求,标簽“2024”大概率没有。
- 分頁第 2 頁基本没有獨立搜尋意图,但它是蜘蛛繼續爬向更早内容的路径。
有獨立意图的保留並優化,没有的把抓取资源集中在有意图的頁面上。這個判断不依赖工具,靠對业務的理解就能做。
分頁:保留可抓取路径,不要一刀切 noindex
常见做法是把所有分頁都设成 noindex,只留第一頁。這能减少近似重复,但副作用是列表深處的内容失去了主要入口;如果内鏈又只做“下一頁”,蜘蛛可能很难爬到後面。
更稳妥的處理:
- 每一頁做自引用 canonical,不要把第 2 頁指回第 1 頁,那等于告诉搜尋引擎後面几頁都是重复内容。
- 分頁連結用可抓取的普通連結,不要依赖点击後异步加载;如果必须异步,至少保留 href。
- 给分頁加上可讀的标题和必要的說明,避免所有頁的标题完全相同。
- 條目太少、内容几乎没有的分頁(比如最後一頁只有一條),可以考虑合並或直接不生成。
next 與 prev 這類關系标记現在不再是索引信号,保留無害,但不要指望它解决收錄問题。
篩選與排序:按组合價值分流
篩選頁的關键是控制组合數量。可以按這個顺序處理:
- 有搜尋量、内容有差异的组合,允许收錄,並给獨立的标题與說明文案。
- 纯排序參數(sort、order)通常不值得單獨索引,用 canonical 指向預設排序,或在 robots 中屏蔽抓取。
- 追踪參數(utm、gclid、ref)一律不參與索引判断,最好在服務端或 canonical 里去掉。
- 多條件叠加後结果過少或為空时,返回合适的空狀態,不要返回 200 的空頁面。
需要提醒的是,用 robots.txt 屏蔽參數頁,會让搜尋引擎看不到頁面上的 canonical 提示,两種手段選其一即可,不要指望屏蔽之後還能靠 canonical 传递信号。
归档與标簽:薄聚合頁可以合並
标簽頁和归档頁的價值差別很大。判断方式很简單:這個聚合下有多少條内容,内容之間是否围绕同一主题。
- 内容充足、主题集中的标簽頁,可以当作正式入口来运营,寫一段導语,加上内鏈。
- 只有一两條内容的标簽頁,考虑合並到上級分類,或設定 noindex 並從内鏈中移除。
- 按日期、作者、月份生成的归档頁,如果没有搜尋需求,可以只作為爬取入口保留,不做索引。
動手前的检查顺序
- 先統計所有自動生成頁面的數量,估算它在總 URL 里的占比。
- 按上面三類分別标记:保留索引、保留抓取但不索引、不生成或不抓取。
- 检查 canonical 是否正确自引用,參數是否被規整。
- 检查列表頁的内鏈是否真的能走到更深的内容頁。
- 改動後观察索引报告和日誌,確認被移出的确實是列表頁,而不是把该收的内容頁一起清掉了。
列表頁不是收錄的敌人,失控的列表頁才是。给每一類頁面一個明确的角色,比统一 noindex 或统一放開都更有效。