很多站点的收錄問题,不是詳情頁進不去,而是不该進的頁面進得太多。站内搜尋结果頁、带篩選參數的列表頁、没有任何结果的空查询頁,都属于系統自動生成、數量几乎無限的地址。它們占用抓取次數,稀释索引质量,但也不意味着要一刀切全部屏蔽。
一、先分清三類自動生成頁面
- 站内搜尋结果頁:用戶輸入關鍵詞後生成的地址,内容完全由輸入决定,重复度极高,通常不建议收錄。
- 篩選與排序參數頁:颜色、價格区間、排序方式等參數组合,可能生成成百上千個地址。其中一部分确實有用戶需求,關键在于该组合是否對應獨立内容與稳定搜尋需求。
- 空结果頁:搜尋词無匹配结果时仍返回一個可正常訪問的頁面,内容基本只有一句提示,属于典型的薄頁面。
二、判断标准:有没有獨立價值
判断一個自動生成的頁面该不该進索引,可以問三個問题:它是否有唯一的正文内容,而不是列表拼接;是否存在稳定的搜尋需求;用戶從外部搜尋進来後,能否直接得到答案。三個答案都是否,就属于應当控制索引的對象。
抓取和收錄是两件事。减少抓取是為了省资源,控制索引是為了防止污染,两者的取舍並不相同:對纯粹的參數组合頁優先减少抓取,對内容重复但仍被内外鏈引用的頁面優先控制索引。
三、三種處理方式怎么選
robots.txt:省抓取
适合數量巨大、無外部連結價值、也不需要传递權重的地址。要注意被 robots 屏蔽的地址依然可能被外部連結以無摘要形式收錄,如果在意這一点,就不要用這種方式。
noindex:控收錄
适合頁面本身仍需要被用戶訪問、也可能被蜘蛛抓到,但不希望出現在索引里的情况。noindex 需要頁面能被抓取才生效,所以不能同时用 robots.txt 把它屏蔽掉。
canonical:归並重复
适合參數頁與主列表頁内容高度重合、希望把權重集中到主地址的场景。canonical 是建议而不是强制指令,如果两個頁面内容差异明顯,效果會打折扣。
參數規整
在系統层面把無意义的排序、會话、追踪參數去掉,或统一排序參數的預設值,往往比事後用标簽补救更省事,也更容易長期维持。
四、上线後的检查清單
- 用索引覆盖报告或站内检索,找出被收錄的搜尋頁與參數頁的大致數量與命名模式。
- 確認哪些篩選组合有稳定需求,保留它們,並补齐标题與正文說明。
- 其余地址按上述三種方式分层處理,避免同一批頁面同时使用 robots 和 noindex。
- 在蜘蛛日誌里观察這類地址的抓取占比,看是否把抓取次數让给了詳情頁。
- 两到四周後复查索引狀態。被移除需要時間,不要求立刻见效。
五、容易踩的几個坑
- 空结果頁返回正常狀態碼,模板又與有结果的頁面一致,容易被批量当成低质頁面收錄。
- 只處理了搜尋頁,忘了移動端或另一套域名下相同的入口。
- 把 noindex 寫在 robots.txt 里,這是無效的,两者属于不同机制。
- 頁面加了 noindex,站内連結却照舊大量指向它,白白浪費抓取次數。
這類頁面的處理目标不是“一個都不收錄”,而是让索引里的地址都能對應用戶的真實需求。參數和搜尋頁的數量會随业務變化不断新增,建议把它当成一項定期复查的工作,而不是一次性配置。