站点規模一上来,最容易纠结的不是首頁和内頁,而是那些自動生成的頁面:标簽頁、分類列表頁、聚合頁、多條件篩選後的组合頁。它們的共同点是數量大、内容由模板拼装、彼此之間大量重叠。爬虫會抓,但抓了之後要不要让它們進入索引,需要先做判断。
先分清頁面類型,再谈收錄
不同類型的批量頁面,價值差別很大,處理方式也不该一刀切。
- 列表頁:按時間或分類聚合内容,每個條目通常只有标题和摘要,主要作用是提供發現入口。
- 标簽頁與聚合頁:围绕某個主题把相關内容聚到一起。如果标簽划分清晰、内容量足够、有稳定内鏈入口,它本身可以是一個有價值的落地頁。
- 篩選组合頁:由參數组合生成,维度越多重复度越高,绝大多數组合没有獨立的搜尋需求。
判断“值不值得收錄”的几條标准
1. 頁面是否有獨立内容
把模板以外的部分去掉,剩下的内容是否還能支撑起一個獨立頁面。如果整頁只是同一個模板換了标题,或者與主分類頁高度重合,它的索引價值就很有限。
2. 是否有人會主動搜這個頁面
可以看两個地方:站内搜尋關鍵詞,以及頁面已经获得的展示與点击。如果某個标簽頁長期有自然的查询流量,說明它對應真實需求,值得保留並繼續完善。
3. 是否有稳定的内鏈入口
只能從分頁深處到達、或只靠站内搜尋才會出現的頁面,既难被稳定抓取,也难被持續维護。没有入口的頁面,放開索引的意义不大。
4. 數量是否可控
一個只有二十個标簽的站点和一個有两萬個标簽的站点,策略完全不同。後者更接近程序化生成的頁面集合,需要按维度收敛,而不是逐個判断。
常见的三種取舍
- 全部放開:短期看索引量涨得快,但會引入大量近似頁面,稀释站内連結,也让後續排查真實問题更困难。
- 全部屏蔽:确實能减少重复,但也會把有實际需求的聚合頁一起挡掉,等于放弃這部分入口。
- 分层處理:保留有内容、有需求、有入口的頁面,其余用 noindex 或限制參數组合的方式排除,同时保留抓取路径,让爬虫能顺着列表走到真正的内容頁。
分层處理更常见,代價是需要長期维護一份判断逻辑,而不是設定一次就結束。
動手前的自查顺序
- 拉一份現有索引頁面的清單,按模板類型分组,看哪一類數量異常。
- 抽样检查同類頁面的内容重合度,判断是獨立頁面還是同一模板的變体。
- 對照站内搜尋词與行為資料,確認哪些頁面真的被使用。
- 确定處理方式:保留、合並、加 noindex,還是只控制參數组合。三者後果不同,不要混用。
- 調整後观察抓取日誌和索引狀態的變化,而不是只盯着索引量這個數字。
提醒:阻止收錄和阻止抓取是两件事。用 robots.txt 挡掉一整類 URL,會让爬虫讀不到頁面上的任何指令,也無法顺着這些頁面發現更深的内容;如果目的只是不让它進索引,通常用 noindex 更合适。
小结
批量生成的頁面本身不是坏東西,問题往往出在“没有判断就全部放開”。把頁面按模板分组、按需求取舍,比纠结某一個标簽頁要不要收錄更有意义。索引里的頁面越接近用戶真正會打開的頁面,後續的抓取分配和問题排查都會更清晰。