站点里總有一類頁面:本身没有多少正文,主要内容是一串連結。标簽聚合頁、日期归档頁、空分類頁、分頁列表、站内搜尋结果頁,都属于這一類。它們往往由 CMS 自動生成,數量随着内容增加而不断膨胀。蜘蛛沿着内鏈或 Sitemap 走進来,看到的是一頁連結,而不是一頁内容。
這類頁面本身不一定是問题。問题在于它們會形成一條條抓取路径,把蜘蛛的時間和請求分摊到低價值地址上,同时稀释站内重要頁面的入口信号。
蜘蛛走進薄頁面後會發生什么
蜘蛛打開這類頁面时,處理方式和其他 HTML 頁面没有区別:下载 HTML、解析連結、把新發現的 URL 放進待抓取队列、按規則决定是否回訪。区別在结果上——頁面里可提取的正文很少,可提取的連結很多,于是它更像一個中轉站,而不是终点。
如果标簽頁或归档頁每次更新都會改變連結顺序,蜘蛛每次回訪看到的連結集合都在變,回訪的價值就更低。如果這類頁面的 URL 還能被參數、排序方式、分頁翻出多個變体,同一批連結會用不同地址反复出現。
几種常见類型與處理思路
标簽聚合頁
标簽頁适合把同一主题的内容串起来。如果标簽數量遠超内容數量,或者一個标簽下只有一两篇文章,可以考虑合並标簽、取消自動生成,或者保留頁面但限制它進入 Sitemap 和内鏈的主要位置。
常用的做法是把低價值标簽頁做成 noindex, follow:頁面仍可被抓取、被当作路径使用,但不進入索引,避免和分類頁、詳情頁争夺同一批關鍵詞。
日期归档頁
按年月归档的頁面,對讀者来说價值通常不高,對蜘蛛来说則是稳定的連結列表。内容量不大的站点,可以考虑不生成归档頁,或者在归档頁上只保留少量連結,把入口從主導航移出。
空分類與零结果頁
空分類頁和篩選後没有结果的頁面,容易返回一個空列表。這類頁面建议返回合适的狀態碼,並给出返回上一級分類的連結;長期空置的分類頁可以考虑合並到父分類。
分頁列表
分頁是發現老内容的重要通道,但也容易變成一條很長的鏈。可以在列表頁保留“下一頁”和頁碼連結,但在某個深度之後停止向外延伸,同时确保每篇文章至少能從分類第一頁或相關推荐里進入。
站内搜尋结果頁
站内搜尋结果頁通常由參數触發,结果集不稳定。這類頁面一般不需要被索引,也不建议放進 Sitemap。用 noindex 處理比用 robots.txt 屏蔽更合适,因為屏蔽會让蜘蛛看不到頁面上的連結,也不利于後續排查。
几個可以立刻检查的点
- Sitemap 里是否混入了标簽、归档、分頁和搜尋结果地址。
- 主導航、面包屑、頁脚是否把低價值頁面放在了最顯眼的位置。
- 薄頁面上的連結是否指向了重复地址,比如带參數、带排序、带會话 ID 的版本。
- 同一批文章是否同时出現在分類頁、标簽頁、归档頁和推荐位中,形成多條重复路径。
- 這類頁面的更新是否過于频繁,導致蜘蛛每次来都看到一批新連結。
该保留還是该收口
判断标准不复杂:這個頁面有没有真實用戶訪問,有没有搜尋需求,能不能带来阅讀或轉化。有,就把它当成正式頁面维護,给它稳定的标题、描述和内容;没有,就减少它的入口,让它慢慢登出主要抓取路径。
薄頁面的問题通常不是蜘蛛抓不抓,而是蜘蛛把時間花在這里值不值。
處理這類頁面,重点是让抓取路径保持清晰:主干分類和詳情頁有稳定入口,标簽、归档、分頁各有明确职责,低價值地址不占用主要位置。做完這些,日誌里反复出現的地址會少一些,真正需要抓取的頁面被走到的机會也更大一些。