搜尋抓取

篩選頁、站内搜尋頁與标簽頁:哪些入口该让蜘蛛走進去

篩選頁、站内搜尋頁、标簽聚合頁往往是站点里數量最容易失控的入口。本文讨论如何判断哪些入口值得對蜘蛛開放,robots、noindex、canonical、nofollow 该怎么搭配,以及關掉入口後如何补回通往詳情頁的抓取路径,並用日誌驗證調整效果。

搜尋抓取

篩選頁、站内搜尋頁與标簽頁:哪些入口该让蜘蛛走進去

很多站点的問题不是蜘蛛不来,而是蜘蛛被大量低價值入口牵着走,真正要抓的詳情頁反而排在後面。篩選頁、站内搜尋结果頁、标簽聚合頁是三類最容易失控的入口——它們數量能瞬間膨胀到几十萬,内容却高度重复。與其到處發外鏈,不如先管好這些入口,让抓取路径尽量落在有增量内容的頁面上。

入口管理為什么比外部引流更直接

外鏈决定蜘蛛愿不愿意来,站内入口决定蜘蛛来了往哪走。当列表頁上的篩選連結比詳情頁連結還密集时,蜘蛛會更倾向于沿着參數分支扩散,因為這些連結离首頁更近、數量也更多。抓取量在同一段時間内是有限的,被參數頁分走的部分,本来可以用在詳情頁上。

三類高風險入口的抓取特征

篩選與排序參數頁

颜色、尺碼、排序方式一层层叠加,理论上能生成成百上千個 URL,而頁面内容往往只是同一批商品的重新排列。蜘蛛抓到一定量後會把它們当重复内容處理,但抓取過程本身已经花掉了配額,日誌里看起来還很热闹。

站内搜尋结果頁

搜尋结果頁對用戶有用,對蜘蛛基本没有增量:内容来自站内其他頁面,且會随關鍵詞無限扩展。如果允许蜘蛛抓取,等于给蜘蛛開了一個無穷的 URL 生成器,而且這些頁面通常還是空連結的聚集地。

标簽頁與聚合頁

少數人工维護、有編輯意图的标簽頁是好的入口,能帮蜘蛛走通長尾。但如果标簽由用戶提交或系統自動生成,就會出現只有一两條内容的空壳标簽頁,既稀释了站内連結,也让蜘蛛在低價值頁面之間来回绕。

判断某個入口该開還是该關

  • 這類頁面是否有獨立、不重复的内容價值?
  • 它的 URL 數量是否可控,會不會随用戶行為無限增長?
  • 它是否處在抓取路径的關键位置,承担中轉作用?
  • 關掉它之後,下級頁面是否還有別的入口可達?

四個問题里,只要數量不可控和無獨立内容同时成立,基本就该限制抓取。反過来,如果它是通往詳情頁的重要通道,即便内容一般,也可以保留,但要控制參數组合的數量。

几種處理方式,別混着用

robots.txt 的 disallow、頁面上的 noindex、canonical、nofollow 作用完全不同:

  1. Disallow:蜘蛛不會去抓,同时也就讀不到頁面上的 noindex。只适合你完全不希望出現的那類路径,且要小心別挡住需要被抓的頁面。
  2. Noindex:允许抓取,抓完不给索引。适合參數頁這種能抓但不该留的情况,前提是頁面没有被 robots 屏蔽,否則指令讀不到。
  3. Canonical:告诉蜘蛛多個地址里哪個是主版本,适合同一内容有多種篩選、多種排序的场景。
  4. Nofollow:减少蜘蛛顺着連結繼續扩散,但它只是提示,不是硬性阻断,別指望靠它彻底封死入口。

參數篩選頁常见的组合是:允许抓取,canonical 指向無參數的列表主版本,同时不對排序類參數生成可点連結。這样既不让蜘蛛断粮,也不至于被參數分支拖走。

關掉入口之後,记得给蜘蛛留條路

限制入口的同时要检查连通性。如果某批詳情頁只能通過站内搜尋或篩選頁到達,一旦關掉,它們就會變成只有 Sitemap 里才有地址的孤岛。這时候需要用固定的分類頁、分頁、相關推荐把路径补回来,並在 Sitemap 中保留這些 URL,让蜘蛛至少有一條稳定的入口。

入口管理的目标不是少让蜘蛛抓,而是让有限的抓取量花在有增量内容的頁面上。判断标准始终是:這個頁面被抓住,對用戶和索引有没有带来新的東西。

怎么驗證調整是否有效

改完不會立刻见效。建议在服務器日誌里看两個指标:一是參數類 URL 的抓取占比是否下降,二是詳情頁的抓取次數是否上升。再结合抓取統計中 URL 被訪問的比例變化,判断方向對不對。如果两周後參數頁占比没降,多半是入口没真正封住,還有別的列表在大量輸出這類連結。