站点运营

站点运营:站内搜尋與篩選结果頁自查,別让無穷组合把抓取配額耗光

站内搜尋頁和篩選頁由程序自動生成,组合數量几乎無穷,很容易在抓取日誌里占據大头,把真正需要更新的内容挤到後面。本文按断内鏈、加标簽、收维度的顺序,梳理一套可执行的排查思路,帮助把抓取留给有價值的頁面。

站点运营

站点运营:站内搜尋與篩選结果頁自查,別让無穷组合把抓取配額耗光

不少站点的抓取日誌里,占比最高的往往不是正文頁,而是一串带問号的地址:站内搜尋结果、排序方式、價格区間、品牌篩選、時間范围。這些頁面由程序自動生成,组合數量可以無限延伸,蜘蛛顺着一個連結進来,就可能带走几千上萬條地址。抓取配額是有限的,被這類頁面吃掉一部分之後,真正需要更新的内容反而排不上队。

先分清两類頁面

站内搜尋頁是用戶輸入關鍵詞後生成的结果頁,地址里通常带 q 或 keyword 參數。篩選與排序頁是列表頁叠加條件後的形態,比如颜色、排序、頁碼同时出現。两者看起来都是列表,性质却不同:搜尋頁的關鍵詞来自用戶,几乎無穷;篩選頁的维度由站点自己定义,是可以收窄的。

從日誌里找證據

判断問题是否存在,不用凭感觉,先看几項指标:

  • 带參數的地址在抓取總量中占多少比例;
  • 同一個搜尋參數出現了多少種不同取值;
  • 排序與頁碼參數是否被反复抓取;
  • 這些地址返回的狀態碼是 200,還是 404、301;
  • 抓取時間與頁面最後更新時間是否對得上。

如果某個篩選條件被反复抓取,但每次返回的内容几乎一样,這批地址基本就是在消耗资源。

處理顺序:先止损,再收敛,最後决定留谁

  1. 内部連結自查。導航、面包屑、正文里是否直接鏈到搜尋頁或排序地址。先断掉這些入口,比改代碼见效快。
  2. 搜尋頁统一加 noindex。让蜘蛛可以抓取、可以讀到标簽,但不進入索引。
  3. 篩選頁定维度。只保留内容确有差异的少數组合,其余组合用 canonical 指回主列表頁。
  4. 排序參數規范化。排序通常不该产生獨立頁面,建议用前端切換,或统一指向預設排序。
  5. 留一個观察周期。過一段時間再看日誌,確認带參數的抓取占比是否下降。

noindex 和 robots 屏蔽別叠着用

被 robots.txt 屏蔽的頁面,蜘蛛拿不到頁面内容,也就讀不到頁面里的 noindex。结果可能是地址仍留在索引中,只是描述變空。想让它登出索引,就让它可抓但加 noindex;想省抓取配額,就用 robots 屏蔽。同一批地址上,這两件事不要同时做。

篩選维度怎么定才算合理

判断标准不是“這個篩選好不好用”,而是“這個组合有没有獨立的内容價值”。颜色、尺碼這類维度拼出来的结果頁,内容與主列表高度重合;而“某個城市加某個品類”“某個價位段加某類产品”這種组合,如果确實對應着具体内容和介绍文字,做成可索引頁面才有意义。數量上宁少勿多,先做十几個驗證,看它們有没有稳定的自然流量,再考虑扩展。

一份可执行的检查清單

  • 搜尋頁是否已加 noindex;
  • 站内是否還有指向搜尋结果的連結;
  • 排序參數是否生成了獨立可抓地址;
  • 篩選组合是否设了上限;
  • 同一批内容是否會在多個篩選组合里重复出現;
  • 日誌中带參地址的占比是否下降。

這件事不需要一次改完。先看日誌確認問题存在,再按“断内鏈、加标簽、收维度”的顺序推進,每改一步留一段時間观察抓取變化。搜尋頁和篩選頁對訪客本身是有用的,不必删掉,關键是別让它們成為蜘蛛進入站点的主要入口。