搜尋抓取

站内搜尋頁與标簽聚合頁:蜘蛛在這類入口上會走多遠

站内搜尋頁和标簽聚合頁由系統自動生成,入口多、内容變化快,蜘蛛很容易顺着它們一路抓下去。本文讲怎么区分有價值的聚合頁與内容單薄的噪音頁面,以及用 robots、noindex、canonical、内鏈和 Sitemap 控制抓取范围,最後從日誌里看抓取量到底落在哪類頁面上。

搜尋抓取

站内搜尋頁與标簽聚合頁:蜘蛛在這類入口上會走多遠

站内搜尋頁和标簽聚合頁有一個共同点:它們不是編輯手動挑出来的頁面,而是由用戶查询或内容属性自動生成的。蜘蛛顺着内鏈或 Sitemap 進来後,很容易把這套机制当成一條可以無限延伸的路,一路抓下去。問题不在于這些頁面能不能被抓,而在于你希望蜘蛛把有限的抓取次數花在哪里。

為什么蜘蛛容易在這類頁面停留

它們的入口通常很多。導航里可能挂着热门标簽,文章底部有相關标簽,搜尋结果頁里又有大量指向具体内容的連結。對蜘蛛来说,這是密集的連結区,跟着走不需要額外理由。另一方面,這類頁面返回的内容變化快,同一條地址今天和明天的结果可能完全不同,蜘蛛會更频繁地回訪。

先分清:有用的聚合頁和纯噪音

站内搜尋结果頁

搜尋頁的價值在于响應用戶查询,而不是给搜尋引擎提供一份目錄。常见的 /search?q= 形式會随着查询词组合出近乎無限的地址,每一個都返回一份内容單薄的列表,而且往往和分類頁、文章頁高度重合,没有獨立标题,也没有獨立介绍。除非搜尋结果頁本身有稳定的检索價值,比如某些垂直站点固定下来的篩選頁,否則一般不需要让蜘蛛深入。

标簽聚合頁

标簽頁要分開看。有的标簽确實能聚合成一個主题,有稳定的搜尋需求,頁面也补了導语、說明和足够的條目,那它就是资产。有的标簽只挂了两三篇文章,标题只有标簽名,内容和其他分類嚴重重复,那它對用戶和蜘蛛都意义不大。判断标准可以简單一点:這個頁面如果被用戶直接搜到,他會不會觉得有用。

几種常见的收口方式

  • robots.txt 屏蔽:适合完全不想被爬取的路径,比如 /search。注意被屏蔽之後蜘蛛讀不到頁面上的 noindex,两者不要同时指望。
  • noindex:适合内容單薄但仍希望被訪問、被連結的頁面。前提是允许抓取,蜘蛛才能讀到這個指令。
  • canonical 指向主頁面:标簽頁與分類頁大量重合时,指向對應的分類或主聚合頁,帮助蜘蛛把權重集中起来。
  • 控制内鏈數量:不要在每篇文章底部挂几十個标簽,也不要把搜尋框产生的連結放進可被抓取的正文。
  • 合並标簽:把同义、近义标簽合並成一個人工维護的聚合頁,比任由系統自動生成更可控。

内鏈和 Sitemap 要配合

如果你决定保留某批标簽頁,就把它們放進導航或固定区块,並让 Sitemap 里出現的地址和站内實际連結保持一致。反過来,被 noindex 或屏蔽的頁面不要塞進 Sitemap,否則等于一邊说別抓,一邊又主動上报。分頁的聚合列表也一样,第一頁可以做入口,後面的翻頁不必全部上报。

從日誌里看结果

調整完之後,隔一段時間翻一下服務器日誌,看抓取量在搜尋頁、标簽頁、正文頁之間的分布。如果搜尋路径仍然占了大头,說明還有別的入口在放行,比如某個頁脚、某個外鏈,或者 Sitemap 里残留了舊地址。重点看蜘蛛把時間花在哪類頁面上,而不是單日總數的高低。

這類頁面本身不是問题,問题是它們太容易變成一條没有终点的路。给它一個明确的邊界,蜘蛛才更愿意把次數用在正文頁上。