很多站長盯着“今天蜘蛛来了几次”,却很少看“它把時間花在了哪些URL上”。同一個站点,抓取资源是有限的:蜘蛛一天愿意訪問的頁面上限、每次停留的深度,都會影响新頁面被發現的早晚。收錄慢,有时不是蜘蛛没来,而是它来了一趟,時間全花在了低價值URL上。
抓取预算说到底是訪問分配
搜尋引擎不會给每個站無限次訪問。它會參考歷史抓取质量、更新频率、站点規模,给出一個大致的訪問額度。額度之内先抓谁、抓多深,由站点的结构表現和歷史反馈决定。
所以要分清抓取和收錄是两件事:被抓取只說明URL被訪問過,是否進入索引還要看内容是否值得保留、是否與站内其他URL高度重复。但抓取是前提,如果額度被大量無價值URL占用,新頁面连被看一眼的机會都會推迟。
最容易被反复抓取的几類URL
- 參數篩選與排序頁:?color=red、?sort=price 這類组合能生成成百上千個URL,内容却高度相似。
- 無限翻頁:分頁一路往下翻,越往後内容越重复,蜘蛛却可能跟着一直走。
- 會话ID與跟踪參數:带 sid、from、utm 的連結被内鏈或外鏈大量引用,同一頁面被当成多個URL。
- 失效跳轉鏈:302 跳来跳去,最终指向首頁或404,蜘蛛會持續消耗抓取次數。
- 软404與空结果頁:搜尋無结果仍然返回200,内容為空,也容易被当成正常頁面反复訪問。
先判断:這個URL有没有獨立價值
整理之前不用急着删。可以先問三個問题:
- 它有没有獨特内容,用戶直接搜這個词时會不會需要它?
- 它是不是被站内連結或外鏈大量引用,去掉會不會造成死鏈?
- 它和主版本相比,是不是只有排序、篩選、分頁的差別?
前两個答案是“是”,就保留並给它一個明确的規范版本;只有第三個是“是”,通常可以合並或屏蔽。
可以動手做的三步
- 归一化:确定每個内容只對應一個主URL,其余通過 canonical、跳轉或參數規則指向它。
- 控制入口:篩選、排序類連結不要在内鏈里大面积铺開,必要时用 robots 規則限制無意义组合被抓取。
- 给重点頁留入口:新頁面和重要栏目,從首頁、栏目頁和站点地图三條路都能走到,別让它們只靠一條很深的路径。
如果站内還有蜘蛛池或第三方推送類工具在配合,建议先明确它們负责的是“让URL更早被發現”,而URL規范、頁面质量和入口结构仍然要靠站点自己解决,两者別混為一谈。
整理後看两個指标
一是抓取分布:日誌里重点URL占的比例有没有上升;二是新URL從發布到首次被抓的時間有没有缩短。不必天天看,按周對比就够。若一段時間内没有變化,再回到入口和規范上找原因,而不是繼續加推送。
抓取资源不是越多越好,而是越集中越好。把蜘蛛引到真正希望被收錄的頁面上,剩下的交给頁面本身的质量。