網站收錄

抓取频次不低,重点頁面却總排不上:抓取预算分配的核對顺序

日誌里爬虫天天来,想被收錄的頁面却迟迟没動静,問题常常不在“来没来”,而在抓取次數花在了哪里。本文按 URL 類型分组日誌、找出吃掉预算的入口,再把内鏈、sitemap 與 robots 收敛到重点頁,给出一套可落地的核對顺序。

網站收錄

抓取频次不低,重点頁面却總排不上:抓取预算分配的核對顺序

日誌里爬虫天天来,訪問量看着也不少,可真正想被收錄的那批頁面就是迟迟没動静。遇到這種情况,先別急着怀疑“蜘蛛不来”或者“站点被降權”,很多时候問题在另一件事上:爬虫来的次數确實不少,但几乎都花在了不值得抓的 URL 上。留给重点頁面的那份額度,自然就不够了。

先把抓取预算和收錄名額分開看

抓取预算可以粗略理解為:在單位時間里,搜尋引擎愿意在你這個站点上花掉的抓取次數與服務器资源。它受站点規模、更新频率、响應速度、歷史抓取质量等因素影响,不是固定的數字。而收錄名額是另一回事,抓到了不等于會進索引。两者的關系是:抓取是前提,收錄是结果,但抓得多不代表收錄得多。所以核對的第一步,是把問题定位在第几层。

第一步:把日誌按 URL 類型分组,而不是按總量看

只看“今天爬虫来了多少次”意义不大。把一段時間的日誌導出,按 URL 特征归成几類,各占多少比例,一眼就能看出問题。

  • 列表頁與分頁:從第一頁一路翻到很深的頁碼;
  • 參數與站内搜尋:篩選、排序、關鍵詞组合生成的地址;
  • 静態资源與附件:图片、脚本、样式、PDF、下载文件;
  • 重复變体:同一個内容的不同 URL 形式;
  • 真正的詳情頁與栏目頁:你希望被收錄的那部分。

如果前面几類加起来占了大头,而最後一類只占很小一块,那么“重点頁面等不到抓取”就有了解释。

第二步:找出正在吃掉预算的入口

分頁與列表的层层深入

列表頁本身有價值,但深到第十几頁之後,往往内容重复度高、單頁價值低,却和首頁一样要消耗一次抓取。检查一下列表的分頁是否有终点,是否所有頁碼都能從某處被连續点進去。

參數组合與站内搜尋

篩選參數、排序參數、站内搜尋结果的排列组合,是抓取预算最常见的消耗点。這類頁面通常對用戶有用,對索引却價值有限,容易被大量生成又被反复抓取。

跳轉鏈、超时與错誤碼

多跳重定向、响應過慢導致的超时、频繁出現的 5xx,都會让爬虫在同一批 URL 上反复重试。這部分開销看不见,但确實占額度。可以在日誌里专门統計响應碼分布和平均响應時間。

第三步:把预算往重点頁引

  1. 内鏈入口集中:让重点栏目頁和詳情頁能從首頁或主干導航在少數几次点击内到達,减少层层嵌套。
  2. sitemap 只放重点:把真正希望被發現的 URL 放進去,低價值參數頁與深层分頁不必一一列出。
  3. 收敛無價值路径:對確認不需要抓取的參數组合,用 robots.txt 屏蔽;對需要保留给用戶但不需要進索引的頁面,用 noindex,两者用途不同,不要混用。
  4. 把跳轉压到一跳:站内連結直接指向最终地址,避免鏈鏈相接。
  5. 先把速度提上来:同一時間段内响應越快,能完成的抓取次數通常越多,這是最實在的一步。

第四步:調整後看什么

改動不要一次全上,隔一到两周再拉一次日誌,重点看三個變化:重点目錄在總抓取中的占比有没有上升、响應碼分布是否更干净、平均响應時間是否下降。如果占比在動,說明分配方向對了,接下来才是收錄量的观察。

抓取频次高,只能說明爬虫愿意来;要让頁面進索引,還得看它值不值得留。別把两件事混成一件来排查。

最後提醒一句:這類調整通常不會立刻见效,搜尋引擎需要時間重新评估站点的抓取需求。與其反复改结构,不如先把日誌讀清楚,一次只動一两個變量,再對比前後資料。