同一批上线的頁面,過两周再去看,有的已经進了索引,有的還停在“已發現”,甚至日誌里從头到尾没出現過。這種情况不一定和内容好坏直接相關,很多时候是抓取预算的分配结果——蜘蛛在一段時間内愿意發出的請求數有限,谁先被爬、谁被反复爬,取决于站内结构给了哪些信号。
抓取预算不等于固定配額,但它确實存在
抓取预算可以粗略理解為:在一定時間内,蜘蛛愿意在你的站点上發出的請求數量。它受两方面影响,一是站点被信任的抓取能力,二是站点的响應速度與健康状况。這里需要說明的是,抓取量高低並不直接等于收錄结果:抓了不一定收,但没抓基本不會收。
预算被谁悄悄消耗掉了
多數站点的浪費不是因為頁面太多,而是因為無價值的 URL 太多:
- 參數與篩選组合:排序、分頁、篩選叠加後产生的成百上千個變体,内容几乎相同。
- 重复列表與空结果頁:篩選後無结果,頁面照样生成,返回 200 却没有實质正文。
- 软 404:内容已经刪除,却仍然返回正常狀態碼,蜘蛛會反复回来確認。
- 重定向鏈:A 跳到 B、B 再跳到 C,每一跳都要單獨消耗一次請求。
- 大体积资源與慢响應:單頁加载慢,蜘蛛並發上不去,單位時間内能爬的數量自然就少。
把這些加起来,重点頁面能分到的抓取次數就被挤掉了。可以先看日誌里被抓得最多的前 100 個 URL,數一數其中有几個是你真正希望被收錄的。
按目錄做一次對照自查
- 導出近 30 天日誌,按目錄聚合請求數與唯一 URL 數。
- 和 sitemap 里的 URL 清單對照,找出抓得少但頁面质量高的目錄。
- 在索引狀態报告里看分布,区分“已抓取未索引”和“已發現未抓取”各占多少。
- 挑一個收錄好的目錄和一個收錄差的目錄,比較模板层數、内鏈數量和响應時間。
- 確認表現差的那一批頁面,是否真的能從首頁通過可点击連結抵達。
如果某一批頁面“已發現未抓取”占比很高,問题多半在抓取侧;如果“已抓取未索引”占比高,重点就要轉向頁面本身的质量與重复度。方向不一样,改動点也完全不一样。
把预算導向重点頁面的做法
先减少浪費
- 對没有检索價值的篩選參數组合做收敛,必要时屏蔽抓取路径。
- 空结果頁返回 404,或者至少加上 noindex,避免長期占用抓取。
- 清理多跳重定向,内鏈直接指向最终地址。
- 下架内容用 410 或 404 明确表態,不要留着返回 200 的空壳。
再给重点頁面腾路
- 從首頁或栏目頁用普通連結指向重点内容,减少点击深度。
- sitemap 只保留希望被收錄的規范 URL,規模控制在能维護的范围。
- 列表頁控制單頁條目數量,用分頁承接,而不是一次性加载全部。
- 精简模板层重复模块,让正文在 HTML 里更早出現。
几個容易搞混的点
抓取频率提高,不代表收錄比例一定上升,内容重复、信息量不足的頁面依然可能被排除。反過来,頁面本身质量不错,如果站内没有任何路径指向它,也很难被發現。蜘蛛池這類工具能改善的主要是 URL 被發現的速度,是否進入索引仍然取决于頁面本身和站点整体健康状况。
先判断問题出在“没被抓”還是“抓了没收”,两者的處理方向完全不同,混在一起改往往白費力气。
實际运营中,建议每隔一段時間做一次抓取與索引的對照,把目錄級別的差异记錄下来,而不是只盯着整站的總收錄數。總數波動大、受很多因素干扰,目錄之間的横向對比反而更容易看出结构問题在哪里。