有些站点會遇到一種情况:服務器日誌里蜘蛛来得很勤,抓取次數不少,但搜尋索引里的頁面數几乎不動。于是很多人第一反應是繼續加蜘蛛入口、改抓取频率,结果日誌更热闹,索引依舊没變化。抓取和收錄本来就是两個环节,抓取多只能說明蜘蛛愿意来,收錄與否還要看頁面本身是否值得進入索引。
先把抓取和收錄拆開看
抓取是蜘蛛讀取 URL 的過程,收錄是搜尋引擎把頁面编入索引並可供展示。抓取成功不等于收錄,返回 200 也不等于通過质量评估。日誌里的 200 响應、抓取频次、抓取字节數,都只能證明蜘蛛来過。
要判断問题出在哪一环,可以先把資料分成三组:
- 抓取层:日誌中蜘蛛的請求次數、响應碼、抓取耗时。
- 索引层:索引狀態里有效、已排除、错誤頁面的數量變化。
- 頁面层:這些被频繁抓取的 URL,内容质量、重复度、内鏈位置是否一致。
如果抓取层正常,索引层長期不動,重点就不该放在“让蜘蛛更频繁地来”,而應放在“让頁面更值得被索引”。
頁面质量:先看被抓的頁面是不是同一類
抓取频次高但索引增長慢,常见于網站里大量頁面属于同一模板、同一字段组合或同一篩選结果。蜘蛛在几個入口之間来回抓,索引却只留下少數代表頁。這时可以抽查日誌里抓取最频繁的 URL,按下列顺序核對:
- 内容是否獨立:頁面主体是否只有标题和几條參數不同,正文大量重复。
- 是否有真實需求:该頁面是否對應一個用戶會搜尋的問题,還是只是站内流程的中間頁。
- 是否可被替代:同站是否已有更完整、更權威的頁面覆盖同一主题。
- 是否稳定可訪問:返回碼、渲染结果、移動端体驗是否長期一致。
如果多數被抓頁面都落在“模板化、無獨立信息、可被替代”里,索引不增長就是正常结果。繼續放大抓取,只會重复消耗资源。
重复内容與 URL 規范:別让同一内容分散成多個地址
另一個常被忽略的点是重复内容。同一頁面通過參數、大小寫、斜杠、打印版、排序篩選等组合出多個 URL,蜘蛛每個都抓,索引却只會選擇一個主版本。抓取量看着上涨,實际有效頁面没有增加。
處理时先做 URL 收口,再做内容取舍:
- 能 301 的重复地址尽量 301 到主版本,不要只靠 canonical 提示。
- 篩選、排序、跟踪參數用 robots.txt 或 noindex 控制时,要確認不會誤挡主版本。
- 站内連結统一指向主版本,减少蜘蛛從内鏈發現重复地址的机會。
- 對确實無獨立價值的頁面,考虑合並或刪除,而不是保留大量近似入口。
canonical 是提示,不是强制指令。重复地址如果仍能被内鏈、sitemap 和外部連結大量發現,蜘蛛仍會反复抓取。
内鏈與入口:把抓取预算引到该去的頁面
当站点頁面數量很大时,蜘蛛的抓取预算是有限的。如果導航、列表頁、标簽頁把大量連結指向低價值頁面,高價值頁面反而离首頁較遠,就會出現“抓取很多、收錄很少”。
可以按以下顺序整理入口:
- 首頁和栏目頁只保留少量稳定入口,指向核心内容。
- 列表頁翻頁、篩選组合、用戶中心等頁面,评估是否需要被索引。
- sitemap 只放希望被收錄的主版本 URL,不要把重复地址和參數頁全部塞進去。
- 對重要但抓取少的頁面,增加站内推荐位或相關阅讀入口。
一個實用的核對顺序
遇到抓取频次高、索引增長慢,可以按這個顺序走:先看日誌里被抓的是不是重复地址和低價值頁面;再抽查這些頁面的内容獨立性與质量;然後收口 URL 和内鏈;最後才考虑提交 sitemap、检查服務器响應等抓取层動作。每一步只解决一個問题,避免同时改多個變量。
需要提醒的是,索引數量本身會受頁面质量、站点整体信任和搜尋需求影响,没有一種操作能保證某個頁面一定被收錄。把抓取引到有價值的頁面上,把重复和低质頁面收掉,才是更可持續的做法。