網站收錄

抓取日誌里全是 200,收錄量却没變化:日誌先按狀態碼和頁面類型分開看

抓取日誌只能證明蜘蛛来過,不能證明頁面會被收錄。当狀態碼看着正常、索引量却長期不動时,可以把日誌分成三层来看:先過滤出可信的搜尋引擎請求,再按狀態碼分布和頁面類型聚合,最後核對詳情頁的渲染结果與 robots、canonical 信号。文中给出一份可执行的核對顺序,帮你判断卡在抓取层還是收錄层。

網站收錄

抓取日誌里全是 200,收錄量却没變化:日誌先按狀態碼和頁面類型分開看

蜘蛛来得挺勤,狀態碼也大多正常,但索引量几周不動,這是运营中很常见的一種情况。先把两件事分開:抓取是蜘蛛把頁面取回,收錄是搜尋引擎判断這個 URL 值不值得放進索引。日誌只能證明前者發生過,不能證明後者一定會来。所以看日誌的目的不是“證明蜘蛛来過”,而是找出蜘蛛把時間花在哪里、哪些頁面临近收錄门槛。

第一步:確認日誌本身是可用的样本

样本不可靠,後面所有结论都會偏。至少要做三件事:限定時間范围、過滤 UA、剔除自己产生的請求。

  • 時間范围:太短會被偶發抓取誤導,一般看两周以上再下结论。
  • UA 與 IP 双向核對:只看 UA 字符串容易被伪造或被第三方工具污染。
  • 去掉监控探针、预渲染服務、CDN 健康检查和自己的測試訪問,否則統計失真。

第二步:按狀態碼分布看蜘蛛的“体力”花在哪

把可信請求按狀態碼分组,通常一眼就能看出問题集中在哪里。

  • 200:正常取回。重点不是數量多少,而是這些 URL 是不是你想收錄的那批。
  • 301 / 302:留意跳轉鏈長度,以及最终落地的 URL 是不是規范版本。
  • 304:說明内容相對上次没有變化,或改動信号没传出去。
  • 404 / 410:下架頁面還在被反复請求,多半是外鏈或站内連結没清理。
  • 403 / 429 / 5xx:服務器或防護层在拦蜘蛛,抓不到自然谈不上收錄。

第三步:按頁面類型聚合,看重复抓取

把日誌按路径前缀聚合,常能看到某一類 URL 吃掉了多數請求,比如各種篩選參數頁、排序頁、翻頁。這類頁面被反复抓取,會挤占真正需要收錄的詳情頁的抓取机會。此时先判断這些頁面该不该被大量抓取,再决定是收敛入口、加參數規范,還是保留观察。

第四步:看响應体大小與渲染结果

日誌里的响應体大小只能作粗略參考,不能直接当成“内容够不够”。如果詳情頁返回的 HTML 只有模板骨架、正文靠脚本注入,要單獨用渲染工具確認渲染後的正文、内鏈和标题是否完整。骨架頁被反复抓取却始终不進索引,是很典型的信号。

抓取层没問题,再回到收錄层核對

日誌解释不了收錄,接下来要回到頁面本身逐項確認:canonical 是否指向自身或正确的規范 URL;是否存在 noindex 或 X-Robots-Tag;與站内其他頁面是否高度相似;是否有清晰的主体内容;是否能從内鏈或列表入口走到。這几項里任何一項出問题,都可能让頁面停在“已抓取,未编入”的狀態。

一份可以直接照着做的核對顺序

  1. 取最近 14 至 28 天日誌,過滤到搜尋引擎 UA,去重成 URL 列表。
  2. 按狀態碼分组,先處理 403、429、5xx 這類“抓不到”的問题。
  3. 按路径前缀聚合,找出被高频抓取但價值偏低的頁面類型。
  4. 挑 10 至 20 個本该收錄的詳情頁,逐個看渲染结果、canonical 與 robots 指令。
  5. 對照索引狀態(已收錄 / 已發現未编入 / 已抓取未编入),按狀態分別處理。
  6. 记錄改動日期,隔两三周再比對日誌與索引量,驗證改動是否真的起作用。
日誌是诊断工具,不是收錄開關。抓取频率提高不等于一定會被收錄,任何“多久见效”的说法都只能当作參考区間。

實际排查时,日誌和索引狀態要對着看:日誌說明蜘蛛在做什么,索引狀態說明搜尋引擎怎么看這些頁面。两邊對不上的地方,往往就是需要動手改的地方。