網站收錄

蜘蛛来了很多次,頁面還是没進索引:抓取之後的几道關卡

日誌里爬虫訪問频繁,頁面却始终没出現在搜尋结果里,這種落差通常不是抓取不够,而是卡在抓取之後的环节。本文按内容可解析性、指令設定、重复判定與索引排队四條线,梳理從抓取到收錄之間需要逐項核對的地方,並给出可操作的排查顺序。

網站收錄

蜘蛛来了很多次,頁面還是没進索引:抓取之後的几道關卡

服務器日誌里蜘蛛一天来几十次,頁面却始终進不了索引,這種情况很常见。抓取和收錄是两件獨立的事:抓取只說明蜘蛛取走了 HTML 响應,收錄要经過解析、评估、去重、排队几道环节,任何一步卡住,頁面都不會出現在搜尋结果里。所以看到“抓了不收錄”,先別急着加大提交量,按下面的顺序核對更有效。

先確認:你看到的“抓取”到底是什么

日誌里的记錄至少要看三件事:响應碼是不是 200、返回的字节數是否和正常頁面接近、請求的 UA 是不是真正的搜尋蜘蛛。有几種情况會被誤当成抓取:

  • 响應碼 200,但 Body 极小:往往是跳轉頁、拦截頁或空壳頁,蜘蛛拿到的是没有正文的 HTML。
  • 返回 301/302 鏈路過長:蜘蛛跟了几跳後停在中間頁,目标頁其實没被抓到。
  • UA 伪造的第三方爬虫:日誌量看着很大,對收錄没有任何作用。

抓取之後的四道關卡

1. 内容能不能被解析出来

蜘蛛拿到 HTML 後要先能讀到正文。正文全部由 JS 渲染、首屏之外才出現、被遮罩层或登入墙挡住,都會让解析结果接近空白。可以用“網址检查”里的原始 HTML 和渲染後 HTML 做對比,重点看正文有没有出現在原始响應里。

2. 指令有没有把頁面挡在索引外

很多“抓了不收錄”其實是頁面已经明确告诉搜尋引擎不要收錄。需要同时检查响應头和 HTML 里的两處設定:

  • HTML 中的 meta robots:noindex、none、noindex,nofollow 都會阻止進入索引。
  • 响應头中的 X-Robots-Tag:常见于 PDF、图片和 CDN 回源配置,作用與 meta 标簽一致,但最容易被忽略。
  • canonical 指向了別的 URL:頁面會被当作副本,信号合並到目标地址,自身不單獨收錄。

這三處只要有一處生效,抓取次數再多也不會有收錄结果。

3. 頁面是否被判為重复或低價值

正文與站内其他頁面高度重合、由模板批量生成、正文只占頁面很小比例,都會让頁面進入“被采集但不單獨保留”的狀態。此时日誌里能看到抓取,索引里只會留下其中一個版本。

4. 索引排队與可检索性

通過前面几關後,頁面進入索引队列。队列有先後,新站或低權重路径上的頁面可能等待較久。還有一種情况是已经進入索引,但没有任何查询能把它检索出来——這属于可检索性問题,和没收錄不是一回事,處理方向也不同。

用日誌和後台工具交叉核對

  1. 日誌里筛出目标 URL,记錄最近一段時間的抓取频次、响應碼、返回字节數。
  2. 後台做一次“網址检查”,看抓取到的 HTML 與渲染後 HTML,以及抓取狀態是否正常。
  3. 對照抓取响應,逐條確認 meta robots、X-Robots-Tag、canonical 的最终取值。
  4. 把頁面正文與相近頁面做文本比對,判断是否属于同一批重复内容。
  5. 观察两到四周,看索引狀態是停在原地還是有變化,再决定是否調整内容或结构。

几個容易走偏的判断

  • 把抓取频次当收錄進度:频次反映的是蜘蛛對地址的兴趣,不反映索引结果。
  • 反复提交同一個 URL:提交只是补充發現渠道,不改變頁面本身的评估。
  • 给重复頁面加大量外鏈:重复問题不會因為外鏈變多而消失。
抓取是入口,收錄是结果。中間隔着解析、指令、去重和排队四步,排查时按顺序走,比盲目加大提交量省事得多。