網站收錄

爬虫天天来,頁面却没進索引:抓取與收錄之間的三道门槛

很多站長會遇到爬虫频繁到訪、目标頁面却迟迟不進索引的情况。本文把抓取和收錄拆成两件事,說明從下载、内容判断到索引准入要過的三道门槛,並给出一套可照着执行的核對顺序,帮助定位問题出在抓取、内容還是索引信号上。

網站收錄

爬虫天天来,頁面却没進索引:抓取與收錄之間的三道门槛

日誌里每天都能看到某個 URL 被爬,收錄却一直没動静,這種反差最容易让人誤判。抓取和收錄其實是两個獨立环节,中間還夹着内容處理和索引准入的判断。把這两件事混在一起看,往往會去改错東西。

抓取和收錄分別指什么

抓取是爬虫把頁面的 HTML 以及必要的资源下载下来,這一步只說明它来了、拿到了内容。收錄是抓取之後,搜尋引擎判断這個頁面有獨立價值、可以被索引,再把它放進索引库,之後才可能出現在搜尋结果里。

所以會出現几種狀態:被抓了但没收錄、收錄了但排不出来、抓取频率很高但索引量不動。它們對應的處理動作完全不同。

從抓取到收錄要過三道门槛

第一道:能不能顺利抓到

  • robots.txt 是否誤屏蔽了整站目錄或關键资源;
  • 返回的狀態碼是否稳定為 200,有没有間歇性 5xx 或超时;
  • 需要渲染的内容,原始 HTML 里是否為空;
  • 頁面是否依赖登入、Cookie 或特定地域才能看到主体内容。

這一關没過,日誌里要么根本不出現,要么大量报错,處理重点是让頁面能被正常抓到。

第二道:抓到的内容值不值得留

爬虫抓到了,不等于内容會被保留。以下几種頁面容易被判為低價值:

  • 正文只有几句话,其余全是導航、推荐位和广告;
  • 同一批内容在不同 URL 下反复出現,没有 canonical 或參數處理;
  • 列表頁、标簽頁、站内搜尋结果頁大量生成相似结构;
  • 内容由模板拼接,換個關鍵詞就当成一篇新頁面。

處理重点是让每個 URL 承载獨立信息,而不是繼續增加相似頁面。

第三道:處理之後能不能進索引

内容本身没問题,也可能因為信号冲突被挡住:

  • 頁面上的 canonical 指向了另一個更完整的版本,本頁會以那個 URL 的形式入索引;
  • HTTP 头或頁面里的 noindex 没有清理干净,是從測試环境带過来的;
  • 多個變体(带參數、带尾斜杠、大小寫不同)被合並,只保留一個代表 URL;
  • 站点整体质量偏低时,新頁面的收錄速度和比例都會明顯下降。
判断問题的顺序應该是:先確認被抓到,再看内容是否值得留,最後检查索引信号是否一致。跳過前两步直接改代碼,通常是在治标。

一個可以照着走的核對顺序

  1. 在服務器日誌或抓取統計里確認该 URL 是否真的被請求過,返回碼是什么。
  2. 把日誌按頁面類型分组,看是詳情頁不收錄,還是列表頁、篩選頁也在里面,問题范围會立刻缩小。
  3. 抓取原始 HTML(關閉 JS 或用抓取工具查看),確認主体内容在不在。
  4. 检查 robots、meta robots、X-Robots-Tag、canonical 四個信号是否互相一致。
  5. 對比同栏目下已被收錄的頁面,找出结构、長度、内容上的差別。
  6. 確認無誤後,用站内入口連結、Sitemap 提交等方式重新暴露 URL,然後耐心观察,不要反复提交。

常见的两個誤判

一是看到抓取频繁就以為快收錄了。抓取频率更多反映爬虫對站点的信任度和更新预期,和單個頁面能否入索引没有直接關系。

二是看到索引量没涨就去堆外鏈。如果頁面本身過不了第二道门槛,外鏈只會带来更多抓取,不會自動带来收錄。

小结

抓取是入口,收錄是结果,中間隔着内容质量與索引信号的判断。遇到爬虫来了但不收錄,先把两個數字分開,再顺着抓取、内容、索引信号這條线逐段核對,比盲目修改頁面要有效得多。