日誌里每天都能看到某個 URL 被爬,收錄却一直没動静,這種反差最容易让人誤判。抓取和收錄其實是两個獨立环节,中間還夹着内容處理和索引准入的判断。把這两件事混在一起看,往往會去改错東西。
抓取和收錄分別指什么
抓取是爬虫把頁面的 HTML 以及必要的资源下载下来,這一步只說明它来了、拿到了内容。收錄是抓取之後,搜尋引擎判断這個頁面有獨立價值、可以被索引,再把它放進索引库,之後才可能出現在搜尋结果里。
所以會出現几種狀態:被抓了但没收錄、收錄了但排不出来、抓取频率很高但索引量不動。它們對應的處理動作完全不同。
從抓取到收錄要過三道门槛
第一道:能不能顺利抓到
- robots.txt 是否誤屏蔽了整站目錄或關键资源;
- 返回的狀態碼是否稳定為 200,有没有間歇性 5xx 或超时;
- 需要渲染的内容,原始 HTML 里是否為空;
- 頁面是否依赖登入、Cookie 或特定地域才能看到主体内容。
這一關没過,日誌里要么根本不出現,要么大量报错,處理重点是让頁面能被正常抓到。
第二道:抓到的内容值不值得留
爬虫抓到了,不等于内容會被保留。以下几種頁面容易被判為低價值:
- 正文只有几句话,其余全是導航、推荐位和广告;
- 同一批内容在不同 URL 下反复出現,没有 canonical 或參數處理;
- 列表頁、标簽頁、站内搜尋结果頁大量生成相似结构;
- 内容由模板拼接,換個關鍵詞就当成一篇新頁面。
處理重点是让每個 URL 承载獨立信息,而不是繼續增加相似頁面。
第三道:處理之後能不能進索引
内容本身没問题,也可能因為信号冲突被挡住:
- 頁面上的 canonical 指向了另一個更完整的版本,本頁會以那個 URL 的形式入索引;
- HTTP 头或頁面里的 noindex 没有清理干净,是從測試环境带過来的;
- 多個變体(带參數、带尾斜杠、大小寫不同)被合並,只保留一個代表 URL;
- 站点整体质量偏低时,新頁面的收錄速度和比例都會明顯下降。
判断問题的顺序應该是:先確認被抓到,再看内容是否值得留,最後检查索引信号是否一致。跳過前两步直接改代碼,通常是在治标。
一個可以照着走的核對顺序
- 在服務器日誌或抓取統計里確認该 URL 是否真的被請求過,返回碼是什么。
- 把日誌按頁面類型分组,看是詳情頁不收錄,還是列表頁、篩選頁也在里面,問题范围會立刻缩小。
- 抓取原始 HTML(關閉 JS 或用抓取工具查看),確認主体内容在不在。
- 检查 robots、meta robots、X-Robots-Tag、canonical 四個信号是否互相一致。
- 對比同栏目下已被收錄的頁面,找出结构、長度、内容上的差別。
- 確認無誤後,用站内入口連結、Sitemap 提交等方式重新暴露 URL,然後耐心观察,不要反复提交。
常见的两個誤判
一是看到抓取频繁就以為快收錄了。抓取频率更多反映爬虫對站点的信任度和更新预期,和單個頁面能否入索引没有直接關系。
二是看到索引量没涨就去堆外鏈。如果頁面本身過不了第二道门槛,外鏈只會带来更多抓取,不會自動带来收錄。
小结
抓取是入口,收錄是结果,中間隔着内容质量與索引信号的判断。遇到爬虫来了但不收錄,先把两個數字分開,再顺着抓取、内容、索引信号這條线逐段核對,比盲目修改頁面要有效得多。