抓取和收錄,中間隔着好几道门
很多人看服務器日誌,發現搜尋蜘蛛来得很勤,返回狀態碼大多是 200,就預設這些頁面已经被收錄。實际上,抓取和收錄是两件事。抓取更像“把頁面下载回去”,收錄是“判断這個頁面值不值得放進索引,並把它整理成可检索的版本”。
蜘蛛抓走一個 URL,只代表它拿到了内容。之後還要经過解析、渲染、识別規范地址、去重、质量评估和索引選擇。任何一步不通過,頁面都可能停在索引之外。
日誌里的抓取量,不能直接当成收錄量。抓得多,只能說明蜘蛛愿意来;收不收,是另一套判断。
為什么抓了很多,索引里却没几條
1. 抓取成功,但頁面本身不可索引
返回 200 不代表頁面允许被索引。常见情况包括:頁面带有 noindex 标簽;canonical 指向了另一個地址;内容被登入墙或彈窗遮住;主要正文要点击多次才出現;robots 元标簽阻止索引。這些頁面可以被正常抓取,但不會進入索引。
2. 抓取後判定為重复或低價值
篩選頁、排序頁、參數頁、空结果頁、模板化聚合頁,往往會被抓取,但搜尋引擎不一定收錄。它們和主頁面内容高度相似,或者自身没有獨立信息。抓取它們是為了比較和確認,不是承诺给每個 URL 一個索引位置。
3. 抓到的不是規范版本
同一個頁面可能有多個地址:带 www 和不带 www、http 和 https、带追踪參數和不带參數、PC 版和移動版。蜘蛛可能都抓,但最後只會選一個作為索引代表。其他版本即使被抓過,也可能不單獨收錄。
4. 索引選擇:同主题只留一個
当站内存在多個近似頁面时,搜尋引擎會判断哪一個最合适。它可能收錄 A,不收錄 B;也可能把 B 的内容折叠到 A 下面。抓取 B 並不等于 B 會獨立出現在搜尋结果里。
自查顺序:先看抓取,再看索引,最後看選擇
- 看日誌:哪些 URL 被抓取,狀態碼是什么,抓取频率是否集中在重要頁面,是否大量消耗在無意义地址上。
- 看索引狀態:用 URL 检查工具或索引报告,区分“已發現未抓取”“已抓取未索引”“已索引”和“被排除”。不同狀態對應不同問题。
- 看頁面质量與重复:正文是否完整,是否有獨特信息,是否和站内其他頁面高度相似,是否有多個版本在互相竞争。
- 看内鏈與入口:重要頁面有没有稳定入口,是否只靠 sitemap 提交,是否處在很深的层級里。
- 看規范信号:canonical、robots、sitemap、狀態碼是否一致。信号互相矛盾时,蜘蛛容易抓错版本,索引也容易選错地址。
能做和不能做的事
能做的,是让值得收錄的頁面更容易被抓到、被正确解析、被清楚识別,並且和其他頁面形成内容差异。不能做的,是保證某個頁面一定被收錄,或者一定获得排名。抓取量高不是目标,索引里有用的頁面才是。
如果日誌里 200 很多、索引里却很少,不要急着加蜘蛛或堆連結。先把頁面分成“值得索引”和“不值得索引”两類,再检查不可索引的原因、重复版本和規范信号。顺序對了,排查會清楚很多。
小结
抓取是過程,收錄是结果。日誌里的 200 只能說明蜘蛛来過,不能說明頁面已经進入索引。把抓取、索引和展示分開看,很多“收錄不好”的問题會更容易定位。