很多人把“蜘蛛来過”和“頁面被收錄”当成同一件事。日誌里出現抓取记錄,就觉得這條 URL 已经進了索引;過一段時間搜不到,又反過来怀疑是被降權。其實抓取和收錄是搜尋流程里两個獨立环节,中間還隔着若干道處理,任何一道没過,頁面都不會出現在索引里。
抓取只是把内容取回来
抓取解决的是“能不能拿到這份文件”。蜘蛛按 URL 發起請求,服務器返回 200 和 HTML,這一步就算完成。它只說明地址可訪問、服務器有响應,並不评價内容好坏,也不决定要不要收錄。
所以下面這些情况,日誌會很好看,但不代表收錄:
- 頁面返回 200,但正文靠脚本渲染,抓取时拿到的 HTML 里没有主体内容;
- URL 進了待抓取队列,蜘蛛只取了一小段就离開;
- 同一内容有多個地址,蜘蛛每個都抓了一遍。
收錄要過的几道關
抓到之後,搜尋引擎要做解析、正文抽取、去重和质量判断,再决定是否寫入索引。大致有這几道:
- 可索引性:robots.txt 是否放行、頁面是否带 noindex、canonical 是否指向別處。
- 内容可讀:正文能否在不执行脚本的情况下拿到,還是只剩一個空壳。
- 重复判断:與站内或站外已有頁面是否高度相似,谁作為代表版本。
- 质量门槛:内容量是否够、信息是否自足、是不是只靠列表或模板拼接。
這几步里,第一步是硬性開關,後面三步更偏向權衡。所以會出現“能抓但不收錄”,也會出現“收錄了但排在很後面”。
几個常见誤判
日誌有记錄就等于收錄
日誌只能證明来過。建议把日誌里的 URL 和索引报告、site 查询结果對照着看,两邊對不上的那批,才是要重点排查的對象。
返回 200 就等于收錄
200 只表示請求成功。空壳頁、内容稀薄的頁面、被 canonical 指向別處的頁面,都可能是 200。
收錄了就一定能被搜到
收錄是進索引,能不能展現還要看查询词與頁面的匹配度。收錄正常但搜不到,属于另一個問题,不要混在一起調。
一條可执行的排查顺序
- 先確認抓取是否正常:日誌里有没有這條 URL,返回碼是什么,抓的是不是同一個版本。
- 再用 URL 检查工具看目前是否在索引里,以及抓取到的 HTML 與用戶看到的是否一致。
- 若已抓未收錄,检查 noindex、canonical、robots.txt 和正文是否可讀。
- 若内容可讀也没被屏蔽,就看是否與站内其他頁面重复,确定哪條该作為主版本。
- 最後再看内容本身是否够用,是补充、合並,還是調整保留方式。
抓取是入口,收錄是判断。把两者分開看,排查时就不容易在服務器响應和抓取频率上反复做無用功。