網站收錄

抓取與收錄不是一回事:頁面進索引前要過哪几道關

日誌里出現蜘蛛不等于頁面進了索引。抓取只解决能不能拿到内容,收錄還要過可索引性、正文可讀、重复判断和质量门槛几道關。文章梳理這两者的差別,並给出一條從日誌、URL 检查工具到索引报告的排查顺序,帮你判断卡点在哪一步。

網站收錄

抓取與收錄不是一回事:頁面進索引前要過哪几道關

很多人把“蜘蛛来過”和“頁面被收錄”当成同一件事。日誌里出現抓取记錄,就觉得這條 URL 已经進了索引;過一段時間搜不到,又反過来怀疑是被降權。其實抓取和收錄是搜尋流程里两個獨立环节,中間還隔着若干道處理,任何一道没過,頁面都不會出現在索引里。

抓取只是把内容取回来

抓取解决的是“能不能拿到這份文件”。蜘蛛按 URL 發起請求,服務器返回 200 和 HTML,這一步就算完成。它只說明地址可訪問、服務器有响應,並不评價内容好坏,也不决定要不要收錄。

所以下面這些情况,日誌會很好看,但不代表收錄:

  • 頁面返回 200,但正文靠脚本渲染,抓取时拿到的 HTML 里没有主体内容;
  • URL 進了待抓取队列,蜘蛛只取了一小段就离開;
  • 同一内容有多個地址,蜘蛛每個都抓了一遍。

收錄要過的几道關

抓到之後,搜尋引擎要做解析、正文抽取、去重和质量判断,再决定是否寫入索引。大致有這几道:

  1. 可索引性:robots.txt 是否放行、頁面是否带 noindex、canonical 是否指向別處。
  2. 内容可讀:正文能否在不执行脚本的情况下拿到,還是只剩一個空壳。
  3. 重复判断:與站内或站外已有頁面是否高度相似,谁作為代表版本。
  4. 质量门槛:内容量是否够、信息是否自足、是不是只靠列表或模板拼接。

這几步里,第一步是硬性開關,後面三步更偏向權衡。所以會出現“能抓但不收錄”,也會出現“收錄了但排在很後面”。

几個常见誤判

日誌有记錄就等于收錄

日誌只能證明来過。建议把日誌里的 URL 和索引报告、site 查询结果對照着看,两邊對不上的那批,才是要重点排查的對象。

返回 200 就等于收錄

200 只表示請求成功。空壳頁、内容稀薄的頁面、被 canonical 指向別處的頁面,都可能是 200。

收錄了就一定能被搜到

收錄是進索引,能不能展現還要看查询词與頁面的匹配度。收錄正常但搜不到,属于另一個問题,不要混在一起調。

一條可执行的排查顺序

  1. 先確認抓取是否正常:日誌里有没有這條 URL,返回碼是什么,抓的是不是同一個版本。
  2. 再用 URL 检查工具看目前是否在索引里,以及抓取到的 HTML 與用戶看到的是否一致。
  3. 若已抓未收錄,检查 noindex、canonical、robots.txt 和正文是否可讀。
  4. 若内容可讀也没被屏蔽,就看是否與站内其他頁面重复,确定哪條该作為主版本。
  5. 最後再看内容本身是否够用,是补充、合並,還是調整保留方式。
抓取是入口,收錄是判断。把两者分開看,排查时就不容易在服務器响應和抓取频率上反复做無用功。