很多运营人員看到服務器日誌里有搜尋蜘蛛的訪問记錄,就預設頁面“已经被收錄”。但日誌只能說明蜘蛛来過,不能說明頁面進入了索引。從 URL 被發現,到最终能出現在搜尋结果里,中間至少隔着抓取、解析和索引篩選几個环节。把它們混在一起看,排查时容易改错地方。
第一步:URL 被發現
搜尋蜘蛛首先要拿到地址。常见入口有站内連結、sitemap、外部連結,以及搜尋平台提供的提交入口。如果頁面没有任何入口指向,或者入口藏在需要复杂交互才能展開的模块里,蜘蛛可能根本不知道它存在。此时頁面在索引里查不到,原因不在頁面质量,而在發現环节。
检查时可以先看:新頁面發布後,站内是否有稳定的連結指向它;列表頁、聚合頁是否能直接輸出連結;sitemap 是否包含该 URL。不要只依赖提交接口,外部和内部連結仍然是重要的發現路径。
第二步:抓取是否成功
發現 URL 後,蜘蛛會尝试抓取。抓取失敗的原因很直接:服務器返回 5xx、响應超时、被防火墙或限流拦截、robots.txt 禁止抓取。還有一種容易被忽略的情况是頁面依赖 JavaScript 渲染,而關键内容没有以可抓取的形式輸出。蜘蛛拿到的 HTML 與用戶看到的不一致,後續索引判断自然缺少依據。
如果日誌里只有少量抓取记錄,或者反复出現错誤狀態碼,應该先解决抓取可用性,而不是急着改标题和正文。抓取都拿不到内容,讨论收錄為时過早。
第三步:内容能否進入索引
抓取成功也不等于一定收錄。搜尋系統還要判断頁面是否值得進入索引:内容是否與已有頁面高度重复,是否有明确的主题,是否属于薄内容或空壳頁,是否被 noindex、canonical 等指令指向別處。參數頁、篩選頁、打印頁、多語言重复頁,常常在這一步被归並或過滤。
這里要区分“被归並”和“被拒绝”。归並是搜尋引擎認為多個 URL 指向同一主题,選擇一個代表;被拒绝則可能因為质量或技術限制。两者的處理方式不同,前者重点在 URL 規范,後者要回到頁面本身。
收錄之後才有排名讨论
頁面進入索引,只是拿到了參與搜尋结果的资格,並不保證有排名,也不保證有流量。收錄是基础设施,排名還要看查询匹配、内容质量、連結關系和用戶体驗。把收錄和排名拆開看,才不會因為一個词没排名就誤判頁面没被收錄。
怎么判断卡在哪一步
- 發現层:站内連結是否可達,sitemap 是否完整,提交後是否被讀取。
- 抓取层:日誌中狀態碼、抓取频次、响應時間,robots 是否放行。
- 索引层:頁面是否有 noindex、canonical 指向他頁、内容是否重复或過薄。
- 展示层:已收錄但無排名,属于检索匹配和排序問题,不是收錄問题。
實际操作中,可以先用抓取統計和日誌確認蜘蛛是否来過;再用 URL 检查工具看抓取狀態和索引狀態;最後對照頁面内容、規范标簽和重复情况。按這個顺序走,比一上来就改模板更省時間。
抓取是過程,收錄是结果。頁面没出現在索引里,先確認它有没有被成功抓取和解析,再判断内容是否满足索引條件。