在索引狀態报告里看到“已编入索引”,很多人就預設這件事結束了:頁面進了库,用戶應该能搜到。但從抓取到真正被搜到,中間還有几道判断,每一道都可能让同一個 URL 呈現完全不同的狀態。分清楚這几层,排查問题时才不會一直盯着错的地方。
抓取、索引、收錄、展現是四件事
- 抓取:爬虫把頁面 HTML 取回本地。取不到就没有後續。
- 建立索引:解析正文、提取連結、识別主内容,把頁面信息寫進索引库。
- 收錄數量:通常指索引库里與站点相關的 URL 條目數,它是一個統計口径,不等于有多少頁面能带来流量。
- 展現:用戶輸入某個词时,系統從索引里挑出它認為最合适的几條结果,這一步带有篩選和替換。
把收錄当成终点,就會在頁面其實已经入库、只是没被展現时,反复去做提交和加外鏈,白耗精力。
已收錄却搜不到的几種常见原因
1. 同一個查询词,系統選了另一個頁面
站内有两三個頁面讲的是同一件事,标题和正文高度相似时,通常只會保留其中一個作為该查询的代表。其余頁面仍然在索引里,但很少被單獨展現。這不是没收錄,而是重复内容在展現环节被合並了。
2. 頁面内容單薄,不足以單獨支撑一個结果
列表頁、标簽頁、只有几行說明的說明頁,即使被抓取並入库,也可能長期不參與展現。索引里存在,和搜尋时被選中,是两個不同的门槛。
3. 查询词與頁面主题的匹配度不高
頁面的确在讲某個主题,但用戶搜的词更宽或更窄。此时換個更贴近正文表述的長尾词去驗證,往往能看到它。
4. URL 規范没统一
带參數、带大小寫差异、带 www 與不带 www 的版本各自被抓過,索引里可能留下多條相似條目,權重被分散,任何一條都难以單獨冒头。
一段可执行的自查顺序
- 先用完整标题搜尋,再用 site: 限定域名搜。两者结果不同,說明是展現篩選,不是索引缺失。
- 查看该 URL 在索引狀態报告里的具体狀態:已抓取、已發現未抓取、重复、备用頁面,含义完全不同。
- 检查 canonical 是否指向自己,是否被別的頁面指向,或被错誤地指向了別的 URL。
- 检查该 URL 是否被 robots 元标簽、X-Robots-Tag 或 robots.txt 拦截,注意抓取屏蔽和索引屏蔽不是同一层。
- 換三到五個與正文表述接近的長尾词再搜一遍,確認它是否只是没被泛词選中。
- 對照服務器日誌,確認這個 URL 最近是否還有被抓取。長期不再被抓,說明入口或連結结构有問题。
重复内容在這里扮演什么角色
同一主题存在多個版本时,系統需要做選擇,優先保留的通常是:正文更完整、内鏈更集中、URL 更干净、被引用更多的那一個。所以處理重复内容不是简單地删掉多余的,而是让站内對同一個主题只保留一個明确的主頁面,其余版本要么合並,要么明确指向它。
常见来源包括:分頁的第一頁與主頁内容高度重合、篩選參數生成的大量近似頁面、同一商品的不同規格頁,以及不同目錄下内容雷同的专题頁。
几個容易被誤讀的信号
- “已编入索引”只說明入库,不保證展現,也不保證排名。
- site: 的條數是粗略估計,不适合当作精确的收錄總量逐日對比。
- 今天能搜到、明天搜不到,可能是系統在調整,也可能只是查询词的匹配變化,單次观察不足以得出结论。
判断收錄問题,先確認是抓取没發生、索引没建立,還是展現被替換。三種情况的處理方式完全不同,用错方案只會浪費時間。
實际操作时,建议固定一批有代表性的 URL 作為样本,记錄它們的狀態變化,而不是每天盯着總量波動。样本里的頁面從已發現走到被展現,比整体面积數字更能說明問题。