很多人判断一個頁面有没有“進”搜尋引擎,习惯直接搜一下。搜不到,就認定“没收錄”,然後去折腾 sitemap、加内鏈、找提交入口。但從蜘蛛看到 URL 到頁面出現在结果頁,中間隔着几個环节,卡在哪一步,處理方式完全不同。把抓取、收錄、排名混為一谈,最容易做無用功。
抓取、收錄、排名,是三個不同的环节
可以先這样区分:
- 抓取:蜘蛛請求了你的 URL 並拿到响應内容。服務器日誌里能看到它的訪問记錄。
- 收錄:搜尋引擎對抓到的内容做了處理,判定值得放進索引库。這一步在日誌里看不到痕迹。
- 排名:用戶在某個具体查询下,搜尋引擎從索引中挑出候選頁面並排序。同一個頁面在不同词下的表現可以相差很大。
抓取是收錄的前提,收錄是排名的前提,但每一步都不是必然發生。被抓不等于被收錄,被收錄也不等于有位置。
先判断頁面停在哪一步
看日誌:蜘蛛来没来
如果日誌里连訪問记錄都没有,問题出在發現和抓取环节:内鏈是否可達、robots 是否放行、有没有外鏈或 sitemap 提供入口。如果日誌里反复出現同一個 URL,但都是低優先級抓取,那說明它已经被發現,只是還没轮到被處理。
看索引:有没有入库
用站点查询或搜尋控制台里的 URL 检查,可以大致判断頁面是否在索引中。注意两者口径不同,數字對不上很正常。索引检查里出現的“已抓取,目前未收錄”是一個明确的中間狀態——說明抓過了,但没通過收錄這一關。
看具体查询:有没有被調用
收錄了不等于有位置。更可靠的做法是挑一個頁面的核心词去搜,看它是否出現。如果查不到,先確認這個词本身有没有真實搜尋需求,再換更長的長尾词试一次。
收錄了却没有位置,通常不是收錄問题
- 查询本身搜尋量太小,或者只是你内部习惯的叫法。
- 頁面主题和查询意图不匹配,标题和正文没有正面回答這個問题。
- 站内存在多個相似頁面,信号被分散,谁都不容易上去。
- 内容深度和完整度不足,用戶点進来解决不了問题。
- 頁面能被索引,但在高相關场景下很少被調用。
這些都偏内容和匹配层面。再去提交 sitemap、反复請求抓取,基本不會有變化。
如果確認是没收錄,按這個顺序查
- 確認 URL 返回 200,正文内容在初始 HTML 里就能看到,不是空壳。
- 確認 meta robots 和响應头里没有 noindex,robots.txt 没有拦住這個路径。
- 確認頁面有可爬取的入口:内鏈、導航、sitemap 至少有一條通路。
- 確認它不是和其它頁面高度重复的版本,canonical 指向的是该保留的那一版。
- 確認站点整体抓取正常,蜘蛛没有因為响應慢或频繁报错而降低訪問频率。
一步一步排除,比同时改十處配置更容易看出是哪一环出了問题。
別把收錄數量当成唯一指标
收錄數是入门指标,不是结果指标。收錄比例高但頁面都不對應真實需求,整体表現不會好;反過来,收錄數不多但每個頁面都精准命中某類查询,同样能带来稳定訪問。定期观察收錄率的變化有意义,但看到一個數字波動就大規模改站,通常不划算。
收錄只是把頁面放進了候選池,能不能被調出来,取决于它和用戶查询的匹配程度。排查时先确定卡在哪一步,再動對應的地方。