很多站点检查收錄时,习惯先看蜘蛛抓取日誌。看到新URL被訪問過,就預設頁面很快會進索引;過几天搜尋里找不到,又怀疑内容质量或站点權重。其實抓取、索引和展示是三個不同阶段,中間任何一步没處理好,都可能让頁面停在半路。
抓取、索引、展示各管一段
蜘蛛訪問URL,只代表它知道了這個地址,並且愿意来取一次内容。取到内容之後,搜尋引擎還要判断這個頁面是否值得進入索引、應该保留哪個URL版本、在什么情况下展示。抓取正常但收錄慢,並不一定是蜘蛛没来。
- 抓取:蜘蛛請求URL並获取响應,可能只是發現,也可能是定期回訪。
- 索引:搜尋引擎把頁面内容處理後存入可检索的库,並确定代表版本。
- 展示:用戶搜尋时,從索引中選出頁面並排序展示,這一步還受查询词和竞争影响。
把這三步混在一起看,容易得出错誤结论。比如日誌里抓取频繁,就说“收錄没問题”;搜尋里没有,就说“内容太差”。更稳妥的做法是按阶段核對。
第一步:確認蜘蛛抓到的是哪個URL
同一個頁面如果存在多個可訪問地址,比如带參數、带大小寫、带www與不带www、带结尾斜杠與不带斜杠,蜘蛛可能分別抓取,但索引里通常只會保留一個代表版本。站点需要先明确希望哪個URL被收錄。
- 頁面是否只有一個規范URL,其他版本是否通過301或canonical指向它;
- robots.txt是否誤屏蔽了重要目錄或參數;
- 站点地图和内鏈是否主要指向規范版本,而不是把權重分散到多個副本;
- 分頁、篩選、排序參數是否产生了大量低價值URL。
如果URL規范没做好,蜘蛛可能抓了很多重复版本,但索引里只留一個,甚至因為版本摇摆而暂时不收錄。這时優先整理URL,而不是急着加内容。
第二步:看頁面有没有“可索引”的内容
被抓取不代表内容值得索引。頁面如果主要由模板、推荐位、广告或重复文案组成,正文信息很少,搜尋引擎可能抓取後不保留。頁面质量不是抽象分數,通常可以從可见内容、獨立價值和重复程度判断。
- 頁面是否有獨立于其他頁面的主要信息,而不是只換了标题和几張图;
- 正文是否被大量重复的列表、标簽、相關推荐淹没;
- 同一主题是否拆成了多個高度相似的URL,互相竞争;
- 内容是否完整可讀,不依赖登入、彈窗或脚本才能看到關键信息。
如果多個頁面讲的是同一件事,先考虑合並或明确主從關系。重复内容不一定會被惩罚,但會让搜尋引擎难以判断该收錄哪一版,收錄速度也容易變慢。
第三步:核對索引里保留的版本
有时頁面不是没進索引,而是索引里保留的是另一個URL版本。比如移動版、參數版、AMP版或舊版地址。站点在搜尋里查不到目标URL,就以為没收錄,實际可能是代表版本換了。
可以用站点地图和canonical交叉检查:站点地图提交的URL、頁面声明的canonical、内鏈指向的URL,是否一致。如果這三處指向不同版本,搜尋引擎需要額外判断,收錄和展示都可能延迟。
抓取不等于收錄,收錄也不等于排名。排查时先分清阶段,能减少很多無效改動。
一個實用的排查顺序
- 先從抓取日誌或搜尋资源平台確認蜘蛛是否訪問過目标URL;
- 检查该URL是否可正常訪問,返回碼是否稳定,robots.txt是否允许抓取;
- 確認頁面canonical和站点地图是否指向同一規范版本;
- 查看頁面正文是否有獨立、完整、可讀的信息;
- 检查站内是否存在多個相似URL,必要时合並或設定規范版本;
- 最後再观察索引狀態變化,不要频繁改動URL和内容。
收錄是抓取、索引和展示共同作用的结果。站点能控制的主要是URL規范、内容质量和站内入口。把這些基础整理清楚,比反复猜测蜘蛛行為更有用。