網站收錄

頁面被收錄却没排上:把抓取、收錄、排名拆開看

很多站長把抓取、收錄、排名当成一件事:搜不到頁面就统一归因為没收錄,然後反复提交 sitemap、加内鏈。本文把三個环节拆開讲,說明怎样用服務器日誌、索引检查和具体查询判断頁面卡在哪一步,收錄之後仍然没有位置时的常见原因,以及確認未收錄後该按什么顺序排查。

網站收錄

頁面被收錄却没排上:把抓取、收錄、排名拆開看

很多人判断一個頁面有没有“進”搜尋引擎,习惯直接搜一下。搜不到,就認定“没收錄”,然後去折腾 sitemap、加内鏈、找提交入口。但從蜘蛛看到 URL 到頁面出現在结果頁,中間隔着几個环节,卡在哪一步,處理方式完全不同。把抓取、收錄、排名混為一谈,最容易做無用功。

抓取、收錄、排名,是三個不同的环节

可以先這样区分:

  • 抓取:蜘蛛請求了你的 URL 並拿到响應内容。服務器日誌里能看到它的訪問记錄。
  • 收錄:搜尋引擎對抓到的内容做了處理,判定值得放進索引库。這一步在日誌里看不到痕迹。
  • 排名:用戶在某個具体查询下,搜尋引擎從索引中挑出候選頁面並排序。同一個頁面在不同词下的表現可以相差很大。

抓取是收錄的前提,收錄是排名的前提,但每一步都不是必然發生。被抓不等于被收錄,被收錄也不等于有位置。

先判断頁面停在哪一步

看日誌:蜘蛛来没来

如果日誌里连訪問记錄都没有,問题出在發現和抓取环节:内鏈是否可達、robots 是否放行、有没有外鏈或 sitemap 提供入口。如果日誌里反复出現同一個 URL,但都是低優先級抓取,那說明它已经被發現,只是還没轮到被處理。

看索引:有没有入库

用站点查询或搜尋控制台里的 URL 检查,可以大致判断頁面是否在索引中。注意两者口径不同,數字對不上很正常。索引检查里出現的“已抓取,目前未收錄”是一個明确的中間狀態——說明抓過了,但没通過收錄這一關。

看具体查询:有没有被調用

收錄了不等于有位置。更可靠的做法是挑一個頁面的核心词去搜,看它是否出現。如果查不到,先確認這個词本身有没有真實搜尋需求,再換更長的長尾词试一次。

收錄了却没有位置,通常不是收錄問题

  • 查询本身搜尋量太小,或者只是你内部习惯的叫法。
  • 頁面主题和查询意图不匹配,标题和正文没有正面回答這個問题。
  • 站内存在多個相似頁面,信号被分散,谁都不容易上去。
  • 内容深度和完整度不足,用戶点進来解决不了問题。
  • 頁面能被索引,但在高相關场景下很少被調用。

這些都偏内容和匹配层面。再去提交 sitemap、反复請求抓取,基本不會有變化。

如果確認是没收錄,按這個顺序查

  1. 確認 URL 返回 200,正文内容在初始 HTML 里就能看到,不是空壳。
  2. 確認 meta robots 和响應头里没有 noindex,robots.txt 没有拦住這個路径。
  3. 確認頁面有可爬取的入口:内鏈、導航、sitemap 至少有一條通路。
  4. 確認它不是和其它頁面高度重复的版本,canonical 指向的是该保留的那一版。
  5. 確認站点整体抓取正常,蜘蛛没有因為响應慢或频繁报错而降低訪問频率。

一步一步排除,比同时改十處配置更容易看出是哪一环出了問题。

別把收錄數量当成唯一指标

收錄數是入门指标,不是结果指标。收錄比例高但頁面都不對應真實需求,整体表現不會好;反過来,收錄數不多但每個頁面都精准命中某類查询,同样能带来稳定訪問。定期观察收錄率的變化有意义,但看到一個數字波動就大規模改站,通常不划算。

收錄只是把頁面放進了候選池,能不能被調出来,取决于它和用戶查询的匹配程度。排查时先确定卡在哪一步,再動對應的地方。