很多站点运营會同时看两份資料:抓取日誌和索引覆盖。抓取量正常,說明蜘蛛愿意来;但收錄數不動,說明這批 URL 並没有拿到索引位。抓取和收錄之間隔着一层篩選,這层篩選主要看頁面本身值不值得被放進索引。
抓取是“取回”,收錄是“决定留不留”
抓取解决的是“蜘蛛能不能拿到這個頁面的内容”,收錄解决的是“拿到之後要不要把它放進索引、让它有机會被检索到”。中間還有质量评估、去重、規范版本選擇等步骤。
所以看到“已抓取,尚未编入索引”或“已發現,尚未抓取”都不奇怪,也不能简單理解成蜘蛛不来。前者通常是抓取之後没通過篩選,後者多半是 URL 還在排队。
收錄數量不是越多越好,索引位更像是搜尋引擎给頁面的一次资格判断,而不是站点提交就一定拿得到的東西。
頁面质量的几個自查维度
内容是否獨立完整
一個頁面能不能獨立回答一個問题,是判断质量的基础。如果正文只占頁面很小一部分,其余全是導航、广告、推荐位和頁脚,搜尋引擎拿到的可用内容就很有限。
自查方法很简單:把浏览器里的頁面结构關掉,只看正文部分,問自己這個頁面解决了一個什么問题。如果答案模糊,收錄的優先級通常不會高。
與站内其他頁面的差异度
批量生成的頁面是常见問题。模板相同、正文只替換几個词,比如不同城市、不同型号、不同篩選條件,這類頁面在搜尋引擎眼里接近重复内容。重复度高的頁面,往往只會保留其中一部分進索引,其余的被归並或忽略。
可以做一次抽样對比:去掉導航和頁脚,把同模板的两三個頁面正文放在一起,看重合比例有多高。如果核心段落几乎一样,差异只在标题和几個變量上,就不要指望它們全部被收錄。
是否有真實入口和稳定 URL
孤岛頁面、站内几乎没有連結指向的頁面,蜘蛛即使抓到,也很难判断它的重要性。同样,URL 反复變化會带来另一個問题:同一份内容散成多條地址,索引里可能只留一條,而且留下的版本未必是你想要的。
- 頁面是否從分類頁、列表頁或相關推荐里能点到;
- 入口連結是否稳定,而不是依赖临时活動頁或站内搜尋;
- URL 是否被追踪參數、排序參數、會话參數污染。
規范信号是否一致
canonical、内鏈、sitemap、重定向如果指向不同版本,搜尋引擎只能自己挑一個。它挑出来的版本可能不是你的首選,也可能在不同時間来回切換。不要求所有信号完美,但至少要避免互相矛盾。
索引狀態里常见的几種寫法
- 已编入索引:頁面在索引里,有机會被检索到;
- 已抓取,尚未编入索引:内容拿到了,但质量、重复度或規范判断之後没有给出索引位;
- 已發現,尚未抓取:URL 已進入队列,站点体量大或抓取预算有限时很常见;
- 已排除:需要点開具体原因看,不能统一按一個办法處理。
把這些狀態混在一起看,很容易得出“站点出問题了”的结论。更好的做法是先分组,再判断每组是不是真的需要收錄。
抓了不收錄时,站点能做什么
- 先抽样,不要全站動作。按模板或目錄分组,每组抽几條看内容差异、入口數量和規范指向。
- 区分“值得收錄”和“不必收錄”。篩選頁、站内搜尋结果頁、纯參數頁本来就可以不進索引,不必强求。
- 對确實值得收錄却没進的頁面,優先补正文獨特性、补内鏈入口、统一規范信号,而不是反复提交。
- 對不值得收錄的頁面,用 canonical 归並、noindex 或合並内容處理,减少索引里的近似重复。
- 改動之後留出观察期。索引更新有延迟,信号频繁来回切換反而會让判断更混乱。
別把收錄數当成唯一指标
收錄數增長不等于有效頁面變多。如果索引里塞進大量近似重复、正文稀薄的地址,站点整体的质量印象也會被拉低。更值得盯的是:核心頁面在不在索引里、狀態稳不稳定、能不能對應到用戶會搜尋的主题。
抓取、收錄、检索是三件事。抓取正常只是第一步,收錄取决于頁面本身是否值得占一個位置。把頁面质量、重复度和規范信号理顺,比盯着收錄數字的每日波動更有效。