做收錄排查时,很多人习惯先看爬虫来訪次數、sitemap 提交量和内鏈入口。這些确實是 URL 被發現的前提,但它們决定的是有没有被抓,而不是會不會被收。搜尋引擎抓完頁面後,還要判断這個 URL 是否值得進入索引:内容是否獨立、是否满足某種查询需求、是否和站内其他頁面高度相似。抓取正常却收錄少,通常要回到頁面质量上找原因。
先分清抓取與收錄的邊界
抓取是爬虫把頁面 HTML 取回的過程,收錄是搜尋引擎把這個 URL 作為候選结果儲存下来的過程。前者出問题,日誌里會看到大量错誤碼、超时或抓取频次過低;後者出問题,日誌可能一切正常,索引报告里却是“已抓取,尚未编入索引”。如果把這两類問题混在一起處理,很容易在服務器和 robots 上反复折腾,却碰不到真正的原因。
索引取舍时通常看什么
搜尋引擎没有公開完整的收錄标准,但從實际表現看,下面几項會明顯影响一個 URL 能否進入索引。
- 内容是否獨立可用:頁面有没有自己的主体信息,還是只由标题、几句導语和一堆推荐位拼成。
- 是否與站内其他頁面重复:同一批商品、同一篇文章通過參數、排序或分頁生成出多條近似 URL 时,搜尋引擎通常只會保留其中一條。
- 是否對用戶有實际價值:列表頁只有几條结果、篩選頁组合出大量空结果、标簽頁只是關鍵詞堆砌,這類頁面被索引的概率會低很多。
- 站点整体质量與信任度:同一批模板批量生成的頁面越多,單個頁面的索引机會越容易被稀释。
重复内容與 URL 規范
重复内容不一定是複製別人的文章,站内自己产生的重复同样常见。比如商品列表按價格、销量、上架時間排序,生成了 order=price、order=sales 等多個 URL;文章带打印版、AMP 版、移動版;篩選條件叠加後出現大量參數组合。這些 URL 如果都能被抓到,索引就會在几條几乎一样的頁面之間反复選擇。
處理思路是先确定每個内容對應的規范 URL,再用 canonical、站内連結和 URL 規則把信号收敛過去。需要注意,canonical 是建议而不是命令,如果站点内部仍然用不同 URL 互相連結,搜尋引擎可能不會按你期望的那條来收錄。
几類容易拖累收錄的頁面
- 空列表頁與無结果篩選頁:没有實际内容,建议返回合适的 404 或 410,或者用 robots 阻止抓取,而不是让它們長期返回 200。
- 批量生成的模板頁:如果只是替換城市名、關鍵詞,正文结构完全一样,索引價值有限。
- 纯聚合頁:把站内或站外内容简單拼接,缺少自己的整理和判断。
- 内容极少的詳情頁:只有一两句话和图片,用戶和搜尋引擎都难以判断頁面主题。
這几類頁面不一定要全部刪除,但至少不要让它們大量占用抓取額度和索引位。對确實有流量的篩選组合,可以补上說明文字、常见問题和结构化信息,让它從參數壳變成可獨立回答問题的頁面。
自查时按這個顺序走
- 先在索引报告里区分已抓取未收錄和未抓取两類 URL,避免混着看。
- 抽查未收錄頁面,看正文、标题、描述是否與站内其他頁面高度相似。
- 检查同一批内容有几條可訪問 URL,站内連結實际指向哪一條。
- 統計模板頁、篩選頁、空结果頁在整站 URL 中的占比,再看抓取日誌里它們占了多少訪問。
- 對確認低價值的 URL 做收敛或屏蔽,對有價值但内容單薄的頁面补充信息。
把索引位留给值得的頁面
收錄不是越多越好。大量低质 URL 進入索引,反而會稀释站点整体的质量信号,让真正需要被搜尋到的頁面更难获得机會。相比追求收錄數字,更實际的做法是定期清理重复和空壳 URL,保證每個被索引的頁面都能回答一個具体問题。
抓取解决的是来没来,收錄解决的是值不值得留。当抓取正常而收錄停滞时,優先检查頁面本身的獨特性和站内 URL 的收敛情况。