做收錄盘点时最容易犯的一個错,是把收錄數当成單一指标:涨了就觉得健康,跌了就急着找漏洞。實际上同一個站点里往往同时存在两種相反的收錄問题——有些頁面该被索引却迟迟没進,另一些頁面本来不该出現在索引里却占着位置。這两類問题的處理方向完全不同,混在一起看,很容易越修越乱。
第一步:先把 URL 分成“该收”和“不该收”
在打開任何工具之前,先拉一份站点 URL 清單,按是否希望被索引打上标记。判断依據不是頁面好不好看,而是它有没有獨立價值、是否可能承接搜尋需求、與其他頁面是否高度相似。
- 该收:核心内容頁、有明确主题的栏目頁、有獨立信息量的詳情頁、必要的帮助與說明頁。
- 不该收:排序與追踪參數頁、會话 ID、站内搜尋结果頁、篩選组合過细的頁面、測試與临时目錄、重复的打印頁。
這份清單不必一次做到完美,但它决定了後面每一步该往哪個方向走。
该收却没收:先看卡在哪一步
一個頁面從存在到進入索引,大体要经過發現、抓取、渲染、索引判断几道關。缺收时先定位卡点,再動手。
發現环节
- 頁面是否真的能從別處到達?只存在于 sitemap、没有任何内鏈指向的 URL,被發現的机會明顯更少。
- 内鏈层級是否太深?点击三四次還到不了的頁面,抓取優先級通常靠後。
- sitemap 是否包含且格式正确?提交了不等于被讀取,日誌里能看到抓取记錄才算數。
抓取與渲染环节
- 服務器返回是否稳定?大量 5xx、超时或频繁跳轉會让抓取意愿下降。
- 主要内容是否依赖脚本渲染?渲染失敗时,抓到的可能只是空壳。
- 是否被 robots 或防火墙誤拦?先確認抓取没有被挡住。
索引判断环节
- canonical 是否指向了別的 URL?指向冲突时,搜尋引擎可能只保留另一個版本。
- 頁面是否與其他頁面高度相似?模板化内容和轉载會削弱獨立收錄的理由。
- 内容量是否過薄?只有标题加一两句话的頁面,通常难以進入索引。
不该收却收了:從入口與信号两头收口
這類問题不一定要把頁面删掉,很多时候只需要让搜尋引擎不再把它当作獨立頁面。
- 頁面級:确實無價值的頁面用 noindex 處理,同时保留可抓取狀態,否則這個信号可能讀不到。
- 入口級:sitemap 只放希望被索引的 URL;内鏈不要指向無意义頁面;分頁與篩選連結做好收敛。
- 信号級:重复或近似頁面用 canonical 指定主版本,並保證站内連結指向主版本而不是副本。
禁止抓取不等于禁止索引。只靠 robots 挡住的 URL,仍可能因外部連結而進入索引,頁面抓不到,修正信号也就传递不進去。
常規盘点可以按這個顺序走
- 導出站点 URL 清單,标记该收與不该收。
- 用服務器日誌確認抓取覆盖:哪些 URL 被訪問過,频率如何。
- 對照實际索引狀態,把缺收的按發現、抓取、索引三類归因。
- 對不该收的頁面,先處理入口,再處理頁面級信号。
- 改動後留一段观察期,按批查看變化,不要一天一個结论。
收錄是结果,不是目标
把收錄數当成 KPI,常见的後果是不断放宽入口,把没有承接能力的頁面也推進索引,短期數字好看,長期反而稀释了整站的质量判断。更稳的做法是守住“该收的收進来、不该收的挡在外”,用批次和時間窗口看趋势,而不是盯某一天的绝對值。