收錄數量上不去时,很多人的第一反應是“蜘蛛没来”。但把索引覆盖报告和服務器日誌放在一起看,往往不是這样:抓取量並不低,卡点在後面——頁面被抓到了,却在索引選擇那一關被過滤掉。内容偏薄的頁面,是這類情况里占比最高的一類。
一、先把三種“薄”分開
“薄”只是一個笼统的说法,成因不同,處理方式完全不同。建议先按下面三類归類:
- 頁面本身信息少:正文只有一两句话、一張參數表或一個下载按钮,其余全是導航、推荐位和頁脚。
- 頁面在站内高度同质:同一套模板批量生成的地区頁、标簽頁、篩選頁,彼此只差一两個词。
- 内容不少,但可解析部分少:正文靠交互加载、關键信息放在图片里、脚本没渲染出来,抓到的 HTML 和用戶看到的頁面對不上。
這三類的處理方向分別是:补内容、做收敛、解决可解析性。混在一起讨论,就很容易一拍脑袋给整站加 noindex。
二、索引系統大致在看什么
索引的目标是留下能回答查询的頁面。判断依據通常包括:頁面自身有多少獨特信息、這些信息能不能被解析、與其他已被索引的 URL 差异有多大,以及有没有人會去搜它。
正文占比
正文之外的部分——導航、推荐位、评论区、頁脚——各站都一样,對索引来说不产生区分度。一個頁面整頁几萬字符,正文只占三百字符,落到索引系統眼里的“有效内容”就是後者。
差异度
如果几十個 URL 的正文有九成以上相同,索引通常會留下其中一個,其余的即便被抓取,也會被判定為重复。這更像是去重机制,而不是针對某個頁面的惩罚。
需求匹配
有一類頁面本来就不该出現在搜尋结果里,比如“提交成功”“购物车為空”“查询無结果”。它們没有對應的搜尋意图,硬让它們進索引,價值有限。
三、處理顺序:补 → 合並 → 規范 → 屏蔽
建议按成本從低到高来,而不是一上来就删頁面或加 noindex。
- 能补信息的先补:给地区頁补上本地联系方式、服務范围、常见問题,让它拥有只有這一頁才有的内容。
- 内容确實雷同的合並:把多個只有细微差別的 URL 收敛到一個主地址,其余做 301,而不是让它們各自存在、互相稀释。
- 有多個訪問地址的做規范化:用 canonical 统一主地址,同时處理大小寫、尾斜杠、無意义參數這些细节。
- 確認没有搜尋價值的再屏蔽:加 noindex 或從站点结构中下线,做之前先確認這個 URL 没有外部連結、没有自然流量。
刪除要谨慎。頁面下线後返回 404 或 410,索引里的舊记錄會逐步消失;如果還有外鏈指向它,更稳妥的做法是先做 301 指向相關頁面。
四、几個容易做反的操作
- 给全部薄頁面统一加 noindex:容易连同一些有搜尋需求、只是暂时内容不足的頁面一起屏蔽。分目錄、分模板评估更可靠。
- 用 robots.txt 屏蔽整批 URL:被屏蔽的地址不再被抓取,但已存在的索引记錄不會立刻移除,頁面之間的連結關系也被切断。目标是移除索引时,noindex 更直接。
- 把正文藏進图片或纯交互里:折叠内容通常仍可解析,图片里的文字則需要額外處理。
- 只盯收錄數,不看這些頁面有没有流量:没有需求支撑的頁面進入索引,對站点整体帮助有限。
五、改完之後怎么看效果
- 用抓取統計观察這批 URL 的抓取频率和响應碼有没有變化。
- 在索引覆盖报告里看對應狀態的數量變化,观察周期按周計,不要按天。
- 抽样用頁面标题或某句獨有内容去搜尋,確認索引里留下的版本和新版本一致。
收錄是索引選擇的结果,不是提交動作的结果。让一個頁面變厚、變獨特,比反复提交更容易见效;但任何調整都没有确定的生效時間。
薄頁面本身不是原罪。真正需要回答的只有两個問题:這個 URL 有没有人需要,它和其他頁面有没有区別。這两個問题想清楚了,补、合並還是屏蔽,選擇也就清楚了。