讨论收錄时,很容易把注意力放在單個頁面上:标题寫没寫、關鍵詞有没有、字數够不够。但搜尋引擎面對的從来不是孤立的一頁,而是整個站点的頁面集合。当站内有大量内容相近、信息量又低的頁面时,判断标准就變成了對比——這一頁和其他頁比,有没有留下的必要。正文太薄、主要靠模板撑起来的頁面,通常就在這一步被跳過。
一、哪些頁面容易被認為是“薄”
- 列表頁只有一串标题,每條没有摘要、没有說明,翻好几頁也看不出差別
- 聚合頁把站内其他文章的标题和連結堆在一起,正文部分几乎都是重复的導航
- 分類頁只有一两條内容,或者長期空着
- 商品頁、服務頁只有參數表和一句简介,没有适用场景,也没有常见問题
- 由模板批量生成的頁面,除了名稱和几個字段,其余部分完全一致
要注意,“薄”不是單纯按字數算的。一頁三百字但把一個問题讲清楚了,往往比一千五百字里有一千二百字是頁头頁尾導航要厚實得多。
二、索引為什么會跳過它們
索引空間有限,抓取和索引系統一直在做取舍。几個常见的判断逻辑:
- 可替代性高:站内已经有讲同一件事更完整的頁面,薄頁面提供不了額外信息
- 正文占比低:把模板、導航、推荐位去掉之後,真正属于這個 URL 的内容很少
- 相似度過高:几十個頁面只是字段不同,在模型上几乎等價,留一個就够了
- 缺少稳定入口:内鏈少、位置深,即使被抓到,也容易被归到低優先級
這些判断是叠加的。單看一項可能不致命,同时命中两項以上,頁面長期停在“已抓取,尚未编入索引”就很常见。
三、動手之前,先做一次抽样自检
不要一上来就批量 noindex,先抽二十到五十個可疑 URL,按下面几步看一遍:
- 用阅讀模式或纯文本视图打開,看去掉模板之後還剩多少内容
- 把同類的三五個頁面放在一起對比,看差异是不是只有名稱、時間、價格
- 检查有哪些内鏈指向它們,入口在導航里還是埋在角落
- 回想一下:用戶會為了這個頁面的内容专门搜尋並点進来吗
经過這一步,通常會分成三堆:值得补内容的、應该合並的、确實该让出位置的。
四、處理的先後顺序
顺序很重要,先做能保留價值的動作,再做减法。
- 补:對有價值但寫得太少的頁面,补上說明、适用场景、常见問题,让它比同類頁更完整
- 合:内容本来就重复的,合並到一個主頁面,把其他 URL 重定向或 canonical 指過去
- 收敛:确實不需要獨立存在的,用 canonical 或調整内鏈,把信号集中到主版本
- 登出:確認没有保留價值的,再考虑 noindex 或刪除
noindex 不等于刪除。頁面仍然可以被訪問,只是不再作為索引候選;而且已经進入索引的版本需要一段時間才會登出,期間在搜尋结果里看到舊頁面是正常的。
五、几個容易踩的点
- 批量 noindex 之前,先確認没有重要頁面靠這些 URL 传递内鏈
- 列表頁有几頁是正常分頁,不要因為“内容重复”把整個分頁体系一起關掉
- 不要把 noindex 当成掩盖内容問题的办法,该补的内容迟早要补
- 處理之後留一份记錄,過几周再抽样看索引狀態,避免誤伤
回到本质:索引留下的是“這個 URL 在站点里扮演了什么獨特角色”。模板能帮你快速生成頁面,但决定收錄的,始终是頁面本身有没有提供別處给不了的信息。