很多站点收錄量不小,但真正能带来流量的頁面很少,問题往往出在一批“薄内容”頁面上。它們能被抓取、能被索引,却几乎没有獨立信息量,既稀释了站内連結的传递效果,也让蜘蛛把抓取配額花在低價值 URL 上。處理這類頁面,關键不是删得越多越好,而是先分清哪些确實该留。
先判断“薄”在哪一层
“薄”不是按字數算的。一個三百字的商品頁,如果有獨立參數、真實库存和用戶评價,它的信息量可能比两千字的拼凑文章更高。判断时可以看三点:
- 獨立信息量:去掉頁头頁脚、導航和模板文案之後,剩下多少只属于這個 URL 的内容。
- 可替代性:站内是否存在另一個 URL,能完整满足同一搜尋意图。
- 入口價值:它是否承担站内導航作用,是否被其他頁面引用。
三点里满足两條以上,基本可以归為偏薄的頁面,進入下一步评估;如果只是字數少但确實有獨立價值,不要急着動手。
三類常见的薄内容来源
标簽頁與聚合頁
标簽、分類、年份归档這類頁面本身没有獨立内容,靠列表撑着。少數有明确检索需求的标簽可以保留,其余大量同质标簽頁會让索引里堆满重复列表。
短内容與模板複製
公告、短讯、活動頁、帮助中心的重复問答,正文很短,主要靠模板填充。站内同類頁面越多,單頁被索引的收益越低。
多版本複製
同一份内容因為地区、語言、渠道參數各生成一套 URL,彼此差异只有一两行。這種情况下真正的問题不是内容薄,而是重复,需要先确定主版本再谈收口。
處理顺序:先补、再合、最後收口
- 补内容:如果頁面有明确搜尋需求,先补充真實信息,例如參數、價格区間、常见問题、图文說明。补完之後观察一個抓取周期,再决定是否保留。
- 合並:多個 URL 讲同一件事时,選信息最全的那個作為主版本,其余用 301 指過去,同时更新站内連結,避免舊 URL 繼續被引用。
- 收口:确實没有保留價值、也不适合合並的頁面,用 noindex 让它登出索引。canonical 解决的是重复版本的归属問题,不是用来屏蔽頁面的,两者不要混用。
先合並再收口,通常比直接批量 noindex 更稳妥。很多頁面被 noindex 之後,站内依然有大量連結指向它,蜘蛛還是會反复来抓,只是不再收錄。
別一次性全量處理
批量提交几千條 noindex 或 301,容易出現两個後果:一是站点抓取节奏被打乱,二是萬一判断错了,想恢复索引同样需要時間。更稳妥的做法是按模板分组,一次處理一類,例如先處理没有检索量的标簽頁,观察一到两周的抓取與收錄反馈,再决定是否扩大范围。
同时要清楚,收口的目标是让索引里留下有價值的頁面,不是把收錄量做低。如果某類頁面确實有稳定的長尾流量,即便内容简短,也應当保留。
收口之後核對哪些指标
- 抓取频次:被收口的 URL 是否還在大量消耗抓取日誌。
- 索引狀態:狀態是否從已编入索引變為已排除,附带的原因是什么。
- 站点层收錄量:總收錄下降的同时,有效頁面的展現與点击是否稳定。
- 内鏈残留:站内是否還有入口指向已收口頁面,需要一並清理或替換。
最後提醒一句:這類判断只能建立在站内自查的日誌與索引狀態之上,任何工具给出的收錄數字都只是參考样本。與其盯着收錄總數,不如把注意力放在“這個 URL 到底解决了什么問题”上。