很多站点的頁面是批量生成的:同一個模板,換掉标题、几張图、几行參數,就产出一批 URL。對用戶来说這些頁面可能各有用途,但對搜尋引擎来说,剥离導航、頁脚、侧栏之後,剩下的差异可能非常小。当公共部分占了大半,頁面的主体信息就不足以支撑它被單獨索引。
為什么要先剥掉公共部分
搜尋引擎判断一個頁面时,會先尝试识別主体内容区,把全站通用的導航、版權、备案、推荐位、客服入口等视為样板文字。同一模板下大量頁面的這些部分完全一致,真正能区分它們的只有正文那一块。如果這块太短、太相似,或者只是關鍵詞的排列组合,頁面之間就容易被视為近似重复,落到“已抓取,尚未编入索引”或“重复網頁,系統選擇的規范網頁與用戶指定的不同”這類狀態里。
這里要分清两件事:頁面能被抓取,不代表它的内容足以被單獨收錄;被收錄過一段時間,也不代表它會一直留在索引里。内容價值的评估是持續發生的。
三種高频的模板重复场景
列表頁與聚合頁
标簽頁、分類頁、站内搜尋结果頁往往只有條目标题在變,其余都是導航和篩選框。這類頁面的價值在于帮助用戶和蜘蛛發現下級 URL,但如果它自身没有獨特說明,被索引的意义就有限。可以让真正有入口價值的列表頁保留索引,其余通過連結结构收敛。
多地区、多參數落地頁
同一套服務文案複製到几十個城市、只替換地名,是很典型的重复。话题词覆盖看似很广,實际每頁的有效信息很少。更稳妥的做法是把地区差异寫成真實内容:当地的服務范围、案例、响應時間與联系方式,而不是只換两個字。
商品與變体頁
颜色、尺寸、套餐不同但描述完全一致时,容易互相竞争。可以只让有獨立描述或獨立库存狀態的變体單獨成頁,其余的通過主版本頁内的選項切換呈現,或者用 canonical 指向主版本。
怎么估計一頁的獨特占比
- 關掉样式與脚本,看正文在整頁文字里的比例;如果去掉導航後只剩两三句话,這頁大概撑不住。
- 随机取同模板的五個頁面,把文字複製出来對比,看有多少段落是整段相同的。
- 用站内搜尋定位同模板頁面,观察它們是否成批地停留在“已抓取,尚未编入索引”。
- 查服務器日誌,看這些 URL 的抓取频次與狀態碼變化,判断蜘蛛是否在减少回訪。
可以落地的收口方式
- 先判断這頁值不值得存在。如果它既没有獨立信息,也不是必要的導航节点,就不要單獨生成 URL。
- 给留下的頁面补上真實差异。資料、說明、常见問题、来自用戶的反馈,都比重复的形容词有用。
- 压缩公共区域的体积。把大段通用說明收到獨立頁面並用連結指向,頁脚里的關鍵詞堆砌删掉。
- 用 canonical 處理站内近似頁。注意指向的目标頁本身要能進索引,否則收口鏈條會断掉。
- 對确實不需要索引的頁面用 noindex。noindex 是索引開關,不是抓取開關,別和 robots.txt 混用。
收錄上的很多問题,最後都回到同一句话:這個 URL 有没有必要單獨存在。答案是否定的时候,删掉、合並或收口,通常比繼續優化更快。
最後提醒一句:處理模板重复不是把所有相似頁面一刀切掉。分類頁、分頁、篩選頁在站点结构里各有作用,關键是分清哪些需要被發現、哪些需要被索引。混在一起讨论,往往两头都做不好。