站内做聚合頁很常见:把同類商品、同主题文章、同地区服務匯總在一頁,既能承接偏宽的词,也方便用戶横向比較。問题在于,聚合頁和詳情頁往往描述的是同一批内容,标题、摘要、正文段落大量重合。搜尋蜘蛛抓取之後,索引里到底留谁、以谁為主,就成了需要提前设計的事,而不是等收錄異常了再回头改。
先確認是不是真重复
很多站点的問题是没判断清楚就開始改。判断方法並不复杂:把两頁正文抽出来,去掉導航、頁脚、推荐位這些模板部分,看剩余正文的重合比例;再看标题與 H1 是否指向同一個搜尋意图;最後看有没有獨立的信息增量,比如規格參數、價格区間、用戶评價、更新時間。
- 聚合頁只輸出列表和摘要,詳情頁是完整内容——重合度偏高,需要分主次。
- 聚合頁带有詳情頁没有的對比维度或结构化字段——两頁可以並存,但要有分工。
- 两頁 URL 不同、内容几乎逐字一致——這属于同一頁面的多種寫法,先做收口再说其他。
這三類情况處理方式完全不同。把它們混在一起,往往會出現“改了很多地方,索引狀態却没變化”的局面。
主次關系的判断顺序
確認存在重复之後,不要凭感觉選主頁面,按下面這個顺序過一遍,通常能得出比較稳定的结论:
- 搜尋意图:用戶搜這個词时,更可能想先看列表,還是直接看某一個具体條目?
- 信息不可替代性:哪一頁有別的頁面拿不到的稳定内容,而不是靠模板拼接。
- 站内入口與外鏈:哪一頁被更多内鏈指向,外鏈也更集中。
- 可维護性:哪一頁能長期更新,不會几個月後變成一批死鏈或空列表。
四項都指向同一頁时,结论很清楚。如果出現分歧,優先看第一項和第四項——意图决定用戶價值,可维護性决定它能不能長期撑住收錄。
常见處理方式與邊界
用 canonical 指定規范頁
canonical 更适用于“同一内容多種 URL 寫法”的收口,例如带參數、带排序、带追踪碼的版本。如果两頁内容确實不同,只是想人為决定谁被收錄,硬指 canonical 的效果有限,提示也可能被忽略。指向之前,先確認两頁真的表達同一内容。
用内鏈和锚文本表態
内鏈是最温和也最直接的表態方式。想让聚合頁承担收錄,就從更多相關頁面用描述性锚文本指向它;想让詳情頁為主,就別在每個列表項上都堆同样的锚文本。站内連結的分布,會直接影响蜘蛛對頁面重要程度的判断。
noindex 與 robots.txt 的取舍
不要用 robots.txt 去屏蔽一個你還希望被索引的頁面,那样蜘蛛连内容都讀不到,更谈不上判断。至于 noindex,也不要在聚合頁上随手加——先確認它是否真的没有獨立價值。真正该 noindex 的,通常是排序參數、篩選组合、會话追踪這類批量生成的頁面。
分頁與篩選參數
第 2 頁之後的分頁 URL,如果只是同一批内容的排列變化,一般不需要單獨作為收錄目标;篩選參數則要看是否有稳定的搜尋需求,有需求就给它一個干净的静態路径,没有就收口掉。两者都不适合靠“數量堆收錄”。
自查清單
- 是否比對過两頁去模板後的正文重合度,而不是只看标题像不像?
- 主頁面的選擇是否寫下来過,团队里其他人的理解是否一致?
- canonical 指向的是同内容頁面,還是内容不同的两個頁面?
- 内鏈锚文本是否在無意中把權重分散给了辅助頁?
- 有没有頁面同时被 robots.txt 屏蔽、又期望它出現在索引里?
- 參數頁是否已经收敛到干净路径,還是仍在持續生成新 URL?
改動之後怎么观察
調整之後不要每天盯着看數字波動。索引狀態、規范頁的選中情况、抓取频次這几項,通常需要數周才能看出趋势,中間還會有反复。建议按頁面類型建一個小台帳,记錄改動時間、改動内容、当时的狀態,几周後再回看,比凭印象判断可靠得多。
主次關系是设計出来的,不是等搜尋引擎替你决定。越早把分工寫清楚,後面越少出現两頁互相稀释的情况。