标簽頁、日期归档、作者頁、分類頁這類聚合列表頁,通常由模板批量生成,一個站点几百上千個很常见。它們既可能是内鏈的重要节点,也可能成為索引里大量内容雷同的頁面。要不要让它們進索引,不能只凭感觉,得按顺序核對。
先分清三類聚合頁的差异
- 标簽頁 / 话题頁:按主题聚合,同一篇内容可能同时出現在多個标簽下,頁面之間的差异很小。
- 日期归档頁:按年月归档,排序依據只有時間,内容與栏目頁基本重合。
- 作者頁 / 分類頁:作者頁内容随發文更新,分類頁通常承担主要導航职能,價值差异較大。
三類頁面的處理方式不该一样,核對时也要分開統計,不要混在一個數字里看。
判断标准:頁面本身有没有獨立價值
核心問题只有一個:用戶直接落到這個頁面,能不能得到別處得不到的東西。可以從几個角度判断:
- 列表條目是否少于三五個,條目太少时頁面近似空壳;
- 列表是否只有标题加連結,没有摘要、說明或任何篩選维度;
- 同一批内容能否通過排序、篩選、頁碼生成多個 URL;
- 頁面是否在站内導航路径上,還是只能靠内鏈偶然到達。
聚合頁被收錄本身不是問题,問题是它有没有带来新的信息或導航價值。判断依據應该是内容差异,而不是頁面類型。
一條可执行的核對顺序
- 按路径分组統計:在索引报表里按 /tag/、/date/、/author/ 這類目錄前缀分组,看被收錄的數量和占全站的比例。
- 抽查頁面返回内容:抓取几個已被收錄的聚合頁,確認 HTML 里是否有實质文字,還是只有一串标题連結。
- 检查參數變体:看排序、篩選、分頁參數能否生成同一内容的多個 URL,這些版本是否也進了索引。
- 確認 canonical 與机器人指令:聚合頁指向的規范版本是否稳定,分頁序列有没有统一處理。
- 看抓取占比:用日誌統計爬虫在這類路径上的抓取比例,如果占用明顯偏高,說明需要收敛。
- 决定去留並留出观察期:改動後不要立刻下结论,等一轮重抓完成後再看索引狀態。
去留對應的處理方式
- 保留:有編輯說明、有獨立篩選维度、被站内導航實际使用的标簽頁,可以正常放開,並把分頁序列處理好。
- 收敛:同主题标簽過多时,只保留被内鏈和導航實际使用的少數几個,其余合並或下线。
- 不進索引:纯日期归档、内容完全重合的列表頁,可以用 noindex, follow 保留連結传递,同时不在索引里占位。
- 屏蔽參數:無意义的排序、篩選组合可以通過參數規則處理,避免同一批内容生成大量 URL。
容易被忽略的几点
第一,用 robots.txt 屏蔽某個目錄後,頁面虽然不再被抓取,但 canonical 也不會被讀取,索引里可能長期保留舊版本,這種情况下更适合用 noindex 或移除工具處理。
第二,屏蔽聚合頁不等于可以删掉站内連結。列表頁承担着發現新内容的作用,直接断鏈會让位置更深的正文更难被發現。
第三,改完之後舊 URL 不會马上消失,索引更新需要時間。核對时要用同一口径對比改動前後的資料,避免把時間差当成處理效果。
聚合頁的取舍没有统一答案,關键是先統計、再抽查、最後按價值决定保留還是收敛,同时让 URL 規范和机器人指令保持一致。