網站收錄

归档頁、标簽頁與作者頁:聚合列表頁的收錄取舍與核對顺序

标簽頁、日期归档和作者頁往往由模板批量生成,内容高度相似,既容易被收錄成大量低價值頁面,也可能因為屏蔽方式不当影响内鏈传递。本文按路径分组統計、頁面内容抽查、參數變体、canonical 與 robots 處理、抓取占比几條线,给出一套可执行的核對顺序與取舍建议。

網站收錄

归档頁、标簽頁與作者頁:聚合列表頁的收錄取舍與核對顺序

标簽頁、日期归档、作者頁、分類頁這類聚合列表頁,通常由模板批量生成,一個站点几百上千個很常见。它們既可能是内鏈的重要节点,也可能成為索引里大量内容雷同的頁面。要不要让它們進索引,不能只凭感觉,得按顺序核對。

先分清三類聚合頁的差异

  • 标簽頁 / 话题頁:按主题聚合,同一篇内容可能同时出現在多個标簽下,頁面之間的差异很小。
  • 日期归档頁:按年月归档,排序依據只有時間,内容與栏目頁基本重合。
  • 作者頁 / 分類頁:作者頁内容随發文更新,分類頁通常承担主要導航职能,價值差异較大。

三類頁面的處理方式不该一样,核對时也要分開統計,不要混在一個數字里看。

判断标准:頁面本身有没有獨立價值

核心問题只有一個:用戶直接落到這個頁面,能不能得到別處得不到的東西。可以從几個角度判断:

  • 列表條目是否少于三五個,條目太少时頁面近似空壳;
  • 列表是否只有标题加連結,没有摘要、說明或任何篩選维度;
  • 同一批内容能否通過排序、篩選、頁碼生成多個 URL;
  • 頁面是否在站内導航路径上,還是只能靠内鏈偶然到達。
聚合頁被收錄本身不是問题,問题是它有没有带来新的信息或導航價值。判断依據應该是内容差异,而不是頁面類型。

一條可执行的核對顺序

  1. 按路径分组統計:在索引报表里按 /tag/、/date/、/author/ 這類目錄前缀分组,看被收錄的數量和占全站的比例。
  2. 抽查頁面返回内容:抓取几個已被收錄的聚合頁,確認 HTML 里是否有實质文字,還是只有一串标题連結。
  3. 检查參數變体:看排序、篩選、分頁參數能否生成同一内容的多個 URL,這些版本是否也進了索引。
  4. 確認 canonical 與机器人指令:聚合頁指向的規范版本是否稳定,分頁序列有没有统一處理。
  5. 看抓取占比:用日誌統計爬虫在這類路径上的抓取比例,如果占用明顯偏高,說明需要收敛。
  6. 决定去留並留出观察期:改動後不要立刻下结论,等一轮重抓完成後再看索引狀態。

去留對應的處理方式

  • 保留:有編輯說明、有獨立篩選维度、被站内導航實际使用的标簽頁,可以正常放開,並把分頁序列處理好。
  • 收敛:同主题标簽過多时,只保留被内鏈和導航實际使用的少數几個,其余合並或下线。
  • 不進索引:纯日期归档、内容完全重合的列表頁,可以用 noindex, follow 保留連結传递,同时不在索引里占位。
  • 屏蔽參數:無意义的排序、篩選组合可以通過參數規則處理,避免同一批内容生成大量 URL。

容易被忽略的几点

第一,用 robots.txt 屏蔽某個目錄後,頁面虽然不再被抓取,但 canonical 也不會被讀取,索引里可能長期保留舊版本,這種情况下更适合用 noindex 或移除工具處理。

第二,屏蔽聚合頁不等于可以删掉站内連結。列表頁承担着發現新内容的作用,直接断鏈會让位置更深的正文更难被發現。

第三,改完之後舊 URL 不會马上消失,索引更新需要時間。核對时要用同一口径對比改動前後的資料,避免把時間差当成處理效果。

聚合頁的取舍没有统一答案,關键是先統計、再抽查、最後按價值决定保留還是收敛,同时让 URL 規范和机器人指令保持一致。