很多站点的标簽頁、作者頁、日期归档頁都是系統自動生成的。建站初期看起来“多一個入口多一條路”,但运营一两年後,這些地址往往成百上千,内容却高度重合。它們既占抓取预算,也让訪問者点進去只看到几篇标题雷同的文章。
先盘点:到底有多少自動生成的聚合地址
動手之前先弄清楚規模。只看後台的标簽數量往往不够,因為真實可訪問的地址還包括组合參數、分頁和不同模板。
- 導出站点地图和服務器日誌中的地址,按路径規則归類;
- 統計每個标簽下真實文章數量,标出只有一两篇的“孤标簽”;
- 检查是否存在同一标簽的多種寫法,如大小寫、單复數、中英文混用;
- 確認這些頁面是否允许被抓取、是否已被索引。
判断标准:哪些聚合頁值得留
判断的核心問题只有一個:這個聚合頁是否解决了訪問者的某個具体需求。如果它只是把已有文章按机器規則堆在一起,标题和描述也由模板拼出来,那它大概率只是重复。
可以保留的類型
- 围绕稳定主题、文章數量持續增長的标簽;
- 能承接真實检索需求的分類词;
- 編輯人工维護、有獨立說明文字和结构的专题頁。
建议收敛的類型
- 只有一两篇文章的自定义标簽;
- 由分词、拆分词组产生的近义标簽;
- 日期归档、作者归档中長期無人訪問的月份。
處理方式:不是简單刪除了事
删标簽最怕的是留下大量 404,或者把已有外鏈和内鏈一起切断。更稳妥的顺序是:
- 先合並语义相近的标簽,把文章迁移到主标簽下;
- 對确定不再使用的地址做 301 到相關分類或首頁;
- 暂时保留但不希望被索引的頁面,用 noindex 處理,同时確認内鏈不會繼續放大入口;
- 修改模板,避免自動為每一篇新文章生成新的碎标簽。
需要提醒的是,noindex 和 robots.txt 屏蔽不是一回事:如果地址被 robots.txt 挡住,搜尋引擎無法讀取頁面上的 noindex 指令,反而可能長期保留這條“未知”记錄。
让入口和内容保持一致
标簽頁的價值取决于編輯是否真的在维護它。如果决定保留某個标簽,就给它一段简短說明、合理的排序和可讀的列表;内鏈只從相關文章指向它,而不是每篇文章底部無差別铺開。至于分頁,建议保持简單規則,避免“标簽+篩選+排序+頁碼”叠加出成倍的组合地址。
日常维護的节奏
- 每月看一次新增标簽,及时合並零散項;
- 每季度按日誌检查聚合頁的抓取與点击情况,長期只有抓取没有訪問的,考虑收敛;
- 發布規范里寫明标簽的使用范围,從源头减少随意建立。
聚合頁本身没有错,错的是無人管理、無限增長。把地址數量控制在與内容規模匹配的范围内,比追求“入口越多越好”更實际。