栏目结构在搭建的时候通常是清晰的,但站点运营一两年之後,往往會多出一批計划外的頁面:編輯随手填的标簽、系統自動生成的日期归档、作者列表頁、临时专题頁。這些頁面平时几乎没人訪問,對蜘蛛来说却是實打實的可抓取 URL。數量一旦上去,抓取预算就被摊薄在價值不高的地址上。
先把归档類頁面盘清楚
不同 CMS 的叫法不一样,但归属大致相同:
- 分類归档:栏目下一級或多級分類;
- 标簽归档:由編輯或系統根據關鍵詞生成;
- 作者归档:多作者站点常见,單作者站点往往也會生成一個;
- 日期归档:按年、月甚至按日生成;
- 专题與合集頁:围绕某個事件或主题临时聚合。
把它們列成一張表,标上 URL 規則、頁面數量、平均條目數和是否有獨立搜尋需求,後面的判断會轻松很多。
什么情况算薄内容
不需要套复杂的评分模型,几條對得上就该留意:
- 列表里只有三五條,而且短期内不會增加;
- 頁面除了标题連結,没有導语、没有說明文字,用戶看完不知道這一頁是干什么的;
- 同一批文章同时出現在分類頁、标簽頁和专题頁里,内容高度重合;
- 该頁面没有對應的搜尋需求,用戶基本不會主動搜到它。
三種處理路径
保留並补强
對确實有搜尋需求的归档頁,可以补一段一两百字的說明,讲清這個栏目收錄什么、按什么逻辑组织;同时控制每頁條目數量,條目太多就分頁,分頁連結保持可抓取。這样它就從一張标题清單變成了有獨立價值的入口頁。
合並與裁撤
拼寫相近、含义重叠的标簽可以合並到一個主标簽,舊地址用 301 指向新地址。日期归档如果没人看,可以直接把入口從模板里去掉,同时確認列表頁不再輸出相關連結;已经产生收錄的,视情况做重定向或者让它自然淡出。裁撤之前先看成因,別把還在被外部引用的地址一刀切掉。
限制抓取與收錄
决定不收錄的归档頁,用 noindex 或 robots.txt 處理,但要分清两者的用途:noindex 针對收錄,不针對抓取,蜘蛛仍會照常訪問頁面;robots.txt 屏蔽抓取之後,頁面上的 noindex 标簽也就讀不到了,容易出現“已经屏蔽、索引里却還留着”的尴尬。另外,noindex 頁面上的内鏈依然會引導蜘蛛繼續爬,如果不想让某個内容集合被大量展開,模板层面的連結輸出也要一並調整。
自查清單
- 導出站点全部归档類 URL,按類型統計數量與平均條目數;
- 核對同一批文章被多少個地址重复承载;
- 检查归档頁模板是否輸出了導语和分類說明;
- 確認分頁序列的連結可被抓取,不依赖 JavaScript 点击加载;
- 確認 noindex、robots.txt、canonical 三者的策略不互相打架;
- 检查 Sitemap 是否還在推送已决定不收錄的归档地址。
改完之後怎么驗證
調整後的一两周里,重点看抓取日誌中归档類地址的請求占比是否下降、重点内容頁的抓取频次有没有回升,以及索引报告里被排除的頁面是否與预期一致。索引狀態變化需要時間,不必每天盯着看,按周對比更實际。
归档頁本身不是問题,無人维護又大量重复的归档頁才是。定期把它們拿出来過一遍,比反复折腾首頁要有效得多。