站点規模一上来,索引里往往混進一批“看着有頁面、讀起来没多少東西”的 URL:參數篩選後的结果、只有一两句话的說明頁、由同一套模板拼出来的地区頁。它們被收錄本身不算错,但如果占比過高,會稀释整站的頁面质量信号,也让後續抓取被摊薄。這里只谈一個動作:這些薄内容頁已经進入索引之後,怎么判断该保留、该合並,還是该逐步登出。
先弄清“薄”指的是信息量,不是字數
很多人把薄内容等同于短文章,于是拼命把段落拉長,结果模板文字變多了,獨立信息却没增加。判断标准應換成:去掉導航、頁脚、推荐位、免责声明這些全站通用部分後,這條 URL 還剩多少只属于它的内容。
可以按下面的顺序粗估:
- 打開頁面源碼,粗略划出模板区域,估算正文区块占整頁可见文本的比例;
- 把正文区块里可复用的句子(同一句式只換了關鍵詞)單獨标出;
- 剩下的、這條 URL 獨有的信息量,就是它真正的“厚度”。
如果獨有信息只有一两行,而且和別的頁面高度重合,那它更接近模板的變体,而不是一個獨立頁面。
獨立價值怎么判断
厚度只是第一步,還要看它有没有獨立存在的理由。可以依次問几個問题:
- 用戶带着明确意图落到這個頁面,能不能在這里得到答案,而不是必须再点走?
- 把它和站内最接近的另一條 URL 放在一起,差异是否值得單獨建頁?
- 它有没有獨有的資料、時間、價格、库存、地域等會随條件變化的信息?
- 它是否承担導航或聚合职责,比如分類首頁?
前三問都答“不”,第四問也答“不”,這條 URL 的獨立價值基本可以判為低。
處理顺序建议
- 先分堆。按 URL 形態归類:參數篩選、分頁、地区或語言變体、标簽聚合、詳情頁模板。同一堆的問题往往同源,處理方式也一致。
- 再定去向。有獨立價值但内容薄,考虑补充獨有信息;無獨立價值且内容與其他頁重合,考虑合並到主頁面並做規范指向;既無價值又無入口的,考虑让抓取和索引逐步登出。
- 合並優先于刪除。如果几條 URL 讲的是同一件事,合並成一條更完整的頁面,通常比直接删掉稳妥,也避免外鏈和用戶书簽失效。
- 改動分批做,留观察窗口。一次改掉大批 URL,很难判断哪一步起了作用。按堆分批,每批之間留出足够時間观察索引和抓取日誌的變化。
- 回看入口。很多薄頁之所以被收錄,是因為内鏈、sitemap 或站外連結把它当正常頁面推了出去。處理頁面本身的同时,也要處理這些入口。
两個容易走偏的地方
把“加字數”当成解法。模板句子堆上去,頁面變長但獨有信息没變,判断结果不會改善,反而让用戶更难找到重点。
把“没被搜到”当成“该删”。有些頁面本来就不是為搜尋流量存在的,比如帮助頁、條款頁,判断标准應是它有没有用,而不是它有没有带来訪問。
收尾
薄内容頁的整理不是一次性動作,更像日常的索引卫生:新模板上线、新篩選條件開放时,都會产生新的變体 URL。把“模板占比加獨立價值”這两個判断固化到上线流程里,比事後一遍遍清理更省力。