站上總有一批頁面,字數不多、信息也單薄:商品詳情只有一行參數,問答只有一個問题,标簽頁只堆了一串連結,篩選頁則是同一批商品換個顺序。這些頁面要不要留、要不要让搜尋引擎收錄,凭感觉很难拍板。更稳妥的做法是先分清两件事:這個頁面有没有獨立存在的價值,以及它占用的抓取和索引位置值不值得。
先分清薄内容的几種来源
不同来源的薄頁面,處理方式並不一样,混在一起判断容易誤伤。
- 空或半空頁面:栏目下只有两三個條目,列表頁照样自動生成,标题和描述几乎一样。
- 模板重复頁:同一套模板套出的問答、词條、城市分站,正文只換了一個词。
- 标簽與聚合頁:按标簽、作者、時間组合出的列表,内容與主分類頁大面积重叠。
- 篩選參數頁:颜色、價格、排序随意组合,能生成成百上千條 URL。
- 摘要型頁面:只放了正文前一两段,完整内容要点進去才能看到。
判断去留,看三件事
1. 是否回答了別的頁面没回答的問题
一個标簽頁如果有明确的搜尋意图支撑,比如用戶确實會按這個标簽找内容,那它就算内容少,也有獨立價值。反過来,只是系統按規則拼出来的组合,用戶既不會搜,也不會從站内点進来,那它存在的意义就只剩「多了一個 URL」。
2. 是否有稳定的站内入口和真實訪問
看一下搜尋日誌和站内搜尋词:這些薄頁面有没有被真實用戶訪問、有没有被其他頁面正常連結。完全没有入口、只能靠站点地图暴露的頁面,通常属于站点结构里的邊角料。
3. 數量是否可控
几十個薄頁面和几萬個薄頁面,性质完全不同。數量一旦上去,抓取額度會被大量低價值 URL 吃掉,真正需要被發現的詳情頁反而排到後面。這也是「抓取不等于收錄」最直观的体現:蜘蛛来了、抓了,但頁面因為质量或重复問题進不了索引,額度却是實打實花掉的。
處理顺序:先补、再合、最後才是 noindex 和刪除
- 补内容:把參數、規格、常见問题、使用场景补齐。能靠补内容救回来的頁面,優先救,因為它的 URL 和已有連結都還留着。
- 合並:语义重复的标簽頁、城市頁,合並到主分類或主頁面,用 301 把權重和入口集中過去。
- 收口參數頁:有搜尋價值的篩選组合保留,canonical 指向主列表;纯排序、纯追踪參數的组合,做 noindex 或直接在 robots 之外用規則收敛。
- 刪除:只有前几步都不成立、頁面對用戶也确實没用时才删。刪除要配 301 指向最近的替代頁,确實没有替代内容的用 410。
noindex 與 robots.txt 的先後顺序
想让頁面登出索引,要用 noindex。robots.txt 只挡抓取,挡不住已经被索引的 URL 繼續出現在结果里。正确顺序是先把 noindex 加上、確認搜尋端能讀到,等頁面從索引中消失之後,再考虑要不要在 robots 里屏蔽。顺序反過来做,搜尋端讀不到 noindex,頁面會在索引里挂很久,而抓取又被挡住,想改都改不動。
决定保留的薄頁面,也要管住抓取
如果判断下来頁面值得留,但短期内补不上内容,可以做两件事:一是收紧内鏈,別让每一頁都從導航、热门推荐里反复出現;二是在站点地图里控制提交范围,只提交有真實價值的 URL。這样既能保住頁面,又不會让它持續分摊抓取額度。
薄内容不是一刀切要删的東西,而是一個需要排序的問题:值不值得留、能不能补、补不上要不要收口。按這個顺序走,比直接批量 noindex 稳妥得多。