列表頁多起来以後,分頁、标簽聚合、條件篩選三類地址會同时存在。它們本身没有問题,問题在于没人管:同一個列表被拆成几十個地址,蜘蛛在其中来回打轉,真正的内容頁反而分不到多少抓取机會。這篇讲的是怎么把這三類頁面理清楚。
先分清三類頁面
- 分頁:/list/、/list/page/2/ 這類,按時間或热度往下翻。
- 聚合頁:标簽、作者、专题、归档,按主题把跨栏目的内容聚在一起。
- 篩選頁:颜色、價格、地区等參數组合,數量随條件相乘。
三類頁面用途不同,處理方式也不该一样。分頁通常是用戶和蜘蛛進入深层内容的通道;聚合頁有一部分具备獨立價值;篩選頁大多只對目前這位訪客有意义。
分頁自查要点
- 每頁是否有可点击的上一頁、下一頁連結,而不是纯 JS 的“加载更多”。
- 分頁地址是否稳定,參數顺序是否统一,避免 ?page=2&sort=x 與 ?sort=x&page=2 變成两條地址。
- 第一頁是否與栏目首頁地址重复,如果重复,應選其中一個作為規范地址。
- 深分頁(例如第 50 頁)是否還有獨立價值,是否應该保留連結但加上 noindex。
- 列表項的标题和摘要是否随内容更新,別让第 3 頁長期停在三年前的内容上。
聚合頁與篩選頁
- 标簽頁只有一两條内容时,是否值得作為獨立頁面存在。
- 篩選後無结果的空頁面,返回的是 200 還是 404、410。
- 篩選參數是否會無限组合,是否该限制可被抓取的參數范围。
- 聚合頁的标题與描述是否由模板直接拼出来,是否與栏目頁高度雷同。
- 是否需要 canonical 指向上层栏目,或者直接 noindex, follow。
對外暴露的三種方式
常见做法有三種:允许抓取並收錄;允许抓取但不收錄(noindex);不允许抓取(robots 限制或連結不可達)。選擇取决于這個頁面有没有獨立的搜尋需求。多數篩選頁适合第二種;深分頁适合保留連結但配合 noindex;纯排序、纯會话參數适合第三種。要注意 noindex 需要頁面能被抓到才會生效,先用 robots 屏蔽再加 noindex,两者會互相抵消。
判断标准其實很简單:如果這個地址被單獨搜到时,用戶會觉得有用,就留着;如果它只是某位訪客当时的一次篩選结果,就別让它進索引。
一次可执行的检查清單
- 導出近 30 天被訪問的列表類地址,統計带參數的地址數量。
- 抽样 20 個聚合頁,看内容是否與其他頁面大面积重复。
- 检查分頁連結是否為 a 标簽,關閉 JavaScript 後能否点击。
- 检查篩選頁是否會把蜘蛛引向無穷组合,必要时在 robots 中限制參數。
- 检查空结果頁的狀態碼與提示文案,別让它看起来像正常内容頁。
- 观察日誌中列表頁與内容頁的抓取比例,判断是否失衡。
這類自查不必一次做完,先處理重复率最高、被抓取最多的一批,再回头看長尾。改完之後用日誌观察列表頁的抓取量是否下降、内容頁是否上升,比單看收錄數字更有參考價值。