很多站点的列表頁,前几頁還算干净,越往後翻越乱:同一批内容被拆成几十個地址,翻頁參數各不相同,有的能打開、有的报错、有的直接跳回首頁。平时看不太出来,但蜘蛛顺着翻頁連結一路抓下去,很容易把時間花在這些重复列表上。
先看清自己的翻頁長什么样
打開栏目列表,從第一頁翻到最後一頁,把地址记下来。常见的有几種:
- 路径型:/news/page/2/,静態化程度高,地址稳定;
- 參數型:/news?page=2,參數位置和顺序经常變;
- 混合型:既有路径又有參數,翻几頁之後两種形式混着出現;
- 篩選叠加:分類、排序、頁碼一起出現,组合數量迅速膨胀。
形式本身没有绝對好坏,問题在于同一套翻頁是否只對應一套地址。如果第二頁既能用 A 地址打開,又能用 B 地址打開,内容完全一样,那這两條地址就在互相分流。
翻頁頁面上常见的四個問题
1. 翻到很後面還在被索引
栏目内容多的时候,翻到第三十頁之後,往往只剩一些很早的舊文章摘要。這類頁面给訪客的價值不高,却和正文頁抢抓取机會。可以结合站点實际情况,给超過一定深度的翻頁加 noindex, follow,或者限制翻頁連結的出現范围。
2. 頁碼翻過头,出現空列表
頁碼超過實际頁數时,有的站点返回空白列表,狀態碼却是 200;有的直接报错。前者容易被当成正常頁面,後者會浪費一次抓取。更稳妥的做法是:超出范围返回 404,或者跳回可用的最後一頁。
3. 翻頁連結全部挤在頁面底部一小块
如果只有「上一頁 下一頁」两個連結,想深入只能一頁頁爬。栏目内容确實重要时,可以在列表底部给出若干頁碼或分段入口,让訪客和蜘蛛都能快速跳到中段,而不是靠几十次点击。
4. 列表里混着失效連結
列表頁是站内連結的集中出口,一條失效地址出現在列表里,會被反复抓到。定期抽查列表頁里的連結狀態,比等到日誌里發現大量 404 更省事。
一份可以按顺序执行的自查清單
- 列出全站所有會产生翻頁的栏目,标注地址形式;
- 逐頁訪問,確認同一頁只對應一條地址,多余的做跳轉或合並;
- 確認翻頁頁面的标题、描述是否只有頁碼差別,若高度重复可考虑统一處理;
- 检查第一頁地址:列表首頁是否和栏目首頁是两條不同地址;
- 检查末頁與超范围頁碼的返回狀態;
- 抽查列表内連結,记錄失效比例;
- 在日誌或抓取记錄里看翻頁地址的抓取频次,判断是否偏高;
- 把處理規則寫下来,方便下次改版时照着做。
處理时的几個原則
第一,能合並就合並。同一頁内容有多條地址时,優先保留一條,其余 301 過去,而不是两套並行。
第二,不要一刀切。内容量大的核心栏目和深度很浅的邊缘栏目,處理方式可以不同。全部 noindex 會把有用的入口也一起挡掉。
第三,改動要留记錄。翻頁規則涉及大量地址,改完最好在表格里记下時間、范围、規則,避免半年後自己也说不清哪條生效。
翻頁不是必须消灭的東西,它只是站内導航的一種形式。關键是让每一條翻頁地址都有明确用途,而不是因為程序預設生成就長期留在站上。
這類整理不需要一次做完。挑一個内容量大的栏目先试,把地址形式统一、超范围頁碼處理好,再推廣到其他栏目,改動带来的影响也更容易观察。