站点运营

站点运营:分頁與列表頁自查,別让翻頁埋掉内容或制造重复

列表頁和分頁是站内内容分發的主要通道,處理不当會造成重复地址、抓取浪費、老内容沉底。本文從分頁連結形態、canonical 指向、加载方式、越界頁與篩選參數等角度,给出一份可操作的自查清單和處理顺序,帮助站点把翻頁逻辑理顺。

站点运营

站点运营:分頁與列表頁自查,別让翻頁埋掉内容或制造重复

列表頁是内容型站点分發内容的主要通道:首頁、栏目頁、标簽頁、搜尋结果,几乎都要靠分頁把老内容一层层铺開。分頁本身不复杂,但它牵扯到 URL 形態、連結可達性、重复内容判定和抓取效率,一旦處理粗糙,常见的结果是同一批内容散出多個地址、深處頁面長期無人訪問、抓取被低價值的翻頁消耗掉。

先看清分頁的几種形態

不同實現方式對抓取的影响差別很大,自查前先確認自己的站点属于哪一類。

  • 地址型分頁:如 /list/page/2/ 或 /list?page=2,每頁有獨立可訪問的 URL,翻頁連結是真正的 a 标簽,這是對抓取最友好的一種。
  • 加载更多:点击按钮通過 JS 追加内容,地址不變。蜘蛛通常不會点击按钮,第二頁之後的内容基本只能靠其他入口發現。
  • 無限滚動:滚動自動加载,地址往往也不變,且容易形成极深的列表,抓取和回訪都很难控制。

如果站点用的是後两種,重点就不是要不要優化分頁,而是先保證内容有可被直接訪問的静態入口。

分頁自查清單

  • 翻頁連結是否為可点击的 a 标簽,href 指向真實地址,而不是 onclick 或 javascript:void(0)。
  • 分頁 URL 是否稳定,同一頁不會因為會话、排序、来源參數生成多個地址。
  • 每頁的 title 與 description 是否有所区分,至少带上頁碼或区間,避免整站列表頁同名。
  • 分頁頁面的 canonical 指向是否合理:指向自身還是指向列表首頁,需要根據内容是否重复来判断,不要一律指向第一頁。
  • 排序參數(如 ?sort=price、?order=asc)是否會产生大量内容相同、顺序不同的地址,這類地址建议單獨處理或禁止抓取。
  • 篩選组合(地区+分類+價格)是否可控。參數越多,组合越接近無限,抓取很容易被引導到無意义的角落。
  • 列表頁每頁條數是否過大,導致單頁体积和响應時間偏高;也不宜過小,否則翻頁层數過多。
  • 越界頁(頁碼超出實际范围)返回的是空列表 200 還是 404。返回 200 的空頁會造成大量低质地址被反复抓取。
  • 没有内容的空列表頁是否有明确處理,而不是展示一個空白模板。
  • 深层翻頁(第十頁以後)是否還有内鏈可達,是否在站点地图或专题入口中被补充。

老内容沉底的問题

分頁越深,被抓取和被用戶看到的概率越低,這是结构决定的,不是靠調參數能完全解决的。可行的做法是给老内容增加其他入口:按時間或主题整理的归档頁、人工维護的专题頁、相關阅讀模块、站内搜尋,以及在站点地图中包含重要的深层頁面。让同一篇文章有不止一條發現路径,比纠结翻頁深度更實际。

分頁的职责是把内容铺開,而不是把内容藏起来。凡是只能靠翻到第十頁才能找到的内容,都應该問一句:還有没有別的入口。

按這個顺序處理

  1. 先把翻頁連結改成真實可抓取的 a 标簽,确保每頁可達。
  2. 统一分頁 URL 形態,去掉多余參數,確認同一頁只有一種地址。
  3. 检查 canonical 與 title,避免分頁頁之間互相打架。
  4. 處理越界頁和空列表頁,让無内容地址返回合适的狀態碼。
  5. 收敛排序與篩選參數,把明顯重复的组合挡在抓取之外。
  6. 為深层内容补充归档、专题或站点地图入口。

這些調整通常不需要改版,改的是連結寫法和狀態碼判断,但效果往往比反复調整列表頁样式更直接。做完之後,隔一段時間看看爬虫日誌里翻頁地址的訪問情况和狀態碼分布,就能判断處理是否到位。