站点运营

站点运营:分頁與列表頁自查,別让翻頁地址堆出一批雷同頁面

列表頁和分頁通常是一個站点里數量最多的頁面類型。數量多、差异小,處理不好就會生成大量雷同地址,既分散抓取也影响訪客查找内容。本文從地址统一、加载方式、深层分頁和标题区分几個方面,整理出一份可以直接照着做的分頁自查清單。

站点运营

站点运营:分頁與列表頁自查,別让翻頁地址堆出一批雷同頁面

列表頁、栏目頁和翻頁地址,通常是一個站点里數量最多的頁面類型。一個栏目如果有 200 條内容、每頁顯示 10 條,就會产生 20 個分頁地址;再加上标簽頁、時間归档、搜尋结果頁,站内地址的規模很容易是内容頁的几十倍。這些頁面平时不太有人盯着看,但结构一旦没理顺,就會出現同一批内容被拆成许多地址、蜘蛛在深层分頁里来回绕的情况。

分頁為什么值得單獨拿出来看

内容頁的质量有編輯把關,列表頁却往往是模板自動生成的,頁面之間的差异只有几條标题和摘要。這種高度相似的结构如果没有邊界,很容易让站点里看起来差不多的頁面占據大多數。

對訪客来说,分頁是找内容的通道;對搜尋蜘蛛来说,分頁是發現新地址的路径。两條线都要走通,才不至于出現新内容發布了却迟迟没人訪問,或者蜘蛛天天在翻第 30 頁的情况。

常见的几類分頁問题

列表首頁和翻頁首頁是两個地址

栏目首頁通常是 /news/,而翻到第一頁时又出現 /news/?page=1。两者内容完全一致,却分別對外提供。建议统一到不带參數的地址,用 canonical 指向它,或者把带 page=1 的地址 301 過去,避免同一份内容保留两個入口。

加载更多只靠脚本實現

点击“加载更多”後用 JavaScript 把内容追加到目前頁面,這種做法在视觉上很顺,但後續内容可能只存在于脚本里。比較稳妥的做法是保留一组真實可点的分頁連結,例如“下一頁”指向 /news/?page=2,让脚本在其上做增强,而不是把連結整個省掉。

深层分頁内容高度重复

有些列表頁排序規則固定,翻到後面几頁时展示的内容和前面差別不大;标簽交叉之後,同一篇文章可能出現在十几個不同的列表頁里。這類地址如果全部開放抓取,抓取額度就會消耗在重复頁面上。

分頁頁面的标题和描述完全一样

第 1 頁到第 20 頁共用同一個标题,用戶在搜尋结果里很难分辨,蜘蛛也無法從标题判断這一頁的重点。至少在标题里带上頁碼或目前范围,让每頁有可区分的标识。

一份可执行的自查清單

  • 確認栏目首頁與第一頁地址是否统一,是否存在两個都能訪問的地址。
  • 检查“下一頁”是否有真實的 a 标簽連結,而不是只绑定点击事件。
  • 查看每頁條數設定,條數過少會让分頁层級拉得很深,過多則單頁内容過重。
  • 抽查深层分頁(如第 10 頁以後)的訪問情况,判断是否值得繼續開放。
  • 检查時間归档頁、标簽頁是否生成了大量内容稀薄的地址。
  • 確認分頁地址是否有規律,避免出現随机參數或带會话信息的字符。
  • 如果列表頁是某些内容頁的唯一入口,調整 robots 規則前先確認不會切断發現路径。

調整之後怎么看效果

改動分頁结构後,先看蜘蛛訪問日誌里列表頁的訪問比例是否下降、内容頁的訪問是否更集中;再看收錄情况是否保持稳定。這個過程通常比較慢,不必指望几天内就有明顯變化,重点是把站内地址收敛到可以解释的狀態。

分頁不是越少越好,也不是越多越好,關键是每一條翻頁地址都能说清楚它存在的理由。

小结

把分頁和列表頁当作站点结构的一部分来维護:统一首頁地址、保留真實連結、给每頁可区分的标题、對内容重复的深层頁面做取舍。做完這几步,站内地址的規模會更容易理解,蜘蛛也能把更多精力放在真正的内容上。