列表頁是站点内容的主要入口,分頁則是把内容切成一段段。分頁做得好,用戶和蜘蛛都能顺着往下走;分頁做得随意,後面几頁就可能變成只有自己知道的角落。下面按几個常见問题梳理自查方向。
先看翻頁連結能不能被点到
不少站点把分頁做成了“加载更多”按钮,点击後由脚本追加内容。這種交互對用戶友好,但如果頁面里没有可点击的静態連結,搜尋引擎就很难發現第二頁之後的内容。自查时可以關掉脚本或查看源代碼,確認分頁入口是否以 a 标簽加 href 的形式存在。
- “加载更多”按钮是否同时提供普通的下一頁連結。
- 頁碼連結是否可獨立訪問,返回正常狀態碼。
- 最後一頁、空列表頁有没有做好提示,而不是报错或空白。
分頁 URL 與參數別太随意
分頁地址常见的有 ?page=2、/page/2/、?paged=2 等多種寫法。同一套列表如果混用多種形式,容易产生重复地址。篩選、排序、翻頁參數叠加时,還可能生成大量内容相近的頁面。自查时可以從這几個点入手:
- 分頁 URL 是否统一,避免同一列表出現多套地址。
- 篩選和排序參數是否被大量抓取,必要时用 robots.txt 或 canonical 做控制。
- 分頁頁面的 canonical 是指向自身還是第一頁,是否符合站点策略。
- 分頁頁面的标题與描述是否只是机械地拼接“第几頁”,是否有区分度。
分頁不必强求每一頁都被收錄,但至少要让重要列表的後几頁有清晰、可抓取的入口。
關于 rel=prev/next 的現状
曾经流行的 rel=prev/next 标记,主流搜尋引擎已不再把它当作分頁信号。它不會带来明顯坏處,但也不该作為分頁方案的核心。更實际的做法是把分頁連結放在 HTML 中,让抓取路径自然存在。
用日誌和 site 查询做驗證
改完分頁结构後,別只看頁面表面。可以结合服務器日誌观察分頁 URL 的訪問情况,看看蜘蛛是否在往下翻,翻到第几頁停止。也可以用站内搜尋观察分頁地址是否被大量收錄,判断篩選參數是否失控。
- 日誌中分頁 URL 的抓取频次是否合理。
- 是否存在大量參數组合地址被反复抓取。
- 重要列表的後几頁是否長期没有抓取记錄。
一份简單的分頁自查清單
- 列表頁分頁是否有普通連結,不依赖脚本。
- 分頁 URL 是否统一,是否與篩選參數混在一起。
- 分頁頁面的标题、描述是否有基本区分。
- 空结果頁與最後一頁是否有合理處理。
- 日誌中是否能看到蜘蛛翻頁,而不是只停在第一頁。
- 改動後是否复查過抓取和收錄狀態的變化。
分頁不是大功能,但它决定了内容能不能被繼續發現。把連結、參數、狀態碼和日誌這几件事對齐,通常就能避免内容被翻頁结构藏起来。