列表页是站点内容的主要入口,分页则是把内容切成一段段。分页做得好,用户和蜘蛛都能顺着往下走;分页做得随意,后面几页就可能变成只有自己知道的角落。下面按几个常见问题梳理自查方向。
先看翻页链接能不能被点到
不少站点把分页做成了“加载更多”按钮,点击后由脚本追加内容。这种交互对用户友好,但如果页面里没有可点击的静态链接,搜索引擎就很难发现第二页之后的内容。自查时可以关掉脚本或查看源代码,确认分页入口是否以 a 标签加 href 的形式存在。
- “加载更多”按钮是否同时提供普通的下一页链接。
- 页码链接是否可独立访问,返回正常状态码。
- 最后一页、空列表页有没有做好提示,而不是报错或空白。
分页 URL 与参数别太随意
分页地址常见的有 ?page=2、/page/2/、?paged=2 等多种写法。同一套列表如果混用多种形式,容易产生重复地址。筛选、排序、翻页参数叠加时,还可能生成大量内容相近的页面。自查时可以从这几个点入手:
- 分页 URL 是否统一,避免同一列表出现多套地址。
- 筛选和排序参数是否被大量抓取,必要时用 robots.txt 或 canonical 做控制。
- 分页页面的 canonical 是指向自身还是第一页,是否符合站点策略。
- 分页页面的标题与描述是否只是机械地拼接“第几页”,是否有区分度。
分页不必强求每一页都被收录,但至少要让重要列表的后几页有清晰、可抓取的入口。
关于 rel=prev/next 的现状
曾经流行的 rel=prev/next 标记,主流搜索引擎已不再把它当作分页信号。它不会带来明显坏处,但也不该作为分页方案的核心。更实际的做法是把分页链接放在 HTML 中,让抓取路径自然存在。
用日志和 site 查询做验证
改完分页结构后,别只看页面表面。可以结合服务器日志观察分页 URL 的访问情况,看看蜘蛛是否在往下翻,翻到第几页停止。也可以用站内搜索观察分页地址是否被大量收录,判断筛选参数是否失控。
- 日志中分页 URL 的抓取频次是否合理。
- 是否存在大量参数组合地址被反复抓取。
- 重要列表的后几页是否长期没有抓取记录。
一份简单的分页自查清单
- 列表页分页是否有普通链接,不依赖脚本。
- 分页 URL 是否统一,是否与筛选参数混在一起。
- 分页页面的标题、描述是否有基本区分。
- 空结果页与最后一页是否有合理处理。
- 日志中是否能看到蜘蛛翻页,而不是只停在第一页。
- 改动后是否复查过抓取和收录状态的变化。
分页不是大功能,但它决定了内容能不能被继续发现。把链接、参数、状态码和日志这几件事对齐,通常就能避免内容被翻页结构藏起来。