站点运营

站点运营:分页与列表页自查,别让翻页把蜘蛛绕进死胡同

列表页和分页地址往往是蜘蛛发现内容的主要通道,比 Sitemap 更常走。翻页参数混乱、加载更多按钮不可抓取、越界页码返回空列表、分页元信息全站雷同,都会让有效抓取打折。本文从 URL 形态、链接可抓取性、越界处理、canonical 取舍和翻页深度几个角度,给出一份能直接照着做的自查清单。

站点运营

站点运营:分页与列表页自查,别让翻页把蜘蛛绕进死胡同

列表页和分页地址,通常是蜘蛛发现站内新内容最主要的通道之一。比起 Sitemap,蜘蛛更常顺着频道页一页页往下翻。如果翻页环节出了问题,后面详情页质量再高,也可能一直没人来。

分页为什么值得单独检查

很多站点把精力花在详情页的标题和正文上,却默认列表页“本来就那样”。实际上分页同时涉及 URL 形态、链接渲染、状态码、元信息四件事,每一件都会影响蜘蛛能不能顺利往下走。

常见的几类分页问题

1. 同一个列表有多个地址

列表首页既能通过 /news/ 打开,也能通过 /news/?page=1 打开;第二页有时是 ?page=2,有时是 /news/page/2/。同一份内容对应多套地址,抓取预算被摊薄,链接关系也被拆开。建议固定一种翻页写法,并让第一页始终指向不带参数的地址。

2. 翻页链接点得动,蜘蛛抓不到

“加载更多”或无限滚动如果只靠 JavaScript 事件触发,源码里没有对应的 a 标签,蜘蛛就没有下一步可走。可以在关闭 JavaScript 的情况下再打开一次列表页,或者直接看源码里有没有 href。

3. 越界页码返回 200 和空列表

列表只有 20 页,访问 ?page=999 仍然返回 200,标题正常但列表为空,这属于典型的空壳地址。蜘蛛会把这些地址记下来反复回访。越界时应返回 404,或者至少给出明确的空状态提示。

4. 分页页面的标题完全一样

第 3 页和第 7 页的 title、描述、H1 一模一样,只有列表内容不同。这本身不算致命,但标题里带上页码或区分标识,排查和判断时会方便很多。

自查清单

  1. 从列表首页手动翻到第 3 页,记录 URL 的变化规律,确认只有一种写法。
  2. 查看翻页链接是否为 a 标签,href 是否指向真实地址。
  3. 在关闭 JavaScript 的状态下打开列表页,看能否继续翻页。
  4. 访问一个远超总页数的页码,确认返回的状态码。
  5. 检查每页展示条数:太少会增加翻页层级,太多会让单页体积偏大。
  6. 确认分页地址有没有被塞进 Sitemap,通常只需放列表第一页。
  7. 检查分页页面的 canonical 指向哪里。
  8. 抽查抓取日志,看蜘蛛是否真的访问到了第 2、3 页之后的地址。

canonical 与索引取舍

分页页面一般建议 canonical 指向自己。把它们统一指向列表第一页,等于告诉搜索引擎后面几页不重要,同时切断了从这些页面继续发现新文章的路径。如果确实不希望分页页参与索引,可以用 noindex,follow 处理,保留链接可追踪性,而不是直接屏蔽抓取。

翻页与排序参数叠加

列表页往往还带排序和筛选,翻页时两者叠加,会拼出大量组合地址。自查时留意是否存在“排序 + 页码”无限增长的入口,必要时限制可选排序项,或者让排序结果不被链接指向。

控制翻页深度

翻到第 50 页以后,内容价值通常已经很低,但地址依然存在。可以考虑限制可翻页的范围,或者超过一定页数后不再输出翻页链接,让抓取集中在前面的有效区间。

分页本身不复杂,难点在于它同时承担“内容入口”和“地址管理”两个角色。把 URL 形态统一、把链接做成可抓取的、把越界地址处理干净,通常比事后补救省力得多。