站点运营

站点运营:分页与列表页自查,别让翻页地址堆出一批雷同页面

列表页和分页通常是一个站点里数量最多的页面类型。数量多、差异小,处理不好就会生成大量雷同地址,既分散抓取也影响访客查找内容。本文从地址统一、加载方式、深层分页和标题区分几个方面,整理出一份可以直接照着做的分页自查清单。

站点运营

站点运营:分页与列表页自查,别让翻页地址堆出一批雷同页面

列表页、栏目页和翻页地址,通常是一个站点里数量最多的页面类型。一个栏目如果有 200 条内容、每页显示 10 条,就会产生 20 个分页地址;再加上标签页、时间归档、搜索结果页,站内地址的规模很容易是内容页的几十倍。这些页面平时不太有人盯着看,但结构一旦没理顺,就会出现同一批内容被拆成许多地址、蜘蛛在深层分页里来回绕的情况。

分页为什么值得单独拿出来看

内容页的质量有编辑把关,列表页却往往是模板自动生成的,页面之间的差异只有几条标题和摘要。这种高度相似的结构如果没有边界,很容易让站点里看起来差不多的页面占据大多数。

对访客来说,分页是找内容的通道;对搜索蜘蛛来说,分页是发现新地址的路径。两条线都要走通,才不至于出现新内容发布了却迟迟没人访问,或者蜘蛛天天在翻第 30 页的情况。

常见的几类分页问题

列表首页和翻页首页是两个地址

栏目首页通常是 /news/,而翻到第一页时又出现 /news/?page=1。两者内容完全一致,却分别对外提供。建议统一到不带参数的地址,用 canonical 指向它,或者把带 page=1 的地址 301 过去,避免同一份内容保留两个入口。

加载更多只靠脚本实现

点击“加载更多”后用 JavaScript 把内容追加到当前页面,这种做法在视觉上很顺,但后续内容可能只存在于脚本里。比较稳妥的做法是保留一组真实可点的分页链接,例如“下一页”指向 /news/?page=2,让脚本在其上做增强,而不是把链接整个省掉。

深层分页内容高度重复

有些列表页排序规则固定,翻到后面几页时展示的内容和前面差别不大;标签交叉之后,同一篇文章可能出现在十几个不同的列表页里。这类地址如果全部开放抓取,抓取额度就会消耗在重复页面上。

分页页面的标题和描述完全一样

第 1 页到第 20 页共用同一个标题,用户在搜索结果里很难分辨,蜘蛛也无法从标题判断这一页的重点。至少在标题里带上页码或当前范围,让每页有可区分的标识。

一份可执行的自查清单

  • 确认栏目首页与第一页地址是否统一,是否存在两个都能访问的地址。
  • 检查“下一页”是否有真实的 a 标签链接,而不是只绑定点击事件。
  • 查看每页条数设置,条数过少会让分页层级拉得很深,过多则单页内容过重。
  • 抽查深层分页(如第 10 页以后)的访问情况,判断是否值得继续开放。
  • 检查时间归档页、标签页是否生成了大量内容稀薄的地址。
  • 确认分页地址是否有规律,避免出现随机参数或带会话信息的字符。
  • 如果列表页是某些内容页的唯一入口,调整 robots 规则前先确认不会切断发现路径。

调整之后怎么看效果

改动分页结构后,先看蜘蛛访问日志里列表页的访问比例是否下降、内容页的访问是否更集中;再看收录情况是否保持稳定。这个过程通常比较慢,不必指望几天内就有明显变化,重点是把站内地址收敛到可以解释的状态。

分页不是越少越好,也不是越多越好,关键是每一条翻页地址都能说清楚它存在的理由。

小结

把分页和列表页当作站点结构的一部分来维护:统一首页地址、保留真实链接、给每页可区分的标题、对内容重复的深层页面做取舍。做完这几步,站内地址的规模会更容易理解,蜘蛛也能把更多精力放在真正的内容上。