当栏目里的内容越积越多,列表页会自然分成多页。对访客来说,翻页只是点一下;对抓取来说,分页是通往深层内容的主要路径之一。分页做得含糊,最直接的结果是老文章长期缺少入口,只能靠 sitemap 或站内搜索偶尔被碰到。下面整理几处常见的分页问题,以及一份可以照着走的自查清单。
分页为什么容易被忽略
首页和栏目第一页往往是运营关注的重点,标题、描述、排版都会被反复调整,而第二页往后很少有人打开看。问题也多半藏在这些没人看的页面里:链接是脚本生成的、参数越翻越长、每页标题一模一样。这些细节单看都不致命,叠在一起就会让深层内容变得难以被正常发现。
几类常见问题
翻页入口不是链接
有些前端组件把“下一页”做成按钮,点击后由脚本拼接数据渲染。人能正常用,但抓取端拿到的 HTML 里可能只有一个空容器,看不到指向第二页的地址。比较稳妥的做法是保留常规的 a 标签链接,再由脚本接管交互,让没有执行脚本的访问也能顺着链接走下去。
分页地址参数混乱
同一批列表内容,可能出现 /list/page/2、/list?p=2、/list?page=2&from=home 等多种形式。地址不统一,容易让同一页内容以多个 URL 出现,也会让后续的统计和排查变得费劲。建议固定一套分页规则,站内所有翻页链接都指向这套地址,不要混用。
分页页面标题与描述重复
如果第二页到第二十页的标题都是同一个栏目名,描述也是同一句话,那么这些页面在结果里几乎无法区分。可以在标题里带上页码或该页的内容特征,描述也按页做一点区分。至少要让每一页看起来不是第一页的复制品。
canonical 指向第一页
为了处理重复内容,有人会把所有分页的 canonical 都指向第一页。这样做的代价是,分页地址自身传递的信号被削弱,深层内容的发现路径也随之变窄。分页页面通常更适合自指,让每一页代表自己那一段列表。
无限滚动没有兜底
无限滚动体验流畅,但如果没有可访问的分页地址作为后备,内容就只能靠脚本加载。可以保留一组普通的翻页链接,或者在页脚提供“查看全部”的分页入口,作为兜底路径。
自查清单
- 关闭脚本后,翻页链接是否还能看到并可点击;
- 翻页地址是否统一,是否存在多套参数并存;
- 每页的 title、description 是否能区分;
- canonical 是否为自指,是否与第一页冲突;
- 分页页面的正文是否有实质内容,而不是只有标题列表;
- 第一页与第二页之间是否存在互相链接;
- 分页是否有合理上限,是否存在能翻到几十页之后的空页;
- 无限滚动或“加载更多”是否有备用入口。
处理时的顺序
先看抓取端的实际表现,再动结构。可以先用抓取工具或查看服务器日志,确认分页地址是否被访问过、访问到第几页停下。确认之后再调整链接形式或地址规则,一次改一处,改完观察一段时间。分页结构一旦变动,旧地址最好保留跳转,避免已有的入口失效。
分页不是排版问题,而是内容发现路径的一部分。把翻页链接做得可读、可点、可区分,深层内容的曝光机会自然会多一些。