为什么分页容易被忽略
栏目页、标签页、内容列表页,往往靠分页把内容铺开。运营时我们盯着首页和详情页,分页常被当成附属品。但对蜘蛛来说,分页恰恰是它发现新 URL 的主要通道之一,处理不好会两头受损:要么翻不进去,要么在翻页里反复绕圈。
先确认分页地址是不是唯一
同一个列表,不同参数会生成不同地址:
- /list?page=2
- /list?page=2&sort=new
- /list?p=2&from=nav
如果这些都能访问且返回 200,蜘蛛会把它们当成不同页面,抓取预算被摊薄。建议固定一种分页形式,其余参数用 301 或 canonical 归拢。
分页页面的标题和描述别照抄
很多站点的第 2、3 页 title 和第一页一模一样,正文也只是顺序不同。这类页面本身价值有限,但仍应做到:
- title 带页码或分段标识,便于区分
- description 不用强行堆关键词,写清楚这段列表的范围即可
- 列表摘要有差异,不要所有卡片文案完全相同
目标不是让每个分页都去争排名,而是让蜘蛛能判断这是一条连续的列表。
分页该不该 noindex
把分页全部 noindex,等于把蜘蛛通向深层内容的桥拆掉。
常见误区是嫌分页质量低,一刀切加 noindex 或用 robots.txt 屏蔽。结果蜘蛛到达第一页后无路可走,后面的详情页只能靠外链或站点地图慢慢被发现。更稳妥的做法是保留可抓取,通过 canonical、内链分配来控制,而不是直接封路。
如果一定要限制
至少保证详情页有别的入口,比如相关推荐、最新更新、站点地图,而不是让分页成为唯一通道。
翻页机制要能点到
加载更多按钮、无限滚动这类交互,如果完全依赖脚本触发且没有对应的可访问链接,蜘蛛很难顺着翻。可考虑:
- 提供带页码的真实链接,作为兜底路径
- 滚动加载时同步更新地址,并保证该地址可直接打开
- 关键栏目保留传统分页,别全站只用一种交互
抓取路径上的细节
- 分页末尾要有出口,不要出现空列表还返回 200
- 页码超出范围时返回 404 或跳回第一页,别无限生成
- 排序、筛选参数尽量用 nofollow 或参数规则收敛
- 分页内的内链别都指向同一批热门页
一个简单的自查顺序
- 打开栏目第一页,点进第 2、3、最后一页,看地址是否规范
- 查看源码,确认翻页是可抓取的 a 标签
- 抽查分页的 title、description 是否高度重复
- 确认分页没有被 robots.txt 或 noindex 误封
- 翻到最后一页,看是否正常收尾
分页不产生多少排名价值,但它决定了蜘蛛能不能顺利走到有价值的内容那里。把它当成通道维护,比当成页面优化更合适。