分页、筛选、排序页面是站内最容易产生大量 URL 的地方,也是收录问题的高发区。它们既不是完全没用的页面,也不是每一页都值得进索引——判断标准不是“能不能抓”,而是“这一页有没有独立存在的检索价值”。
先把三类页面分开看
- 分页:列表的第 2、3、4 页,通常只是同一批内容的不同片段。
- 筛选:按价格、颜色、地区等条件组合出来的结果页。
- 排序:按时间、销量、热度切换顺序,内容集合往往完全一样。
三者逻辑不同,混在一起做决策,很容易把该留的屏蔽掉,或者把不该收的全放进来。
分页页面:第 2 页之后通常不追求收录
对大多数商品列表、文章列表来说,分页页面本身没有独立标题和独立摘要,用户也很少通过“列表第 7 页”找到你。它们的主要作用是让蜘蛛顺着链接继续往下走,把深层详情页发现出来。
常见做法是:分页页面保留可抓取、可跟进链接,但不作为索引的重点,也不必强行给每一页写独立的标题和描述。如果分页 URL 用了参数形式,注意给第 1 页做自指向 canonical,避免 ?page=1 和主列表页互相竞争。
筛选页:判断标准是“这个组合有没有人搜”
筛选页的价值差异极大。像“城市 + 房型”“品牌 + 型号”这类有稳定搜索需求的组合,可能值得保留;而颜色 × 尺码 × 价格区间的排列组合,动辄成千上万条 URL,绝大多数没有独立需求。
判断时可以问三个问题:这个组合会不会有人在搜索框里输入?页面上的内容量是否足以支撑一个独立页面?如果去掉筛选条件,剩下的内容是不是和主列表页几乎一样?三个问题里有两个答不上来,就倾向于不进索引。
几种常见处理手法的边界
- noindex:让页面留在索引之外,但蜘蛛仍会抓取,适合内容量不足、却仍有导航价值的筛选页。
- robots.txt 屏蔽:连抓取都禁止。适合参数组合爆炸、完全没有收录必要的页面;但屏蔽之后页面上的内链也就断了,要确认不会影响重要页面的发现。
- canonical 指向主列表页:适合内容高度重合的排序页、会话参数页。注意 canonical 是建议而非命令,也不要和 noindex 同时使用。
- 参数规范:固定参数顺序、去掉无用跟踪参数,让同一组条件只对应一个 URL。
- 分层导航:把有价值的筛选组合做成静态入口,放在页面上可点击的位置,而不是只留在表单里。
一个可执行的判断顺序
- 先用服务器日志或搜索控制台,看哪些分页、筛选 URL 已经被抓取,抓取量有多大。
- 把有独立搜索需求、内容足够的组合挑出来,保留在索引里。
- 内容重复度高的排序页,统一 canonical 到默认排序版本。
- 无需求、无内容量的参数页,先收敛参数,再考虑 noindex。
- 确认所有重要详情页,仍能通过至少一条正常内链被走到。
处理完要观察什么
调整之后不要只盯着“收录数量降了多少”。更值得关注的是:重要详情页的抓取是否变多、索引里留下的页面是否更接近你希望被搜到的那批、以及日志里爬虫的时间是否从无意义的参数页转移到了内容页。索引数量下降但有效页面被抓得更勤,通常说明方向是对的。
任何处理方式都不能保证收录或排名。搜索引擎最终按自己的判断决定是否索引,站内能做的是把信号整理清楚:让有价值的页面只有一个地址、能被链接到、内容足够独立。