列表頁和分頁经常被放在一起讨论,但它們其實在做两件事。列表頁往往有真實搜尋需求,用戶會搜某個分類、某個榜單;分頁更多是一條路径,作用是让蜘蛛顺着往下走,把更深的詳情頁找出来。把這两件事分開看,後面的取舍會清楚很多。
先看分頁的 URL 是怎么長出来的
常见的形態有這几種:
- 路径式分頁,例如 /list/page/2/
- 參數式分頁,例如 /list?page=2,或者再叠加排序、篩選參數
- 無限滚動或“加载更多”,内容靠 JS 追加,URL 不變
- “查看全部”頁,把所有條目铺在一個長頁面上
前两種對蜘蛛最友好,因為每個狀態都有獨立地址,可以被單獨抓取。後两種的風險在于,如果没有任何可抓取的地址,蜘蛛只能看到第一屏,後面的條目就少了入口。另外要留意 rel="next" / rel="prev" 這類标记,它們已经不再被主流搜尋引擎当作收錄信号,只算提示,不能替代可抓取的連結。
分頁頁面對收錄的價值到底有多少
一個分頁頁面本身被搜到的概率通常不高,用戶很少去搜“第 7 頁”。它的價值主要有两点:传递連結關系、提供發現路径,以及承接一部分浏览型需求。
但分頁也很容易變成重复内容的来源。如果分頁复用了列表首頁的标题、描述和大段摘要,几十個分頁在索引评估里看起来會非常接近。结果可能是只有第一個版本被留下,也可能几個版本互相稀释信号。
判断标准可以简化成一句:這個分頁有没有獨立的、值得被單獨检索的信息。如果没有,它更應该被当作路径,而不是被当作目标頁面。
三種常见處理方式,各自的代價
用 noindex 關掉分頁
這是最常见的做法。需要注意的是,noindex 的分頁依然可以被抓取,頁面里的連結也依然可以被跟随,蜘蛛顺着往下走還是能發現詳情頁。真正的風險是同时又在 robots.txt 里屏蔽了分頁:蜘蛛既抓不到頁面,也看不到頁面里的連結,更看不到 noindex,深层頁面可能就此断了入口。
用 canonical 指向第一頁
把後面几頁的 canonical 都指向第一頁,表達的是“這些属于同一個序列”。這種做法會让分頁基本不進入索引,同时保留可抓取性。代價是,如果分頁确實有獨立的浏览需求,這部分入口就丢了。還要注意,canonical 指向的頁面内容應该确實相近,如果指向的頁面差別很大,這個信号本身會被忽略。
保持可索引
适合确實有浏览需求的站点,比如电商的分類翻頁、内容站的主题列表。前提是每個分頁有自己的标题和描述,並且不出現大量由纯參數组合生成的空頁面。
還有一個容易忽略的地方是 sitemap。如果分頁已经被 noindex,就不该再出現在 sitemap 里,两種信号互相矛盾,只會让蜘蛛反复確認。如果分頁保持可索引,提交少數有獨立價值的那几頁就够了,把几十頁翻頁全部塞進去,反而分散了抓取額度。
几個可以落地的检查項
- 從列表第一頁出發,不依赖 JS 能不能点到後面的分頁?
- 分頁 URL 是否稳定,參數顺序、大小寫、尾部斜杠是否统一?
- 空结果頁、超出范围的分頁返回的是 404 還是 200?
- 篩選參數组合出的地址有多少,有没有形成大量内容雷同的頁面?
- 做了 noindex 之後,詳情頁的抓取量有没有下降?如果明顯下降,說明分頁一直在承担發現入口的角色,需要补上別的路径。
這些問题没有统一答案,取决于你把分頁当成路径還是当成頁面。先定下這一点,後面的處理方式基本也就定下来了。