做内容站的人常會盯着收錄數看,然後發現一個現象:首頁、栏目頁、文章頁都進了索引,唯獨 /page/2/、/page/3/ 這類分頁几乎查不到。有人因此去改連結、調參數,甚至怀疑是不是站点出了問题。多數情况下這不是異常,而是分頁在抓取和收錄這件事上本来就排在後面。
分頁首先是一條路径
分頁有两個身份:它是一條通往深层内容的連結路径,也是一個獨立頁面。對站点来说,前一個身份更重要。
搜尋引擎沿着第一頁上的連結繼續往下走,才能發現那些没被内鏈直接指向的老文章。所以分頁能不能被抓到,比它自己能不能被收錄影响更大。
反過来看,一個分頁的正文往往只是列表項的重复排列,本身没有額外信息。当站点 URL 數量很大时,抓取會優先给到内容頁、栏目頁,分頁被排在後面属于正常分配,不必過分解讀。
三種常见的分頁寫法
- 參數式:/list?page=2,寫法简單,但容易和篩選、排序參數叠加,产生大量近似 URL
- 路径式:/list/page/2/,在日誌里看起来清楚,层級關系也直观
- 混合式:分頁參數和视图、排序參數混在一起,比如 /list?p=2&sort=price&view=grid
如果你的分頁带了排序、视图這類可選參數,最好让這些參數不要生成新連結,或者让带參數的分頁 canonical 到不带參數的分頁版本。否則同一頁列表會出現十几種 URL,抓取和收錄都會被稀释。
哪些分頁值得被收錄
- 頁面上除了标题和列表,還有一段說明文字,能獨立回答某個浏览需求的
- 作為专题或榜單的浏览入口,用戶确實會一頁頁往下翻的
- 内容量很大,第一頁完全覆盖不到深层條目的列表頁
如果分頁只是導航,通常不必强求收錄。让它保持可抓取、能正常传递連結關系,已经完成了主要任務。
哪些分頁不必花力气
- 纯導航式分頁,頁面上除了重复的标题和列表没有任何說明
- 與第一頁高度相似的列表,只是條目顺序換了一下
- 由排序參數批量生成的分頁,如按價格、按時間、按热度排列的各種组合
判断标准可以简化成一句话:這個分頁被單獨搜到时,用戶能不能得到列表之外的一点東西。
無限滚動和加载更多要留退路
用脚本做無限滚動很常见,但如果没有可抓取的連結入口,深层内容就會變成孤岛,只能靠 sitemap 和站内其他入口去补。可行的做法是:頁面底部保留一套普通的分頁連結,视觉上可以低調處理,但要保證是真實的 a 标簽,能被正常跟随。
另一個容易踩的坑是把分頁序列互相 canonical 到第一頁。分頁之間的内容並不相同,這么做等于告诉搜尋引擎只保留第一頁,深层條目反而可能失去發現路径。分頁用自引用 canonical 就够了。
自查顺序
- 抓一份日誌,看爬虫是否訪問到第 2、3 頁,訪問频率大概是多少
- 用網址检查工具看某個深层分頁是否被抓取、是否進了索引
- 確認分頁連結是真實的 a 标簽,而不是绑定在 JS 事件上的假連結
- 检查分頁没有被 robots.txt 屏蔽,也没有被全站 noindex 規則誤伤
- 看深层文章是否還有別的入口,比如标簽頁、相關推荐、sitemap
分頁收錄不理想,通常不說明站点有問题。真正需要留意的是抓取路径被堵住——那往往是後面一连串收錄問题的起点。