列表頁是很多站点流量最大的入口:新闻列表、商品分類、标簽聚合、作者頁,都靠翻頁来承接更多内容。但翻頁也常常是最容易被忽略的地方——編輯只管發文章,模板只在第一頁加連結,蜘蛛爬到某一頁之後就找不到繼續往下走的入口了。下面梳理列表分頁常见的几個坑,以及可以马上做的自查動作。
一、翻頁連結是不是真的可点、可爬
先別急着看代碼,用最土的办法驗證:打開頁面,關掉 JavaScript,或者用開發者工具查看渲染前的 HTML 源碼,看看“下一頁”的連結是不是本来就在里面。
- 分頁按钮如果是用 onclick 事件或前端路由實現的,源碼里可能根本没有可跟随的地址,蜘蛛拿不到下一頁的入口。
- 有些模板把“下一頁”寫成表單提交,這類請求無法被正常抓取。
- 翻到最後一頁时按钮變灰,本身没問题,但要注意別把整块導航一起删掉,導致前面的頁也失去出口。
二、分頁 URL 的几種寫法
路径式:/news/page/2/
這種寫法层級清晰,用戶和蜘蛛都比較容易理解。注意两点:一是第一頁不要同时存在 /news/ 和 /news/page/1/ 两個版本;二是明确哪一個才是規范地址,避免同一個列表出現多個入口。
參數式:/news?page=2
參數式實現简單,但容易被誤伤。检查一下 robots.txt 里有没有把带 page 參數的地址整段屏蔽,那等于亲手砍掉所有翻頁。另外,如果站内搜尋也用同名的參數,两者混在一起會让統計和排查都變麻烦。
三、列表頁的重复内容
同一個列表翻到第三頁时,标题、描述、H1 往往還是“最新文章 - 第 3 頁”,内容结构也和第一頁高度相似。數量一大,整站的頁面质量就被稀释了。
- 给每頁标题加上頁碼,让它有基本区分度。
- 描述里带上该頁特有的信息,比如本頁第一篇的标题或所在栏目。
- 如果列表頁本身不打算被收錄,用 meta robots 的 noindex,follow,保留連結通路即可;不要直接屏蔽抓取,那會连带切断後續内容的發現路径。
四、無限滚動和“加载更多”
無限滚動對用戶友好,對蜘蛛不太友好——不滚動就不加载。常见的折中做法是保留一條纯連結的分頁路径。
- 首屏之後提供“下一頁”的真實連結,哪怕大多數用戶不會去点。
- 或者提供“查看全部”頁面,但要先评估這個頁面會不會太長、太慢。
- “加载更多”按钮最好同时是一個可訪問的連結,至少保證有一份地址能被追踪到。
五、分頁和内鏈、站点地图的關系
有些站点把翻頁放在脚本里,站点地图里又只提交了第一頁,结果第二頁之後的内容只能靠外鏈和随机抓取慢慢被發現。可以從這几個地方入手:
- 把分頁連結做成普通連結,放在列表底部,不要藏在浮层或折叠面板里。
- 确保每一頁都能從上一頁的“下一頁”一路点到,而不是只能從第一頁跳轉到任意頁。
- 站点地图不必把所有分頁都塞進去,但重点栏目的前几頁可以酌情提交。
- 詳情頁之間做相關推荐,让内容即使不经過列表也能被横向走到。
六、一份简單的自查清單
- 關掉 JavaScript,看翻頁連結是否出現在源碼中。
- 点開第 2 頁、中間某頁、最後一頁,確認返回 200,而不是 404 或一直轉圈。
- 检查 robots.txt 有没有誤屏蔽分頁路径或 page 參數。
- 確認列表首頁只有一個地址版本,没有重复入口。
- 抽查几個列表頁的标题和描述,看是否千篇一律。
- 翻抓取日誌,看蜘蛛訪問分頁的比例;如果長期只有第一頁,說明鏈路大概率断了。
分頁不是纯技術细节,而是内容的最後一公里。翻頁走不通,後面再好的内容也只能躺在資料库里。