站点运营

站点运营:列表分頁自查,別让翻頁連結断在半路

列表頁常是站内流量最大的入口,但翻頁往往最容易被忽略:連結寫在 JS 里、參數被 robots 屏蔽、第一頁有多個地址、第 N 頁标题千篇一律。本文梳理分頁常见的几個坑,给出一份可以直接照着做的自查清單,帮蜘蛛顺利走到後面的内容。

站点运营

站点运营:列表分頁自查,別让翻頁連結断在半路

列表頁是很多站点流量最大的入口:新闻列表、商品分類、标簽聚合、作者頁,都靠翻頁来承接更多内容。但翻頁也常常是最容易被忽略的地方——編輯只管發文章,模板只在第一頁加連結,蜘蛛爬到某一頁之後就找不到繼續往下走的入口了。下面梳理列表分頁常见的几個坑,以及可以马上做的自查動作。

一、翻頁連結是不是真的可点、可爬

先別急着看代碼,用最土的办法驗證:打開頁面,關掉 JavaScript,或者用開發者工具查看渲染前的 HTML 源碼,看看“下一頁”的連結是不是本来就在里面。

  • 分頁按钮如果是用 onclick 事件或前端路由實現的,源碼里可能根本没有可跟随的地址,蜘蛛拿不到下一頁的入口。
  • 有些模板把“下一頁”寫成表單提交,這類請求無法被正常抓取。
  • 翻到最後一頁时按钮變灰,本身没問题,但要注意別把整块導航一起删掉,導致前面的頁也失去出口。

二、分頁 URL 的几種寫法

路径式:/news/page/2/

這種寫法层級清晰,用戶和蜘蛛都比較容易理解。注意两点:一是第一頁不要同时存在 /news/ 和 /news/page/1/ 两個版本;二是明确哪一個才是規范地址,避免同一個列表出現多個入口。

參數式:/news?page=2

參數式實現简單,但容易被誤伤。检查一下 robots.txt 里有没有把带 page 參數的地址整段屏蔽,那等于亲手砍掉所有翻頁。另外,如果站内搜尋也用同名的參數,两者混在一起會让統計和排查都變麻烦。

三、列表頁的重复内容

同一個列表翻到第三頁时,标题、描述、H1 往往還是“最新文章 - 第 3 頁”,内容结构也和第一頁高度相似。數量一大,整站的頁面质量就被稀释了。

  • 给每頁标题加上頁碼,让它有基本区分度。
  • 描述里带上该頁特有的信息,比如本頁第一篇的标题或所在栏目。
  • 如果列表頁本身不打算被收錄,用 meta robots 的 noindex,follow,保留連結通路即可;不要直接屏蔽抓取,那會连带切断後續内容的發現路径。

四、無限滚動和“加载更多”

無限滚動對用戶友好,對蜘蛛不太友好——不滚動就不加载。常见的折中做法是保留一條纯連結的分頁路径。

  • 首屏之後提供“下一頁”的真實連結,哪怕大多數用戶不會去点。
  • 或者提供“查看全部”頁面,但要先评估這個頁面會不會太長、太慢。
  • “加载更多”按钮最好同时是一個可訪問的連結,至少保證有一份地址能被追踪到。

五、分頁和内鏈、站点地图的關系

有些站点把翻頁放在脚本里,站点地图里又只提交了第一頁,结果第二頁之後的内容只能靠外鏈和随机抓取慢慢被發現。可以從這几個地方入手:

  1. 把分頁連結做成普通連結,放在列表底部,不要藏在浮层或折叠面板里。
  2. 确保每一頁都能從上一頁的“下一頁”一路点到,而不是只能從第一頁跳轉到任意頁。
  3. 站点地图不必把所有分頁都塞進去,但重点栏目的前几頁可以酌情提交。
  4. 詳情頁之間做相關推荐,让内容即使不经過列表也能被横向走到。

六、一份简單的自查清單

  1. 關掉 JavaScript,看翻頁連結是否出現在源碼中。
  2. 点開第 2 頁、中間某頁、最後一頁,確認返回 200,而不是 404 或一直轉圈。
  3. 检查 robots.txt 有没有誤屏蔽分頁路径或 page 參數。
  4. 確認列表首頁只有一個地址版本,没有重复入口。
  5. 抽查几個列表頁的标题和描述,看是否千篇一律。
  6. 翻抓取日誌,看蜘蛛訪問分頁的比例;如果長期只有第一頁,說明鏈路大概率断了。
分頁不是纯技術细节,而是内容的最後一公里。翻頁走不通,後面再好的内容也只能躺在資料库里。