很多站点在做 URL 發現时,把注意力放在首頁和内鏈结构上,却忽略了列表頁和分頁。對大多數内容站来说,蜘蛛發現新 URL 的主要入口恰恰是這些一頁一頁翻過去的列表。列表頁翻得够深,深處的地址才有机會進入抓取队列。
列表頁是蜘蛛最省力的路标
蜘蛛進入首頁後,會顺着連結一层层往下走。栏目頁、标簽頁、文章列表頁通常包含大量指向詳情頁的連結,是它最省力的一條發現路径。相比让它從首頁逐級点進去,一個结构清晰的列表頁能一次暴露几十條 URL。
所以列表頁的問题一般不是“有没有連結”,而是“連結能不能被顺利走到”。如果列表只展示前几條,剩下的要靠点击、滚動或接口請求才出現,蜘蛛拿到的 HTML 里就缺少這些地址。
几種常见翻頁寫法的差別
數字分頁
传统的 ?page=2 這類連結最直接,只要每頁都有指向下一頁和頁碼的 a 标簽,蜘蛛就能逐頁往後翻。分頁連結不要只保留“下一頁”,中間頁碼也留一些,方便它跳到靠後的頁面。
“加载更多”按钮
如果按钮背後是真的 a 标簽,只是点击後追加内容,蜘蛛仍能顺着 href 抓到後續頁;如果按钮只是 JS 事件、地址栏變化由脚本控制,就需要检查渲染後的 HTML 里有没有可抓的連結。
無限滚動
無限滚動對用戶友好,對蜘蛛不太友好。滚動本身不产生新的可抓地址,通常需要額外提供分頁入口或獨立的列表頁,让深處的内空有一個可直達的 URL。
翻頁太深,老内容容易沉底
一個栏目如果有一千篇内容、每頁十條,最後一頁就在一百頁之後。蜘蛛未必會把每一頁都翻到底,靠後的 URL 被發現的概率自然下降。這不是惩罚,只是路径太長、收益递减。
- 把列表做成有层級的结构,例如按時間归档、按分類细分,让舊内容有更短的入口。
- 给重要的舊内容留一些固定推荐位或专题頁,避免只能靠翻頁找到。
- 检查分頁連結是否被 robots 或 noindex 影响,確認這些頁是否允许被抓取。
让 URL 更容易被發現的几個习惯
- 列表頁保持静態可抓的 HTML 連結,不要全部依赖脚本渲染。
- 分頁地址稳定、可预测,避免每次生成一串随机參數。
- 詳情頁之間保留相關推荐或上下篇,给蜘蛛多一條進入路径。
- Sitemap 作為补充,把不容易從列表頁走到的 URL 單獨列出。
- 观察抓取日誌里列表頁和分頁的訪問情况,確認它确實在往後翻。
列表頁和分頁不是辅助頁面,對很多站点来说它們就是 URL 發現的主干道。主干道堵住了,深處的地址再優质也很难被看到。
最後可以简單自测:随便挑一個較老的詳情頁,看看從首頁出發需要经過几次跳轉才能到它。如果路径要穿過好几层列表頁、翻很多頁才出現,那它被發現的节奏大概率就偏慢。調整列表结构、补上归档入口或者用 Sitemap 兜底,往往比反复提交 URL 更有效。