列表頁翻頁几乎每個站都有:文章列表、商品列表、搜尋结果都會产生第 2 頁、第 3 頁。這些地址要不要让搜尋引擎收錄,没有统一答案,關键看它們對用戶和搜尋引擎各自意味着什么。
先看分頁地址是怎么生成的
常见的分頁 URL 有三種形態,處理方式並不一样。
- 路径式:形如 /list/page/2/,层級清晰,蜘蛛容易识別。
- 參數式:形如 /list?page=2,容易和其他參數混在一起,也更容易出現重复入口。
- 点击追加:頁面不換 URL,靠脚本往下加载内容,這種情况下並不存在真正的第 2 頁地址。
分頁有没有獨立價值,先問一個問题
可以用一句话做判断:這個分頁地址上,有没有用戶會主動搜尋的獨立内容?
- 商品、文章的深分頁,條目本身在詳情頁各有地址,分頁只承担導航作用,通常没有獨立搜尋需求。
- 分類下只有两三頁,且第 2 頁包含明顯的品類组合,内容也确實不同,保留在索引里一般没有坏處。
- 篩選、排序、站内搜尋产生的分頁,參數组合多到無法收敛,通常不建议收錄。
让分頁進索引时要注意什么
保留分頁收錄,前提是它真的能被抓、能被正常渲染。翻頁連結要是普通的可点击連結,而不是依赖点击事件才生成;頁面上的條目要能通過連結到達各自的詳情頁,這样蜘蛛顺着分頁往下走,才有机會發現更靠後的内容。同时確認分頁之間没有互相指向第一頁的 canonical,否則收錄的意义會被自己消掉。
不让分頁進索引时的几個坑
- 用 robots.txt 屏蔽:蜘蛛抓不到分頁,也就無法顺着它發現後面的詳情頁,深頁面的發現速度可能變慢。
- 用 noindex:蜘蛛仍需抓取才能看到指令,抓取開销照付,但能避免頁面進入索引。
- 把分頁 canonical 指向第一頁:如果分頁确實没有獨立價值,這是可以接受的做法;如果它本身有内容價值,這么做等于主動放弃收錄。
canonical 和 noindex 同时出現在分頁上时,信号容易互相打架。選定一種主要手段,其它設定尽量保持简單。
可以观察的几個信号
分頁處理完不必立刻下结论。可以在搜尋表現里看分頁地址有没有带来過点击;在抓取记錄里看蜘蛛訪問分頁的频率,以及它是停在分頁還是繼續走到詳情頁;做收錄對帳时,看索引中的分頁數量和线上實际分頁數量差多少。這些資料比“應该收還是不收”的直觉更可靠。
一份简短的自检清單
- 分頁地址是否稳定、可预测,翻頁連結是否能被直接抓取。
- 分頁上的條目是否都有獨立詳情頁地址,連結是否可達。
- 分頁與第一頁之間是否出現了互相矛盾的規范與索引指令。
- 如果不让收錄,選擇的手段會不會连累詳情頁的發現。
- 處理之後留出時間观察抓取和索引记錄的變化,再决定是否調整。
分頁本身不是問题,問题往往是分頁上的指令前後不一致,或者用屏蔽的方式挡住了自己需要的發現路径。先把這两点理顺,收不收錄通常會變得容易判断。