搜尋抓取

老頁面很久没被抓:怎么让它重新回到蜘蛛的抓取范围

蜘蛛不會因為頁面還挂在服務器上就定期回訪。老頁面長期没被抓,往往和内容長期無變化、内鏈路径断開、Sitemap 更新無效、服務器响應不稳有關。本文讲怎么判断哪些老頁面值得叫回来,以及用内容更新、内鏈、Sitemap 和服務器配合,让這些 URL 重新進入抓取范围的思路。

搜尋抓取

老頁面很久没被抓:怎么让它重新回到蜘蛛的抓取范围

新頁面有人盯着,老頁面往往没人管。很多内容在上线几個月後就再没被蜘蛛抓過,站長直到發現流量下滑才回头查。蜘蛛不會因為頁面還挂在服務器上就定期回訪,它要不要再来,取决于這個 URL 在它眼里還有没有價值、路径還通不通。

一、蜘蛛不再来的几種常见原因

  • 頁面長期没變化。抓取预算有限,同一個地址反复取回同样的内容,蜘蛛會降低回訪频率。
  • 内鏈路径断了。改版、栏目調整、内容下架之後,指向老頁面的連結被删,它變成了孤儿頁面,只能靠 Sitemap 或外鏈偶尔被發現。
  • Sitemap 里只剩一條记錄。如果 lastmod 從上线起就没動過,蜘蛛對這份清單的信任會下降,回訪缺少触發点。
  • 服務器响應不稳定。這片路径经常超时或者返回 5xx,蜘蛛會整体降低對這個目錄的抓取节奏。
  • 頁面本身没有需求。没有搜尋、没有外鏈、没有点击,抓回来也难产生價值。

二、先判断哪些老頁面值得叫回来

不是所有老頁面都值得花力气。可以優先看這几類:

  1. 還有搜尋需求、只是排名下滑的頁面;
  2. 有外部連結指向,但站内几乎没人鏈過去的頁面;
  3. 歷史上产生過咨询、下單、註冊等轉化的頁面;
  4. 被其他頁面長期引用、需要持續维護的文档頁。

判断依據可以先翻服務器日誌,看這個 URL 最後一次被抓是什么时候,再看這段時間頁面有没有實质變化。如果一年没抓、内容也没動過,要先想清楚為什么要让它回来。

三、让它重新進入抓取范围的几個動作

1. 做真正的内容更新

改個日期、換張配图、加一句無關的话,都不算更新。补資料、改结论、加新的說明,让主体内容明顯變化,蜘蛛再次抓取时才看得出差异。

2. 從近期被抓的頁面加上内鏈

内鏈是最可靠的發現通道。找几個最近有抓取记錄的頁面,在相關段落里加一條指向老頁面的正文連結,而不是塞進頁脚。連結位置越自然越好,但別為了叫蜘蛛而在無關頁面堆連結。

3. 核對 Sitemap、狀態碼與 canonical

老頁面常在几次改版後留下一堆問题:Sitemap 里還寫着舊地址、頁面 301 到了別處、canonical 指向一個已经不存在的 URL。先把這些清理干净,再考虑怎么让蜘蛛回来。

  • 確認该 URL 返回 200,且不是软 404;
  • 確認 robots.txt 没有拦住這個目錄;
  • 確認 canonical 指向自身;
  • 確認 Sitemap 里的地址與线上地址一致。

4. 更新 Sitemap 时別撒谎

只有内容真的改了,才去動 lastmod。長期虚报更新時間,蜘蛛會逐渐忽略這個字段,之後真的更新也換不回一次抓取。

5. 借助站外渠道

被其他站点引用、在行业社区被讨论、有合作方連結,都會让蜘蛛重新看到這個地址。外部入口和内鏈配合,通常比單獨提交一次地址更持久。

四、服務器這邊的配合

就算頁面被重新發現,服務器不给力也白搭。抓取期間保持响應時間稳定、把 5xx 压到很低,別在蜘蛛来訪时做全站维護,否則一次失敗就可能让抓取节奏退回原点。如果必须停机,用 503 加 Retry-After 比直接断開更友好。

五、不建议做的事

  • 為了让蜘蛛来,每天改一遍 lastmod;
  • 重复提交同一個 URL,或用工具批量推送;
  • 把老頁面重定向到首頁應付了事;
  • 用空頁面或占位頁返回 200。
老頁面的回訪,本质上還是那几件事:路径通、内容有變化、服務器稳定、這個地址對用戶還有價值。急不来,但方向對了,节奏會慢慢回来。