新页面有人盯着,老页面往往没人管。很多内容在上线几个月后就再没被蜘蛛抓过,站长直到发现流量下滑才回头查。蜘蛛不会因为页面还挂在服务器上就定期回访,它要不要再来,取决于这个 URL 在它眼里还有没有价值、路径还通不通。
一、蜘蛛不再来的几种常见原因
- 页面长期没变化。抓取预算有限,同一个地址反复取回同样的内容,蜘蛛会降低回访频率。
- 内链路径断了。改版、栏目调整、内容下架之后,指向老页面的链接被删,它变成了孤儿页面,只能靠 Sitemap 或外链偶尔被发现。
- Sitemap 里只剩一条记录。如果 lastmod 从上线起就没动过,蜘蛛对这份清单的信任会下降,回访缺少触发点。
- 服务器响应不稳定。这片路径经常超时或者返回 5xx,蜘蛛会整体降低对这个目录的抓取节奏。
- 页面本身没有需求。没有搜索、没有外链、没有点击,抓回来也难产生价值。
二、先判断哪些老页面值得叫回来
不是所有老页面都值得花力气。可以优先看这几类:
- 还有搜索需求、只是排名下滑的页面;
- 有外部链接指向,但站内几乎没人链过去的页面;
- 历史上产生过咨询、下单、注册等转化的页面;
- 被其他页面长期引用、需要持续维护的文档页。
判断依据可以先翻服务器日志,看这个 URL 最后一次被抓是什么时候,再看这段时间页面有没有实质变化。如果一年没抓、内容也没动过,要先想清楚为什么要让它回来。
三、让它重新进入抓取范围的几个动作
1. 做真正的内容更新
改个日期、换张配图、加一句无关的话,都不算更新。补数据、改结论、加新的说明,让主体内容明显变化,蜘蛛再次抓取时才看得出差异。
2. 从近期被抓的页面加上内链
内链是最可靠的发现通道。找几个最近有抓取记录的页面,在相关段落里加一条指向老页面的正文链接,而不是塞进页脚。链接位置越自然越好,但别为了叫蜘蛛而在无关页面堆链接。
3. 核对 Sitemap、状态码与 canonical
老页面常在几次改版后留下一堆问题:Sitemap 里还写着旧地址、页面 301 到了别处、canonical 指向一个已经不存在的 URL。先把这些清理干净,再考虑怎么让蜘蛛回来。
- 确认该 URL 返回 200,且不是软 404;
- 确认 robots.txt 没有拦住这个目录;
- 确认 canonical 指向自身;
- 确认 Sitemap 里的地址与线上地址一致。
4. 更新 Sitemap 时别撒谎
只有内容真的改了,才去动 lastmod。长期虚报更新时间,蜘蛛会逐渐忽略这个字段,之后真的更新也换不回一次抓取。
5. 借助站外渠道
被其他站点引用、在行业社区被讨论、有合作方链接,都会让蜘蛛重新看到这个地址。外部入口和内链配合,通常比单独提交一次地址更持久。
四、服务器这边的配合
就算页面被重新发现,服务器不给力也白搭。抓取期间保持响应时间稳定、把 5xx 压到很低,别在蜘蛛来访时做全站维护,否则一次失败就可能让抓取节奏退回原点。如果必须停机,用 503 加 Retry-After 比直接断开更友好。
五、不建议做的事
- 为了让蜘蛛来,每天改一遍 lastmod;
- 重复提交同一个 URL,或用工具批量推送;
- 把老页面重定向到首页应付了事;
- 用空页面或占位页返回 200。
老页面的回访,本质上还是那几件事:路径通、内容有变化、服务器稳定、这个地址对用户还有价值。急不来,但方向对了,节奏会慢慢回来。