过时页面不会自己喊停
蜘蛛按计划来抓,你按计划更新,两边看起来都在动。问题在于很多页面从发布那天起就没再动过:价格改了三轮它还是老数字,产品换代了它还写着上一代型号,政策更新了它还在引用旧条文。蜘蛛依然会定时抓,因为链接还在、状态码还是 200,只是抓回去的内容一年比一年没用。
这不算致命错误,但它会慢慢挤压抓取效率。如果一批低价值、明显过期的页面持续被反复抓取,新页面或者真正需要及时入库的内容就少了一份被照顾的机会。自查的目的不是把老页面一刀切删掉,而是让每个还挂着的 URL 都有一个明确去向。
先圈出可疑页面
不需要全站通读,可以从几个信号入手:
- 正文里出现具体年份、版本号、价格、活动截止日期,而这些信息明显属于过去;
- 同一个主题,站内已经有一篇更新的文章,但两篇都在线,彼此内容重叠;
- 页面有大量内链指向,正文却已经空泛,只剩开头一段介绍;
- 抓取日志里这些 URL 被频繁访问,但对应页面的实际访问长期为零;
- 留言区里已经全是“这个还准吗”之类的疑问。
三种去向,先定规则再动手
能更新就更新
内容主体仍然成立、只是细节过时的页面,最省事的做法是就地更新:换掉旧数字,补上新的变化,在文末注明更新时间。如果改动幅度比较大,可以在正文开头用一小段说明“本文已根据近期情况修订”,让回头再看的用户知道自己读的是新版本。更新完,把页面的时间标记和站点地图里的时间字段一并同步,别只改正文。
主题重复就合并
两篇同类文章分散在两三个 URL 上,各自都不够完整,这是很常见的情况。与其两边都小修小补,不如挑内容最扎实的一篇作为主页面,把另一篇里有用的段落并进来,另一篇做 301 指向主页面。合并时注意别把两篇的关键信息都丢掉,也不要简单粗暴地整段删除。
没有保留价值就下线
临时活动页、已停售的商品页、已经失效的公告,如果对用户没有任何延续价值,可以考虑下线。让它们返回 410 比返回一个空壳 200 更清楚;如果这些 URL 还有外部链接指向,或者属于某个栏目结构中的一环,用 301 指到相近的上级页或替代页更合适。关键是不要让它们继续以正常页面的身份留在站点地图里。
把更新当成例行工作
一次性清理解决不了长期问题,比较实际的做法是建一份简单的台账:记录页面 URL、主题、上次更新时间、责任人、下次该检查的时间。比如价格类页面按月看,教程类按季度看,政策相关的内容跟着外部变动走。台账不必复杂,一张表格就够,重要的是有人认领、有固定周期。
日常更新完之后,顺手做几件事:检查站内链接有没有还指向已经被合并或下线的旧页面;确认站点地图里对应的 URL 和状态已经同步;如果是重点页面,观察抓取日志中它的访问频率有没有变化。这几步花不了多少时间,却能让蜘蛛每次来都有新东西可拿。
内容时效自查的核心不是“删掉旧页面”,而是给每个仍然存在的 URL 一个明确交代:它还在,而且它的内容值得被抓。