站点运营到一定阶段,总会有页面需要下线:过期活动、合并后的旧栏目、改过结构的商品详情。这些页面处理方式不同,搜索引擎收到的信号也不同。方法选错,轻则旧地址长期留在索引里占位,重则牵连同目录下正常页面的抓取与收录。
先判断页面属于哪种下线
动手之前,先把要下线的页面归一下类,因为处理方式是由下线性质决定的,而不是由「我想让它消失」决定的。
- 内容作废,但有更合适的替代页:例如两条旧公告合并成一条新公告。这种情况用 301 指向替代页,把已有的权重和入口价值带过去。
- 内容彻底不再提供,并且没有替代:例如永久停止的报名页、已停售且不会回归的商品页。用 410 明确告知更干脆,404 也可以,语义上弱一些。
- 暂时隐藏,之后还会恢复:例如季节性活动页。保留 URL 比删掉再恢复更省事,恢复后也不用重新积累。
- 页面本身还要给用户访问,只是不想让它进搜索结果:例如仅供内部或特定人群访问的说明页,用 noindex,而不是屏蔽抓取。
几种处理方式的信号差异
先理解这几种方式在搜索引擎眼里分别意味着什么,再选,比事后返工要快得多。
- 301:告诉搜索引擎这个地址已经永久换到了新地址,是内容迁移的首选。但跳转目标必须内容相关,全部跳到首页会被当成软 404 处理。
- 410:明确表示资源已永久移除。相比 404 更肯定,适合确定不再提供的内容。
- 404:表示找不到,可能是临时也可能是永久,语义模糊。用它下线也可以,但不如 410 清晰。
- noindex:让页面继续可访问、可抓取,但不进入索引。它只对能被抓取到的页面生效,且需要时间生效。
- robots.txt 屏蔽:阻止抓取,不负责移除索引。已经收录的地址不会因为屏蔽就自动消失。
用 robots.txt 屏蔽一个已经收录的页面,搜索引擎读不到页面上的 noindex,也确认不了页面是否还在,旧索引条目往往比直接返回 410 停留得更久。
按顺序核对的清单
处理下线页面时,建议按下面的顺序走一遍,能避开大部分反复。
- 确认有没有最贴近的替代页。有,就走 301;没有,再考虑 410 或 404。
- 确认下线是不是临时的。如果是,先保留 URL,必要时加 noindex,不要先删再恢复。
- 检查是否要移除索引。需要移除时,让页面返回 410 或 404,或返回 200 但带 noindex,不要用 robots.txt 替代。
- 清理站内入口。导航、侧栏、相关推荐、面包屑、分页、站内搜索结果页里的链接都要一并撤掉,避免内链指向死链。
- 更新站点地图。站点地图里还留着已下线的 URL,等于持续把蜘蛛引向一个不存在的地址。
- 处理已有外链较多的旧地址。外链不受你控制,这类地址优先用 301,而不是直接 404。
- 核对多端与多入口。移动端、PC 端、带参数版本、测试域名下的同一页面,都要按同样方式处理。
- 观察一段时间的索引状态。用站点查询、索引报告和服务器日志交叉看,确认旧地址条目在减少、新地址承接正常。
容易踩的几个坑
- 页面直接删掉返回 404,站点地图和内链却原封不动。既影响用户,也让蜘蛛反复撞空。
- 批量 301 全部指向首页。这种「什么都跳首页」的做法通常不会被当作正常迁移。
- 为了快速下架,先用 robots.txt 屏蔽,过一阵才想起来要移除索引,白等一段时间。
- 批量加 noindex 后忘记撤掉,后续内容恢复更新却一直不进索引。
- 只处理了 PC 端 URL,移动端地址仍在提供内容,形成新的重复入口。
收尾与复查
下线本身是一次性动作,但索引状态的更新需要时间,且不同页面快慢不一。建议按批次处理,记录每个 URL 的处理日期、处理方式和跳转目标,之后隔几周复查一次,而不是每天反复调整。复查时重点看三件事:旧地址是否仍能通过站内链路被访问到、站点地图是否已同步、索引里是否还残留着指向旧地址的条目。把这三项对上,页面下线这件事基本就算收尾了。