网站收录

sitemap 里混着重定向和 404:收录核对先把这份清单洗干净

sitemap 是从后台一键生成的,很容易混进重定向地址、已下线页面、noindex 页面和参数页。这份清单不是收录开关,但会影响核对判断。文章给出逐类清洗的方法:按状态码筛、对齐地址写法、按类型拆分文件,并说明清单清理要和站内链接检查一起做才算收口。

网站收录

sitemap 里混着重定向和 404:收录核对先把这份清单洗干净

很多站点的 sitemap 是从后台一键生成的,生成逻辑往往是「所有发布状态的内容都放进去」。时间一长,这份清单里就会混进重定向地址、已经下线的页面、被 noindex 标记的页面,甚至一堆带参数的筛选页。它本身不会直接让收录变差,但会让核对工作变难:拿一份不干净的地图去找路,很容易被带偏。

先明确 sitemap 的角色

sitemap 的作用是告诉搜索引擎「这些地址存在,可以来看看」,它是一个发现入口,不是收录开关,也不是质量背书。放进去不等于会被抓取,被抓取也不等于会被索引。所以清单的第一原则是:只放你希望被人直接打开、并且内容独立完整的页面地址。

逐类清掉不该出现的地址

会跳转的地址

如果某个地址 301 到另一个地址,sitemap 里应该写最终落地的那一个。留着跳转地址会多消耗一次抓取,也容易让索引里出现两条指向同一内容的记录。

返回 404 或 410 的地址

内容下架、商品删除之后,地址往往还留在清单里。用抓取工具批量跑一遍状态码,把非 200 的挑出来。注意区分 404 和 5xx:5xx 可能是服务器临时问题,不要急着删,先复查一次。

带 noindex 的页面

这类页面最容易被忽略:地址能打开、返回 200,但页面头部明确写了不索引。既然不希望它进索引,就没有必要继续在 sitemap 里提交,两边信号相互矛盾,核对时也容易算错分母。

筛选、排序、分页参数产生的地址

参数组合可以生成远超实际内容量的地址。先给参数分个类:影响内容的参数(如分类、页码)可以保留一部分;纯粹用于排序、追踪、会话的参数,通常不需要进 sitemap。

需要登录、地区限制或本身就是接口的地址

抓取端拿不到内容,提交上去只会浪费额度,也容易在日志里制造无意义的错误记录,干扰后续排查。

地址写法要和站内实际链接一致

  • 大小写:站内链接用小写,sitemap 里就不要写成大写。
  • 协议与域名:统一成一种写法,不要 http 与 https、带 www 与不带 www 混着写。
  • 结尾斜杠:目录形式和文件形式的写法分开,别让同一个页面两种形态都出现。

这些看起来是小事,但核对时同一个页面出现两条记录,统计数字就对不上,判断也会跟着错。

按类型拆分成多份,方便定位问题

把 sitemap 拆成内容页、分类页、专题页等几份,每份控制在合理数量。好处是出问题时能快速缩小范围——是某一份整体表现差,还是零散几个地址的问题。再保留一份索引文件把这些子文件串起来即可。

核对后的处理方式

  1. 把清单导出成表格,加上状态码、是否可索引、最后修改时间几列。
  2. 重定向地址替换成最终地址,其余非 200 的地址直接移除。
  3. noindex 页面移除,并确认指向这批页面的站内链接入口是否也要调整。
  4. 重新提交后,隔一段时间看抓取日志里这些地址的出现频率,确认旧地址没有继续被大量请求。
清理 sitemap 不会立刻带来收录变化,它的价值在于让判断有据可依:清单干净了,收录数字的波动才更容易归因到内容或结构上,而不是被一堆无效地址干扰。

一个容易被忽略的循环

如果站内链接还在指向那些已经重定向或下线的地址,sitemap 清理完了,抓取端依然能从页面里爬到它们。所以清单核对最好和站内链接检查一起做,两边保持一致,才算真正收口。