搜索抓取

Sitemap 与内链的分工:两条 URL 发现路径怎样配合

蜘蛛发现 URL 主要靠内链和 Sitemap 两条路径,两者作用不同,配合不好会拆分抓取。本文说明各自擅长什么、地址不一致时的常见问题,以及一份可执行的配合做法与定期核对清单。

搜索抓取

Sitemap 与内链的分工:两条 URL 发现路径怎样配合

蜘蛛发现一个新 URL,通常只有两条路:顺着页面上的链接爬过去,或者读站点提供的 Sitemap。很多人把两者当成二选一,其实它们承担的是不同工作,配合不好时反而会互相拖累。

两条路径各自擅长什么

内链反映的是站点结构和重要性排序。蜘蛛从一个链接进入页面,同时也在读取这个页面被谁指向、处在什么位置。新页面发布后,只要在相关栏目或文章里加一条链接,被发现的速度往往比等 Sitemap 更快。

Sitemap擅长的是批量和结构化。它能在不增加页面链接的前提下,把成百上千个 URL 一次交出去,还能附上最后修改时间,帮助蜘蛛判断哪些内容值得重抓。但它只是一份候选清单,不代表蜘蛛必须去抓。

Sitemap 告诉蜘蛛“这里可能有内容”,内链告诉蜘蛛“这里值得优先看”。两者缺一个,URL 发现都会变慢。

两条路打架时的三种常见情况

Sitemap 里有,内链里没有

这类 URL 往往就是孤岛页面。蜘蛛可能通过 Sitemap 抓到一次,但因为没有任何内链指向,后续重抓和权重传递都很弱。如果某个页面长期只有 Sitemap 一条入口,比较稳妥的做法是从相关栏目、上下篇或专题页补一条链接过去。

内链里有,Sitemap 里没有

通常不算问题。只要页面能被正常爬到,Sitemap 缺一条不影响发现,只是少了最后修改时间这个辅助信号。真正需要担心的是反过来,把 Sitemap 当成唯一入口。

同一个页面,两边地址不一样

带追踪参数、大小写不一致、结尾斜杠不同、http 与 https 混用,都会让 Sitemap 和内链指向两个地址,抓取被拆成两份。检查时把 Sitemap 中的 URL 和页面里的实际链接做一次对照,差异列表通常不会太长,但值得清理。

一份务实的配合做法

  1. 新页面发布时,先在站内加至少一条从相关栏目指向它的链接,位置尽量靠近正文或列表主体,而不是只放在页脚。
  2. Sitemap 只保留返回 200、canonical 指向自身的 URL,重定向、参数页、已下线页面及时移除。
  3. 内容有实质更新时同步修改最后修改时间,不要每次生成都刷新全部时间戳。
  4. 定期把 Sitemap 里的 URL 和抓取日志对照一次,找出“提交了但几乎没被抓”和“抓了但状态码不对”的两类页面。

需要定期核对的三件事

  • Sitemap 文件本身的抓取频率和返回状态,文件读不到,后面都无从谈起。
  • Sitemap 中 URL 的实际抓取比例,比例异常低时先查是不是被规则拦截或地址写错。
  • 内链中的断点,链接指向 404 或重定向时,蜘蛛走到这里就停住了。

别把 Sitemap 当许愿池

Sitemap 能提高 URL 被注意到的概率,但不承诺收录,也不承诺排名。它的价值在于把站点结构讲清楚,让蜘蛛少走弯路。真正被反复走过的抓取路径还是由站内链接铺出来的,Sitemap 更像是给这条路补上标注和索引。

把两条路径对齐——Sitemap 里的地址和内链指向的地址一致,重要页面两边都不缺——URL 发现通常会稳定很多。