蜘蛛发现一个新 URL,通常只有两条路:顺着页面上的链接爬过去,或者读站点提供的 Sitemap。很多人把两者当成二选一,其实它们承担的是不同工作,配合不好时反而会互相拖累。
两条路径各自擅长什么
内链反映的是站点结构和重要性排序。蜘蛛从一个链接进入页面,同时也在读取这个页面被谁指向、处在什么位置。新页面发布后,只要在相关栏目或文章里加一条链接,被发现的速度往往比等 Sitemap 更快。
Sitemap擅长的是批量和结构化。它能在不增加页面链接的前提下,把成百上千个 URL 一次交出去,还能附上最后修改时间,帮助蜘蛛判断哪些内容值得重抓。但它只是一份候选清单,不代表蜘蛛必须去抓。
Sitemap 告诉蜘蛛“这里可能有内容”,内链告诉蜘蛛“这里值得优先看”。两者缺一个,URL 发现都会变慢。
两条路打架时的三种常见情况
Sitemap 里有,内链里没有
这类 URL 往往就是孤岛页面。蜘蛛可能通过 Sitemap 抓到一次,但因为没有任何内链指向,后续重抓和权重传递都很弱。如果某个页面长期只有 Sitemap 一条入口,比较稳妥的做法是从相关栏目、上下篇或专题页补一条链接过去。
内链里有,Sitemap 里没有
通常不算问题。只要页面能被正常爬到,Sitemap 缺一条不影响发现,只是少了最后修改时间这个辅助信号。真正需要担心的是反过来,把 Sitemap 当成唯一入口。
同一个页面,两边地址不一样
带追踪参数、大小写不一致、结尾斜杠不同、http 与 https 混用,都会让 Sitemap 和内链指向两个地址,抓取被拆成两份。检查时把 Sitemap 中的 URL 和页面里的实际链接做一次对照,差异列表通常不会太长,但值得清理。
一份务实的配合做法
- 新页面发布时,先在站内加至少一条从相关栏目指向它的链接,位置尽量靠近正文或列表主体,而不是只放在页脚。
- Sitemap 只保留返回 200、canonical 指向自身的 URL,重定向、参数页、已下线页面及时移除。
- 内容有实质更新时同步修改最后修改时间,不要每次生成都刷新全部时间戳。
- 定期把 Sitemap 里的 URL 和抓取日志对照一次,找出“提交了但几乎没被抓”和“抓了但状态码不对”的两类页面。
需要定期核对的三件事
- Sitemap 文件本身的抓取频率和返回状态,文件读不到,后面都无从谈起。
- Sitemap 中 URL 的实际抓取比例,比例异常低时先查是不是被规则拦截或地址写错。
- 内链中的断点,链接指向 404 或重定向时,蜘蛛走到这里就停住了。
别把 Sitemap 当许愿池
Sitemap 能提高 URL 被注意到的概率,但不承诺收录,也不承诺排名。它的价值在于把站点结构讲清楚,让蜘蛛少走弯路。真正被反复走过的抓取路径还是由站内链接铺出来的,Sitemap 更像是给这条路补上标注和索引。
把两条路径对齐——Sitemap 里的地址和内链指向的地址一致,重要页面两边都不缺——URL 发现通常会稳定很多。