搜索抓取

面包屑与 HTML 站点地图:给蜘蛛准备的第二条通路

XML Sitemap 不是唯一的入口。本文讨论面包屑、HTML 站点地图、归档页等辅助路径如何补位,让蜘蛛在主导航之外仍能发现并走到深层页面,同时提醒这些入口自身的维护成本与常见失效原因。

搜索抓取

面包屑与 HTML 站点地图:给蜘蛛准备的第二条通路

很多站点的抓取入口其实只有一条:首页导航加一份 XML Sitemap。一旦某个栏目不在导航里,或者导航依赖 JS 渲染,深层页面就只能等蜘蛛碰运气。给蜘蛛准备第二条通路,不需要多复杂,通常是几处结构化的 HTML 链接。

一、XML Sitemap 解决“知道有”,不解决“怎么走”

Sitemap 告诉蜘蛛某个 URL 存在,但它不提供页面之间的关系。蜘蛛拿到一堆地址后,仍然要判断每个地址在站点里的位置、优先级和更新频率。如果这些地址在 HTML 里没有任何指向,抓取就变成一次性的,回访和权重传递都很难持续。

更现实的问题是:Sitemap 里的地址往往远多于内链能覆盖的数量。那些只存在于 Sitemap 的页面,抓取频次通常明显低于有内链的页面。

二、面包屑:把层级关系写进 HTML

面包屑是成本最低的补充入口。它不需要额外的管理成本,只要页面模板里有一处,就能让每个详情页都有一条回到栏目页和首页的路径。

写法上的几个注意点

  • 用普通 <a> 链接,不要只靠 JS 点击事件跳转。
  • 层级要和实际目录结构一致,避免出现“首页 > 全部商品 > 首页”这类循环。
  • 面包屑里的链接文本尽量使用栏目名,而不是“点击这里”。
  • 如果同时输出结构化数据,注意 HTML 与 JSON-LD 里的层级要一致。

三、HTML 站点地图:给老页面留一扇门

当页面数量到了一定规模,XML Sitemap 往往只剩下一串地址,运营者自己都很难从里面看出结构。这时可以维护一个 HTML 版本的站点地图页,按栏目把主要页面列出来。

它不必覆盖全站。通常列出栏目页、重要聚合页和近期更新的内容,效果就已经足够。关键是这个页面本身要有内链指向,否则它同样会变成孤岛。

四、归档页与标签页:辅助入口也有边界

按时间归档、按标签聚合,本质上都是自动生成的列表页,能为老内容提供持续的内链。但它们很容易失控:

  • 标签随意组合,产生大量只有一两条内容的空列表页。
  • 归档页翻到很深的页码,内容价值递减。
  • 同一批内容被多个标签页反复聚合,形成大量近似页面。

可行的做法是给这些列表页设一个下限,比如内容少于一定数量就不生成页面,或者用 noindex 处理,避免把抓取资源消耗在低价值列表上。

五、辅助入口同样要过服务器这关

无论入口设计得多好,最终还是要落在响应上。面包屑和站点地图页如果响应时间偏长,或者在高频抓取时返回 5xx,蜘蛛会逐步降低对这部分路径的访问。稳定返回 200、响应时间可控,是这些入口能长期生效的前提。

六、一次可执行的检查清单

  1. 在浏览器里禁用 JS,看面包屑和 HTML 站点地图中的链接是否仍然存在。
  2. 核对面包屑层级与目录结构是否一致,有没有循环或断链。
  3. 抽查标签页和归档页,统计空列表页的数量。
  4. 用服务器日志确认这些入口页面是否真的被抓取过,频次是否合理。
  5. 检查入口页的响应码与响应时间,排除偶发的 5xx。
补充入口的价值在于降低对单一入口的依赖,而不是替代导航。它不会让页面立刻被抓取,但能让发现路径更稳定一些。

落地时不必一次全上,先补面包屑,再整理一份 HTML 站点地图,通常就能看到入口结构的变化。