搜索抓取

给蜘蛛多留一条路:HTML 站点地图、归档页与订阅入口怎么用

站内链接和 XML Sitemap 之外,站点还可以准备第二条 URL 发现通道:HTML 站点地图、归档页、标签聚合与 RSS 订阅入口。本文讲清这些入口分别适合什么场景、怎么落地,以及翻页上限、参数收敛、入口可达性等容易踩的坑。

搜索抓取

给蜘蛛多留一条路:HTML 站点地图、归档页与订阅入口怎么用

蜘蛛发现新 URL 主要靠两条线:站内链接和 XML Sitemap。但不少站点会卡在“链接挖不到、Sitemap 又不够用”的中间地带——内容藏在列表页深处、只在某个模块短期出现、或者压根没有稳定入口。这时候补一条“第二条发现通道”,往往比反复提交 Sitemap 更实际。

什么情况下需要第二条通道

  • 新内容上线后首页和栏目页更新不及时,链接要等下一次改版才出现
  • 内容层级偏深,从首页点进去要五六层
  • 部分链接只在搜索框、表单或前端交互之后才出现
  • 内容有生命周期,活动页、专题页下架后入口随之消失
  • XML Sitemap 里 URL 很多,但看不出哪个更值得先抓

常见的几种入口形式

这些入口本质都是“人工可维护的 HTML 链接列表”。蜘蛛顺着静态 HTML 链接走,比依赖脚本或参数跳转更稳,也更容易在日志里观察到。

  • HTML 站点地图:一页列出主要内容页
  • 按时间或分类的归档页:形成稳定的时间轴
  • 标签、主题聚合页:把同主题内容聚在一起
  • RSS / Atom 订阅源:输出最近更新的清单
  • 最新更新模块与相关阅读、上下篇链接

HTML 站点地图的实操细节

结构与位置

  • 用 ul / li 输出纯链接,不要等脚本执行后再拼接
  • 在页脚放一个全站可见的入口,保证任何页面都能较快到达
  • 入口地址保持固定,例如 /sitemap.html,尽量不带参数
  • 链接文字用真实标题,避免“点击这里”这类无意义文字

内容与规模

  • 单页链接过多时按分页拆分,并在各页之间互相链接
  • 优先放内容页,功能页、搜索结果页不必列入
  • 更新不必实时,但要有稳定节奏,比如每天或每周
  • 与 XML Sitemap 保持大致一致,避免两套口径互相矛盾

归档页与聚合页的取舍

归档页的价值在于时间轴稳定,蜘蛛能顺着翻页持续发现历史内容。但要注意几个副作用:

  • 无限翻页会让抓取在列表里打转,建议设置翻页上限,早期内容由分页归档承接
  • 筛选、排序参数不要出现在归档链接里,否则容易滚出大量近似 URL
  • 同一内容同时出现在分类、标签、时间三种归档时,选一条主路径并用 canonical 收敛
  • 只收录极少内容的标签页,可以考虑合并成主题页,而不是每个标签都单独做一页

RSS 与订阅入口

RSS / Atom 是一条轻量的“最新内容清单”,适合更新频繁、栏目较多的站点。它不替代 Sitemap,但能让近期 URL 多一次曝光机会。建议只输出标题、摘要和链接,不要输出全文;feed 地址保持稳定,不要每次重新生成一个新地址。

落地检查清单

  1. 用无痕窗口从首页出发,看能否在较少点击内到达任一内容页
  2. 查看源码,确认关键入口是静态 HTML,而不是渲染后才出现
  3. 确认 HTML 站点地图、归档页、feed 都返回正常状态码且未被 robots 挡住
  4. 核对 Sitemap 与页面实际链接,清理已失效地址
  5. 观察服务器日志中这些入口页的抓取情况,判断是否真的被走到
入口页本身不需要排名,它的作用是“把路修通”。判断标准不是它带来多少流量,而是蜘蛛有没有顺着它走下去。

第二条通道只是提高被发现的概率,并不等于一定被抓,更不等于收录。真正起作用的还是内容是否值得保留、站点是否稳定可访问。把入口做清楚、把重复收敛好,剩下的交给时间和抓取节奏。