蜘蛛发现新 URL 主要靠两条线:站内链接和 XML Sitemap。但不少站点会卡在“链接挖不到、Sitemap 又不够用”的中间地带——内容藏在列表页深处、只在某个模块短期出现、或者压根没有稳定入口。这时候补一条“第二条发现通道”,往往比反复提交 Sitemap 更实际。
什么情况下需要第二条通道
- 新内容上线后首页和栏目页更新不及时,链接要等下一次改版才出现
- 内容层级偏深,从首页点进去要五六层
- 部分链接只在搜索框、表单或前端交互之后才出现
- 内容有生命周期,活动页、专题页下架后入口随之消失
- XML Sitemap 里 URL 很多,但看不出哪个更值得先抓
常见的几种入口形式
这些入口本质都是“人工可维护的 HTML 链接列表”。蜘蛛顺着静态 HTML 链接走,比依赖脚本或参数跳转更稳,也更容易在日志里观察到。
- HTML 站点地图:一页列出主要内容页
- 按时间或分类的归档页:形成稳定的时间轴
- 标签、主题聚合页:把同主题内容聚在一起
- RSS / Atom 订阅源:输出最近更新的清单
- 最新更新模块与相关阅读、上下篇链接
HTML 站点地图的实操细节
结构与位置
- 用 ul / li 输出纯链接,不要等脚本执行后再拼接
- 在页脚放一个全站可见的入口,保证任何页面都能较快到达
- 入口地址保持固定,例如 /sitemap.html,尽量不带参数
- 链接文字用真实标题,避免“点击这里”这类无意义文字
内容与规模
- 单页链接过多时按分页拆分,并在各页之间互相链接
- 优先放内容页,功能页、搜索结果页不必列入
- 更新不必实时,但要有稳定节奏,比如每天或每周
- 与 XML Sitemap 保持大致一致,避免两套口径互相矛盾
归档页与聚合页的取舍
归档页的价值在于时间轴稳定,蜘蛛能顺着翻页持续发现历史内容。但要注意几个副作用:
- 无限翻页会让抓取在列表里打转,建议设置翻页上限,早期内容由分页归档承接
- 筛选、排序参数不要出现在归档链接里,否则容易滚出大量近似 URL
- 同一内容同时出现在分类、标签、时间三种归档时,选一条主路径并用 canonical 收敛
- 只收录极少内容的标签页,可以考虑合并成主题页,而不是每个标签都单独做一页
RSS 与订阅入口
RSS / Atom 是一条轻量的“最新内容清单”,适合更新频繁、栏目较多的站点。它不替代 Sitemap,但能让近期 URL 多一次曝光机会。建议只输出标题、摘要和链接,不要输出全文;feed 地址保持稳定,不要每次重新生成一个新地址。
落地检查清单
- 用无痕窗口从首页出发,看能否在较少点击内到达任一内容页
- 查看源码,确认关键入口是静态 HTML,而不是渲染后才出现
- 确认 HTML 站点地图、归档页、feed 都返回正常状态码且未被 robots 挡住
- 核对 Sitemap 与页面实际链接,清理已失效地址
- 观察服务器日志中这些入口页的抓取情况,判断是否真的被走到
入口页本身不需要排名,它的作用是“把路修通”。判断标准不是它带来多少流量,而是蜘蛛有没有顺着它走下去。
第二条通道只是提高被发现的概率,并不等于一定被抓,更不等于收录。真正起作用的还是内容是否值得保留、站点是否稳定可访问。把入口做清楚、把重复收敛好,剩下的交给时间和抓取节奏。