说到 Sitemap,多数人先想到 XML 文件。但在页面上给用户和蜘蛛准备一份 HTML 站点地图,仍然是不少站点在用的补充手段。它的作用不在于“提交”,而在于把散落在各处的入口收拢到一页里,让蜘蛛在抓取路径上少绕几步。
HTML 站点地图页与 XML Sitemap 的分工
XML Sitemap 更像一份给抓取程序看的清单,适合批量列出 URL,并附带时间信号。HTML 站点地图页则是一个真实页面,蜘蛛要靠导航或内链发现它,再顺着页面上的链接继续走。两者并不冲突:XML 负责广度和批量提示,HTML 页面负责给出一条清晰的、可点击的路径。当站点目录层级较深,或者某些栏目入口在导航里藏得比较靠后时,一页结构清楚的 HTML 站点地图可以作为一个额外的汇总入口。
它怎么影响 URL 发现
蜘蛛在站内移动主要靠链接。如果某个分类页只在第三层导航里出现,而首页只链到几个主栏目,蜘蛛可能需要经过多次跳转才能到达。HTML 站点地图页把主要栏目的链接集中在一起,相当于在抓取路径上开了一条捷径。不过要注意,它只是多一条路径,并不会因此让蜘蛛一定去抓某个 URL。真正影响抓取与否的,还是页面本身的质量、更新情况和服务器的响应表现。
适合放进去的链接
- 主要栏目页和分类页
- 更新较频繁的专题页或聚合页
- 重要的静态页,比如关于我们、联系方式
- 内容较多的文章列表入口,视情况按分页展开
不建议放进去的链接
- 大量带参数的筛选页、排序页
- 已经 404 或长期不更新的页面
- 重复内容的不同 URL 版本
- 成千上万条详情页的完整罗列,那更适合交给 XML Sitemap
页面本身要满足的几个条件
- 链接是普通的 a 标签,能被爬虫直接读取
- 链接文字有实际含义,不要只写“点击这里”
- 页面能正常返回 200,加载速度不要拖后腿
- 在页脚或主导航里留一个固定入口,方便蜘蛛反复找到
- 随栏目调整及时更新,避免出现死链
HTML 站点地图页的价值在于“收拢入口”,不是“加快收录”。把它当成一个给用户和蜘蛛都方便的总目录,比当成收录工具更实际。
一个常见的误区
有人为了覆盖更多 URL,把 HTML 站点地图页做成几千条链接的列表,结果页面体积很大,加载慢,蜘蛛也不会一次走完。更实际的做法是只放主要入口,把详情页交给列表页分页和 XML Sitemap。链接数量控制在合理范围,让这一页保持可读、可维护,更新时也不会因为牵一发动全身而出错。
对中小站点来说,HTML 站点地图页的维护成本不高,却能补上导航结构中的一些缺口。配合正常的栏目内链和一份干净的 XML Sitemap,蜘蛛在站内的抓取路径会更清楚,站点运营也更容易排查哪些入口没有走通。