XML Sitemap 是给程序读的清单,HTML 站点地图页则是给人看的目录。不少站点把它当成历史遗留功能,要么删掉,要么只在页脚挂一个链接吃灰。但从抓取路径的角度看,它是一条额外的、稳定的入口通道:新页面、深层页面,以及一时没被内链带到的页面,都可以从这里被蜘蛛重新发现一次。
它在抓取链条里的位置
蜘蛛发现 URL 的途径通常有几类:外链、内链、XML Sitemap、历史抓取记录。HTML 站点地图页做的事,是把站内链接用集中、扁平的方式再摆一遍。它的价值不在于“多提交一次”,而在于缩短路径——一个平时只有零散入口、藏在第四层的页面,在这里可能两次点击就能到达。
对抓取预算有限的站点,扁平入口意味着蜘蛛不用先翻完列表页翻页、再穿过一堆筛选参数,才能碰到目标 URL。
一个能真正起作用的页面长什么样
位置与层级
- 放在固定路径,例如 /sitemap/ 或 /map/,不要随栏目改版一起消失;
- 从首页页脚、主导航底部稳定链过去,保证它自己不是孤儿页;
- 页面要能被正常抓取,别用 JS 渲染后再插入链接,也别加登录、弹窗或遮罩拦截。
结构与链接量
- 按栏目分组,每组给出该栏目主要页面和近期更新的内容;
- 链接文本写清楚页面主题,不要清一色的“点击查看”;
- 单页链接数控制在几百条以内更好维护,量级大的可以拆成多个页面并互相链接;
- 不要把友链、广告、站外跳转混进来,那会让这条通道的信号变浑浊。
和 XML Sitemap 怎么分工
XML 文件擅长交底:把 URL 清单、更新时间批量告诉蜘蛛,适合结构化、可校验。HTML 页面擅长铺路:它是站内真实存在的一个节点,可以被内链权重影响,也可以承载分类和描述。两者不冲突,理想状态是清单一致、内容互补——XML 里有的 URL,页面上也能找到对应入口;页面上出现的链接,也都指向真实可访问的地址。
常见的做法错误是两套清单长期不同步:XML 更新了,HTML 页面还是半年前的样子,蜘蛛从页面点进去一堆 404 或已下线栏目,反而消耗抓取。
怎么判断它有没有起作用
看服务器日志或搜索后台的抓取统计,重点观察三件事:
- 这个页面本身的抓取频率是否稳定,有没有被长期忽略;
- 从它出发的二级、三级页面,抓取量有没有变化;
- 新发内容的首次被抓时间,是否比之前更快。
如果页面抓取正常,但从它点出去的深层页面依旧没有抓取记录,问题往往不在这个页面,而在目标页面本身——比如返回异常、内容过薄、被 robots 规则挡住。
它不是收录保证书,只是把路修平一点。蜘蛛走不走、什么时候走,仍由它自己决定。
落地时的几条检查
- 页面有稳定入口,且入口链接可被抓取;
- 链接指向的 URL 全部是 200,没有重定向链和已下线栏目;
- XML Sitemap 与页面清单定期对齐;
- 改版、迁移时把它列进清单,别顺手删掉。
把它当成站内一条长期维护的通道,而不是上线时做一次的门面工程,作用才会慢慢显出来。