很多站点排查抓取问题时,注意力都放在蜘蛛来了几次、抓了多少页面,却忽略了一件更靠前的事:这些 URL 是怎么被蜘蛛知道的。如果一个页面没有任何内链指向它,它对外就像一座孤岛,蜘蛛沿着链接爬行的路径根本走不到这里。这类页面不是抓不到,而是很可能从未进入抓取队列。
蜘蛛发现 URL 的基本方式
搜索引擎发现新地址,主要靠几条路:顺着已有页面的链接爬过去、读取 sitemap、通过外部链接或站长平台提交等渠道获知。其中最常见也最稳定的是第一条。一个页面只要能被几个正常页面用可点击的 a 标签链到,被发现基本只是时间问题。
哪些页面容易变成孤岛
- 分页改版后旧的分页链接被删除,中间几页再无入口。
- 筛选、排序参数生成的组合 URL,只有用户点击才会出现。
- 老文章或专题页在导航调整时被移除链接,但页面内容仍在。
- 活动落地页只投放于广告或社交平台,站内没有任何指向。
- 程序批量生成、尚未挂到任何列表页的详情页。
补上抓取路径的几种做法
先把内链补齐
能补内链就不要只依赖提交。找到相关性最高的栏目页、聚合页或旧文,在正文里加上自然指向该页面的链接,锚文本尽量描述清楚,而不是写“点击这里”。一个孤岛页面只要有两三条来自不同层级页面的内链,抓取路径就建立起来了。注意别为了补链而堆砌,链接要放在用户真的会点的地方。
用 sitemap 兜底
sitemap 的作用是补充链接,不是替代内链。对确实不适合出现在导航或列表里的页面,可以把地址放进 sitemap,让蜘蛛至少知道它存在。文件要保持可访问,里面的 URL 与线上地址完全一致,不要带多余的参数或跳转。
检查是否被规则挡住
有时候页面有内链,但 robots.txt 规则误伤了路径,或者页面本身带了 noindex、需要登录才能访问,蜘蛛到了门口也进不去。排查孤岛页面时顺手确认这几项,能省下很多反复。
从抓取日志反推
服务器日志里能看到蜘蛛实际访问了哪些地址、带着什么 referer。如果某个页面的来路长期为空或来自站外,说明站内没有给它通路。把日志按路径聚合,孤岛页面往往一眼就能看出来。
孤岛页面不等于低质量页面,但它在抓取环节天然吃亏。补一条内链的成本,通常远低于反复提交与等待重抓。
处理顺序上的建议
- 先确认页面本身是否值得被抓:内容完整、返回 200、能正常渲染。
- 再补内链,优先从相关性高的页面指向它。
- 内链确实补不上时,用 sitemap 保证地址可被读取。
- 观察一段时间日志,看是否出现稳定来路,再决定是否调整站点结构。
URL 发现是抓取的前置环节,内链是其中相对可控的一条路径。定期检查孤岛页面,本质上是在维护蜘蛛走进站点的路网,而不是等着它自己找上门。