一个新页面要被搜索收录,第一步不是抓取,而是被蜘蛛“知道”它存在。这个知道的动作叫 URL 发现。发现之后才有抓取,抓取之后才有解析和入索引。很多“提交了没动静”“页面几个月没被抓”的问题,其实卡在最前面的发现环节。
发现、抓取、收录是三件事
把三者分开看,排查顺序就清楚了:
- 发现:蜘蛛从哪里拿到这个 URL,通常是内链、外链、sitemap、重定向或历史记录。
- 抓取:蜘蛛真的请求了这个 URL,服务器返回 200,内容可解析。
- 收录:内容被判断为值得进索引,并且有明确的代表地址。
日志里能看到抓取,索引状态里能看到收录,唯独“发现”是看不见的一步,只能靠推断:有没有给蜘蛛留一条走得通的路。
链接深度:从首页算起几跳
浅层与深层的差别
把站点画成一张图,首页是起点,每个链接算一跳。首页直接指向的页面是一跳,列表页里的商品是两跳,商品页下方的推荐位是三跳。跳数越多,能分到的发现和抓取机会越少,这是结构问题,不是权重问题。
- 一跳、两跳:新 URL 常在当天或几天内被发现。
- 三跳以上:需要更长时间,有时要等中间那一层页面被重新抓取。
- 入口只来自外链、搜索或参数:容易变成孤儿页面。
让重要页面更靠近首页
导航、分类页、专题页、最新内容列表,都是把深层页面往前提的抓手。把一个重要栏目放进主导航,通常比在页脚堆几十个链接有效得多。对于内容站,按主题做的聚合页也是同理,它能把散落的长尾页面收在一起。
哪些内链位置更容易被跟上
蜘蛛对链接的处理不只看数量,还看位置和上下文:
- 主导航:全站可见,发现最稳定,适合放核心栏目。
- 面包屑:给详情页和小类目一条返回路径,同时体现层级。
- 正文内链:上下文相关,用户也愿意点,适合内容型页面互相引用。
- 列表与聚合页:新品、新文章的第一落点,一定要有。
- 相关推荐:能扩大覆盖面,但不必让所有页面互相全链。
- 页脚全站链接:数量一多就接近噪音,反而稀释了有效入口。
孤儿页面为什么迟迟不出现
没有任何内链指向、只存在于 sitemap 里的页面,就是孤儿页面。sitemap 能起到提示作用,但它不保证蜘蛛会优先抓取,也不保证一定被抓。这类页面通常靠下面几种方式被发现:外链、社交分享带来的访问、站内搜索的落地地址,以及站点地图文件的批量读取。
如果这类页面本身有价值,最稳妥的做法还是补一条从相关栏目或正文指向它的内链,而不是长期依赖 sitemap 兜底。
自己动手查一遍发现路径
- 打开服务器日志,筛出蜘蛛的请求,找到新 URL 第一次出现的日期。
- 对照那次访问,判断入口来自首页、列表页还是外链。
- 在站内搜这个地址,看有没有内链指向它,位置在第几层。
- 如果只在 sitemap 里出现,就给它补一条正常的站内入口。
- 等下一次抓取,再观察该 URL 的访问频率有没有变化。
发现只是开始
蜘蛛来过,不代表页面会进索引;进了索引,也不代表会有排名。发现只解决“它知道有这么个页面”,后面还要看内容质量、重复程度和站点整体的抓取情况。
把内链结构理顺,让重要页面离首页更近,给孤儿页面补一条路,这几件事做到位,URL 发现的效率通常会稳定一些。剩下的部分,交给内容和时间。