先把“被发现”和“被收录”分开
很多站点在上线新页面后做的第一件事,是去外面发一批链接,然后盯着索引量看有没有涨。这个动作本身没问题,但预期容易错位。外链最确定的作用是让爬虫知道这个 URL 存在,它属于发现环节。至于爬虫什么时候来抓、抓完之后收不收,取决于站点整体的抓取情况、页面本身的质量和重复程度,这些都不是一条外链能决定的。
把这两件事分开之后,核对起来会清楚很多:发现出问题,就查入口;收录出问题,就查页面和站点信号。
四条常见的 URL 发现路径
站内链接
从首页或栏目页能点到的链接,是最稳定的一条路径。它的特点是可持续——只要页面在导航或列表里,爬虫每次来访都可能重新经过。点击深度越深、入口越少的页面,被发现的时间越不确定。
XML Sitemap
Sitemap 提供的是批量入口,适合新页面集中上线的情况。它的作用是告知,不是强制抓取。提交之后仍然要看日志里爬虫有没有实际访问。
外部链接与社交分享
外部页面上的链接,相当于给爬虫留了一条站外入口。对于还没有任何内链指向的新 URL,这往往是它第一次被访问的原因。社交平台上的分享效果不稳定,更适合当作辅助。
手动提交与接口推送
部分搜索引擎提供单条 URL 提交或接口推送,适合少量、时效性强的页面。它同样只解决发现环节。
外链在发现环节里扮演什么角色
一个可被抓取的外链,价值主要在两点:一是让爬虫第一次遇到这个 URL,二是如果链接所在页面本身抓取频繁,爬虫经过的次数也会更多。这两点都停留在“更容易被看到”的层面。
常被混淆的是 nofollow。带 nofollow 的外链通常仍然可以作为发现入口,只是不传递权重。所以看到一个 nofollow 链接就认为“完全没用”,并不准确;反过来,认为发了一条外链页面就一定会被收录,也不成立。
从日志到索引状态的核对顺序
- 日志里有没有爬虫访问记录。先确认目标 URL 是否真的被请求过,以及请求来自哪条路径。
- 首次访问时间与后续重访。只有一次访问,说明只完成了发现;有稳定重访,说明这个 URL 已经被纳入抓取范围。
- 响应状态与返回内容。确认返回的是 200、内容是否完整、有没有被 robots.txt 挡住,或者被跳转链消耗掉。
- 搜索侧核对索引状态。用站点查询或索引工具确认这个 URL 当前是否在索引里,注意区分“已抓取”和“已收录”。
- 看站内上下文。如果页面始终不收录,检查它有没有内链入口、和站内其他页面是否高度相似。
几个容易踩的坑
- 短时间集中发大量外链。入口数量突然暴涨,对发现环节没有额外帮助,反而可能带来一批低质链接。
- 外链指向的 URL 自己有问题。目标页返回 301、404,或者需要登录才能看到内容,爬虫到了也拿不到有效页面。
- 链接所在页面本身不被抓取。如果外链所在的页面长期不被访问,这条入口等于不存在。
- 把外链当成收录手段。内容重复、模板占比过高、缺少站内入口的页面,发再多链接也很难稳定进入索引。
外链解决的是“爬虫知不知道这个 URL”,不解决“这个 URL 值不值得被收录”。两件事的排查方向不同,混在一起看容易得出错误结论。
更实际的做法
如果目标是让新页面尽快进入抓取范围,优先顺序通常是:先保证站内有清晰入口,再提交 Sitemap,然后才考虑外部的发现入口。外链可以锦上添花,但不该是唯一依赖。
上线一段时间后,用同一批页面做对比会更有参考价值:把有内链入口的和没有的、有外链的和没有的分成两组,对照日志里的抓取时间和索引状态。差异出现的地方,往往就是需要优先补的环节。