新站刚上线时最容易焦虑的问题就是:蜘蛛到底什么时候来。其实抓取系统不会凭空知道一个域名,它需要先能解析到你的服务器,再从某个入口读到第一批 URL,然后才谈得上回爬和更新。所以与其盯着日志发呆,不如把被发现这条链路上的几个环节先检查一遍。
先把解析和协议层理顺
蜘蛛到访走的是普通 HTTP 请求,任何一层卡住,它都进不来。
- DNS:域名解析要稳定,避免解析还没生效就急着提交。若有多条解析记录,确认没有指向已下线的旧 IP。
- 端口与协议:80 和 443 都要能正常响应,http 到 https 用 301 统一,不要一边能开一边报错。
- 证书:证书过期或域名不匹配会让抓取中断,很多所谓蜘蛛不来,其实是证书问题。
- robots.txt:确认它返回 200 且内容正确。测试阶段写过 Disallow: / 却忘记删掉,是新站最常见的自我屏蔽。
给蜘蛛一份明确的入口清单
蜘蛛发现 URL 主要靠外链、Sitemap 和内链三条路。新站外链少,后两条就更重要。
- Sitemap:把主要栏目页和内容页整理成 sitemap.xml 放在根目录,并在 robots.txt 里用 Sitemap 指令声明它的地址。
- 首页内链:首页要能直接点到栏目页,栏目页能点到内容页,链接写在 HTML 里,不要等脚本执行完才出现。
- 去掉孤岛:任何一篇文章,至少要被一个可被抓取的页面链接到。
提交 Sitemap 只是告诉抓取系统这里有地址,并不等于这些页面会被立刻抓取或收录,节奏仍由对方决定。
从站外引入第一批线索
新域名在抓取系统里没有历史,站外链接往往是第一批线索的来源。数量不必多,关键是可访问并指向真实页面。行业论坛的个人主页、合作方页面的引荐链接、同一主体下的其他站点,都比批量购买的链接更有意义。社交平台的分享对抓取帮助有限,不必把它当成主要手段。
上线初期留意抓取节奏
第一批蜘蛛到来时,站点通常还没做过压力测试,容易出问题:
- 页面响应要快,避免超时导致抓取中断。
- 不要出现大面积 5xx,连续失败会让抓取频率下降。
- 留意 429 与限速策略,别把正常抓取当成攻击拦掉。
- 上线后尽量稳定 URL 结构,频繁改动会让已发现的地址失效。
用访问日志确认进展
与其猜,不如看服务器访问日志:蜘蛛的 UA、来访 IP、请求的 URL 和状态码都能看到。如果只抓了首页和 robots.txt 就停了,多半是内链或 Sitemap 有问题;如果抓取频繁但大量是 404,则要检查旧链接有没有做处理。日志里路径的分布情况,基本就是站点结构在蜘蛛眼里的样子。
常见误区
- 整站被 robots.txt 屏蔽,却在等收录。
- Sitemap 里列了大量 404 或需要跳转的地址。
- 首页主要链接靠脚本渲染,HTML 里几乎没有可跟随的链接。
- 为了让蜘蛛多来,频繁重发 Sitemap 或反复改标题,收益很小。
新站冷启动没有捷径,能做的是把解析、robots、Sitemap 和内链这几件事做扎实,让蜘蛛第一次到访时能顺利走完一条完整路径。剩下的回爬频率和收录进度,会随着站点稳定运行慢慢变化。