新站上线后最常被问到的问题是:地址已经发出去了,为什么搜索蜘蛛迟迟不来。URL 发现本身就是一条链路——入口可达、Sitemap 可用、内链能走通、服务器不拒绝访问,任何一环断了,后面的抓取和索引都无从谈起。下面按时间顺序梳理冷启动阶段可以先做的事,以及日志里常见的卡点。
冷启动前要确认的三件事
- 域名解析稳定,www 与非 www、http 与 https 只保留一个对外版本,其余做 301 跳转。
- robots.txt 没有误挡全站,重点检查 Disallow: / 这类历史遗留规则。
- 服务器与 CDN 不对常见爬虫 UA 做拦截,防火墙规则里留出正常访问通道。
第一步:让首页和一级入口先通
首页是绝大多数爬虫的起点。确保首页 HTML 由服务端直接返回,不依赖脚本执行才能看到链接;主导航使用标准 a 标签,href 写完整路径而不是用事件绑定跳转。如果一级栏目都藏在折叠菜单或脚本渲染里,爬虫能看到的入口可能就只剩首页一个,抓取路径会非常窄。
抓取路径的宽度,取决于首页上有多少条真实可点的链接。
第二步:Sitemap 与主动提交作为补充通道
Sitemap 的价值在于把暂时没有内链指向的地址也列出来,但它只是提供一份候选清单,并不保证抓取。新站的文件不宜过大,单文件控制在 5 万条以内、未压缩不超过 50MB;lastmod 只写真实改动时间,不要每次生成都刷新一遍。
Sitemap 与搜索资源平台的提交入口可以并行使用,两者互不替代,但都不要指望提交后立刻有反馈。可以把它们看作“补位”的手段,而不是主力入口。
第三步:用内链把新地址串起来
- 新内容发布后,从相关旧页面加一条上下文链接,让爬虫有路可走。
- 列表页、归档页、标签页保持可抓取,作为批量地址的入口。
- 避免整站只有“首页 → 内容页”的单层结构,也避免层级过深导致深处地址长期无人问津。
内链的意义是让爬虫在抓完一个页面后自然走到下一个,而不是每次都依赖重新提交。对于新站来说,稳定增加的内链比一次性堆大量外链更容易被持续访问。
常见卡点:日志里看不到搜索蜘蛛
- 入口被 robots.txt 或页面 meta noindex 挡住;
- 链接由脚本渲染,HTML 源码中找不到 href;
- 服务器返回 5xx 或响应时间过长,爬虫提前放弃;
- 存在大量重复地址或软 404,抓取资源被消耗在无效页面上;
- 页面之间链接形成闭环,新地址没有任何入口指向。
观察与调整的节奏
上线后建议以周为单位看服务器日志里的爬虫访问记录:来访频率、被抓取的 URL 分布、状态码分布。如果只有首页被访问,说明入口太窄;如果大量 404 被访问,说明旧链接或历史 Sitemap 还在被读取。把爬虫 UA 的响应时间单独监控,可以及早发现高峰期超时丢入口的情况。调整时一次只改一处,观察一周再判断效果。
冷启动没有统一时间表,站点规模、更新频率、外部引用都会影响节奏。把入口铺平、把障碍清掉,剩下的交给时间,不建议用夸张手段去催。