新域名上线时,搜索引擎对站点的了解是空白的:没有历史抓取记录,也没有已知的内链结构。这个阶段的 URL 发现效率,主要取决于站点能否用最短的路径讲清楚“从这里出发可以走到哪些页面”。下面这套顺序的目标是降低发现成本,而不是保证一次提交就有结果。
一、让首页成为清晰且唯一的出发点
首屏可见的链接越明确,从首页出发的可选路径就越确定。导航栏、面包屑、正文里的锚文本,都属于稳定入口。反过来,把首页做成整屏轮播图、或者导航完全由脚本渲染,等于把路标藏了起来。蜘蛛到站后第一件事是找链接,找不到就只能空手离开。
二、用尽量浅的层级挂载首批内容
起步阶段内容量有限,没必要急着铺深栏目。可以先把核心的二十到五十个页面,通过首页或一级栏目直接链到。层级越浅,从首页能走到的 URL 越多,中间环节出错的机会也越少。
- 栏目页放在主导航里,URL 定下来后尽量别改;
- 内容页至少有一条来自栏目页或相关推荐的内链;
- 避免出现只在 Sitemap 里提到、站内任何链接都到不了的页面。
三、Sitemap 是补充入口,不是替代入口
XML Sitemap 能帮蜘蛛更快知道有哪些 URL 存在,但它不负责维持抓取路径。一个只在 Sitemap 出现、站内没有任何链接指向的页面,通常拿不到稳定的抓取回访。合理分工是:站内链接负责把 URL 组织成网状,Sitemap 负责把清单交出去,两边内容尽量对齐,别一个多一个少。
四、robots.txt 先放行再收紧
新站常见的做法是先让 robots.txt 放行全站,等抓取路径稳定后再针对性拦截后台、搜索结果页这类不值得被抓的地址。起步阶段就大范围 Disallow,容易出现“站点看起来没什么可抓”的错觉,反而拖慢发现节奏。
五、起步阶段的服务器要求
新域名没有稳定的抓取配额,几次超时或 5xx 就足以让蜘蛛降低回访意愿。这个阶段值得确认的几件事:
- 首页与栏目页的响应时间是否稳定,尤其在没有缓存命中时;
- HTML 是否由服务端直接输出,而不是等脚本执行完才有链接;
- 是否存在 www 与非 www、http 与 https 同时可访问的情况;
- CDN 回源是否正常,别让蜘蛛拿到空白页。
六、提交之后看什么
提交 Sitemap 或做主动推送只是告知,不等于被抓取。真正有用的信号在服务器日志里:哪些 URL 被访问过、状态码是什么、Referer 是哪条链接带进来的。如果某个页面始终没有任何抓取记录,先回头看它在站内有没有入口,而不是反复重新提交。已经抓取但状态码异常的 URL,则要优先修复,而不是新加更多地址。
起步期最忌讳的是路径反复变动:今天改目录,明天换 URL 规则,蜘蛛每来一次看到的都是新结构,之前积累的路径认知会被清零。
七、几个常见误区
- 一次性提交几千个 URL,但站内实际只有几十条链接支撑;
- 为了首页“干净”,把导航链接换成不可点击的图片;
- 内容刚上线就改标题和 URL,导致发现记录对不上;
- 只盯着提交结果,忽略日志里真实的抓取行为。
把入口理顺、层级压浅、内链与 Sitemap 对齐、服务器保持稳定,这四件事做到位,URL 发现会随着抓取回访次数增加逐步进入正循环。剩下的就是按节奏更新内容,并定期从日志里核对哪些地址还没被走到。