页面发出去几天,日志里搜不到这个 URL,站长平台的抓取记录也是空的。这时候很容易得出一个结论:蜘蛛不来。但在把问题归到蜘蛛身上之前,更值得先确认一件事——站内有没有一条正常、可抓取的链接,把蜘蛛领到这个地址上。发现和抓取是两件事,后者以前者为前提。
先把发现、抓取、索引三段拆开
一个新 URL 要走完大致三步,卡在哪一步,处理方式完全不同。
- 发现:搜索引擎从站内链接、sitemap、外链等渠道知道这个地址存在。
- 抓取:排到队之后,蜘蛛真的发起了一次请求,日志里能看到记录。
- 索引:抓回去的内容经过处理,再判断要不要留下。
日志里完全没有请求记录,说明还没走到第二步。此时去纠结页面内容质量、关键词布局,方向就偏了,问题大概率出在发现层。
内链入口往上查的五个点
是不是一座孤岛
最直接的情况:这个 URL 只出现在 sitemap 里,任何页面上都没有指向它的链接。孤岛页面的发现速度完全依赖其他通道,慢是常态。
入口页自己能被抓吗
如果唯一指向新页的入口,本身被 robots.txt 屏蔽、被 nofollow 标记,或者需要登录才能看到,这条路径等于不存在。顺着链路往回查一层,往往就能找到断点。
从首页点几次能到
常见的新页面入口是某个频道页或列表页。如果从首页到它要经过四五层跳转,而这几层里又有一层长期不更新,蜘蛛不一定每次都往里走。新的、重要的页面,尽量让它落在更浅的位置,或者临时从一个抓取频繁的页面上给一个入口。
链接是不是写成了蜘蛛读不到的形式
以下几种写法,人能看到,蜘蛛不一定能跟上:
- 用 JavaScript 点击事件跳转,链接没有出现在 HTML 里;
- 需要提交表单或点击按钮才生成的地址;
- 写在 iframe 或需要登录后才能加载的区域里;
- 用 onclick 加数据属性拼出来的路径,而不是标准的 a 标签 href。
这些情况下,链接对用户有效,对发现环节却可能无效。
入口页是否被大量链接稀释
一个列表页如果挂着几千条链接,其中大部分是重复的筛选组合或分页跳转,新页面的入口很容易被淹没。这里不用做复杂优化,先让真正重要的入口出现在稳定、干净的位置上。
按这个顺序动手排查
- 在站内搜索这个 URL,看有没有页面上出现过它;
- 找到所有入口页,逐个确认它们自身可被抓取、返回正常状态码;
- 确认链接是标准 a 标签,href 指向最终地址,而不是中间跳转;
- 计算从首页到目标页的点击深度,过深就补一条更浅的入口;
- sitemap 保持更新,但把它当补充通道,不当唯一通道。
内链做得好,只是让蜘蛛更容易发现一个 URL;它不保证一定被抓,更不保证一定进索引。这两步还取决于页面本身和站点整体的抓取安排。
几个容易走偏的判断
- “sitemap 提交了就够了”:sitemap 解决的是“知道有这个地址”,不解决“值得跑一趟”。
- “随便给个链接就行”:入口页本身的抓取频率和稳定性,会影响蜘蛛走到这里的概率。
- “日志里没记录,就是页面质量差”:没被抓之前,质量还没进入评判环节,先解决发现和入口问题。
把这三段分清楚,很多“蜘蛛不来”的困惑,会变成一条可以逐项核对的链路清单。