内容发布出去,只是完成了第一步。对搜索引擎来说,一个新 URL 从存在到被安排抓取,中间至少要经过被发现、进入队列、被抓取、被处理几个环节,任何一环断了,页面都可能长时间停在那里没人管。这篇自查清单不承诺收录速度,只帮你把明显能自己解决的问题先排掉。
一、先确认这个 URL 真的能打开
很多“蜘蛛不抓”的问题,根因其实在服务器侧。发布后第一件事,用无登录状态的浏览器或者命令行工具访问一次:
- 返回状态码是 200,而不是 301、302、403、500;
- 没有跳转到登录页、验证页或者地区选择页;
- 服务器返回的 HTML 里能看到正文,而不是一片空白等 JS 填充;
- URL 大小写、结尾斜杠与站内链接中写的一致。
如果这一步就不通过,后面所有优化都是白费。
二、给新页面留一条能爬到的入口
蜘蛛发现 URL 的主要途径仍然是链接,sitemap 是补充而不是唯一通道。一个新页面如果全站没有任何指向它的普通链接,只存在于 sitemap 中,被发现的概率会明显下降。
优先补齐的几类入口
- 从栏目页或专题页给出一个直达链接,位置不要太深;
- 在相关老文章的正文或“相关阅读”模块里加入;
- 如果站点有归档页、标签页,确认新页面已被纳入;
- 面包屑导航里带上对应层级。
入口链接最好放在服务端渲染的输出里,而不是等前端异步加载后再插入。蜘蛛能否执行 JS 因站点而异,把关键链接交给 JS 生成,等于给自己增加不确定性。
三、sitemap 和提交动作要跟着走
新增页面后,把对应条目写进 sitemap,并更新 lastmod。不要图省事整份文件重新生成一遍时间戳,这会让 lastmod 失去参考价值。各搜索引擎的站长平台都提供提交入口,提交是告知,不是保证,心态上把它当作提醒而非开关。
四、检查是不是孤岛页面
判断方法很直接:在站内搜索框里搜页面标题的关键词,看能否搜到;或者用只跟着站内链接爬取的工具跑一遍,看这个 URL 是否出现在结果里。如果两处都找不到,基本可以确认它是孤岛。
另一种常见情况是“半孤岛”:链接存在,但只出现在分页很深的位置,例如某个列表的第 30 页之后。蜘蛛对深层页面的抓取优先级本来就低,把重要新页面放在这种位置,等于主动降权。
五、几个容易忽略的细节
- noindex 残留:模板或测试环境带过来的标签没去掉,页面能打开但已被明确排除;
- 参数过多:URL 上挂着会话 ID、来源追踪参数,同一内容裂成多个地址;
- 重复内容:新页面与此前发布的文章高度重合,谁被选中都不奇怪;
- 发布即大改:上线几小时就换标题、换 URL,抓取记录反复对不上。
六、用日志验证,而不是靠感觉
发布后隔一两天翻一下服务器日志,按 UA 过滤蜘蛛访问,看目标 URL 是否出现过、返回什么状态码、抓了几次。如果状态码正常、入口也补上了,但一直没有访问记录,可以检查一下是否有防火墙或 CDN 规则把它当成异常流量拦掉了。
URL 发现这件事,可控的部分是入口、状态码和结构;不可控的部分是抓取节奏。把可控的做扎实,剩下的交给时间。
最后提醒一句:不要为了催抓取而频繁改动 URL 或反复提交同一批地址。稳定的结构和持续更新的内容,比任何技巧都更经得起观察。