网站收录

新页面发布后迟迟没被发现:URL 发现的几条路径与核对顺序

新页面不被收录,很多时候问题不在页面质量,而在于它根本没进入蜘蛛的发现队列。本文区分发现、抓取与收录三个阶段,梳理站内链接、站点地图、站外链接等常见的 URL 发现路径,并给出一份从入口到日志的核对顺序,帮助定位是链接断裂、入口太深还是抓取未安排。

网站收录

新页面发布后迟迟没被发现:URL 发现的几条路径与核对顺序

先分清楚是“没被发现”还是“被发现后没被收录”

很多人把“页面不收录”当成一个问题处理,实际上它至少包含三个不同阶段:发现(蜘蛛知道这个 URL 存在)、抓取(蜘蛛实际取回了页面内容)、索引(内容通过质量评估后进入索引)。如果卡在第一步,再怎么改标题、加字数都不会有效果,因为蜘蛛压根没来过。

一个简单的判断方法:如果服务器日志里从来没有出现过这个 URL 的访问记录,基本可以判定是发现环节的问题;如果日志里有访问但状态码异常、返回内容为空,那问题在抓取;如果抓取正常、状态码 200、内容完整,却长期不进入索引,才需要回到页面质量与重复内容上排查。

URL 发现的几条常见路径

站内链接

这是最稳定也最容易被忽视的一条路径。蜘蛛通常沿着链接爬行,一个页面如果没有任何站内链接指向它,就只能依赖站点地图或外部链接。常见的断链情况包括:列表页只显示前若干条、分类页翻页被异步加载、内链指向的是跳转地址而跳转链被屏蔽、链接写在 JS 事件里而不是 a 标签的 href 上。

站点地图

站点地图是“声明”,不是“保证”。它告诉搜索引擎这里有一个 URL,但不代表一定会抓。地图文件本身的可用性很关键:地址是否可访问、是否被 robots.txt 误屏蔽、单文件 URL 数量是否过大、lastmod 是否长期不更新。如果地图里的地址和站内实际链接的地址写法不一致(例如带不带末尾斜杠、大小写不同),也会削弱它的参考价值。

站外链接

外部链接指向新页面,能明显加快发现速度,但要注意链接是否可被抓取:nofollow 链接仍然可能被发现,但权重传递不同;如果外链页面本身很少被抓取,指向你的链接也不会带来多少访问。

一份可执行的核对顺序

  1. 确认该 URL 是否返回 200,并且匿名访问(不带登录态)能看到完整正文。
  2. 在站内找一个权重较高的入口页,检查是否存在指向它的可抓取链接,且链接不是多层跳转。
  3. 检查该 URL 距首页的点击深度,超过四五层的页面发现速度会明显变慢。
  4. 核对站点地图是否包含该地址,写法是否与实际链接完全一致。
  5. 查看 robots.txt 是否有规则意外命中了这个路径。
  6. 观察服务器日志中是否出现该 URL 的请求,以及请求的 UA 和返回状态码。
  7. 如果长期没有请求,尝试从其他已被频繁抓取的页面增加一条真实内链,再观察一到两周。

容易被忽略的细节

  • 入口页自身没被抓:新页面挂在一个本身就很冷的列表页下,等于挂在死胡同里。
  • 链接位置太靠后:放在页面底部几十条之后,被处理的优先级会下降。
  • 分页与筛选参数:如果入口页默认只展示第一页,深层内容可能只在带参数的地址里出现,这类地址往往抓取意愿较低。
  • 发布节奏:短时间内批量上线大量新 URL,会让抓取被摊薄,平均等待时间变长。
  • 移动端入口:移动版页面如果缺少同一批链接,可能影响移动优先下的发现效率。
发现、抓取、索引是三个环节。先确认蜘蛛有没有来过,再讨论页面值不值得被收录,能省下大量无效改动。

用日志做观察,而不是靠猜

与其反复提交、反复修改,不如按周统计一次日志:新增 URL 中有多少被请求过、从请求到首次出现索引大概间隔多久、哪些入口页贡献的爬取最多。把这些数据留下来,你会慢慢看出自己站点的发现规律——哪些位置的链接真正有效,哪类页面天生就难被发现。之后再决定是补充内链、调整站点地图,还是给重点页面安排一个更靠前的入口,判断会踏实得多。