新栏目、新目录、新一批页面刚上线时,最容易出现的焦虑是:昨天提交了,今天怎么还没收录。收录不是开关,而是一条有先后顺序的流水线。理解这条流水线,能帮你把“要不要改”和“再等等”区分开。
收录是一条流水线
一个 URL 从诞生到进入索引,大致要经过几个环节:被搜索引擎发现(通过内链、Sitemap、外链或提交入口)→ 进入抓取队列排队 → 被实际抓取 → 内容解析与质量判断 → 决定是否入库 → 入库后可能再分批处理。任何一个环节拥堵,表现都是“没收录”,但原因完全不同。
所以看到“已发现但未编入索引”这种状态时,先别急着改页面。它说明发现环节已经完成,卡点在后面的抓取或判断环节。
新目录常见的三个阶段
一、发现期
目录上线后的头几天,搜索引擎通常先记录 URL,不一定马上抓。此时它做的是低成本的事:把新地址登记下来,并和服务器的响应能力做一次试探。
二、抽样抓取期
接下来它会挑一部分页面试抓,通常是最靠近首页、有内链指向、看起来和其他页面不太一样的那些。这个阶段的收录量往往是个位数或几十个,且分布不均匀——不是平均每个分类抓一点,而是集中在你最容易被发现的入口附近。
三、分批推进期
如果试抓的页面响应正常、内容可用,抓取会逐步向目录深处铺开。这时收录量开始明显上升,但仍然是分批的:一段时间跳一次,然后平一段,再跳一次。这种阶梯式增长比线性增长更常见。
影响节奏的几个变量
- 内链入口的位置:从首页正文区链出去的目录页,和只能靠翻列表翻到的页面,被发现的速度不在一个量级。
- 内容的可区分度:一批页面如果模板相同、正文高度重复,判断环节会更谨慎,推进也会更慢。
- 站点整体抓取预算:老站加新目录通常比新站快,因为抓取能力是共享的。
- 服务器响应与状态码:抓取时返回 5xx、超时或反复跳转,会让这一批的推进明显放慢。
- URL 结构是否稳定:中途改路径、加参数、换大小写,等于让前面的发现工作白做一遍。
- 更新频率:长期无变化的目录,抓取优先级通常低于经常有新内容的目录。
判断是在推进还是卡住了
不要凭感觉,用这三步看:
- 看服务器日志:目标目录的 URL 最近有没有被访问、返回什么状态码、抓的是不是同一批页面。如果日志里只有列表页,说明还没进入详情页的抓取。
- 看索引覆盖状态:区分“已发现”“已抓取未索引”“已编入索引”。状态在逐批变化,就是在推进;连续数周停在同一个状态,才需要动手。
- 看内链是否真的可达:从首页出发,用纯 HTML 链接(不依赖 JS 渲染)能否走到这些页面。走不到,问题在链接,不在内容。
这期间不建议做的事
- 频繁修改 URL 或目录结构,让已发现的地址失效。
- 对同一批 URL 反复提交,提交入口并不能提高抓取优先级。
- 因为收录慢就整批替换内容,改动本身会重置判断。
- 一次性铺开成千上万个质量接近的页面,稀释整个目录的抓取机会。
收录快慢是结果,不是可以直接调节的参数。能做的是把发现路径铺顺、把页面判断的障碍清掉,然后给它一个合理的观察窗口。
实际操作上,新目录分批上线通常比一次性全量上线更容易观察:每批几十到上百个 URL,间隔数天,观察日志与索引状态的变化,再决定下一批的规模。如果两三周内状态完全不动,先回到日志和内链找原因,而不是继续加页面。