日志里每天都能看到某个 URL 被爬,收录却一直没动静,这种反差最容易让人误判。抓取和收录其实是两个独立环节,中间还夹着内容处理和索引准入的判断。把这两件事混在一起看,往往会去改错东西。
抓取和收录分别指什么
抓取是爬虫把页面的 HTML 以及必要的资源下载下来,这一步只说明它来了、拿到了内容。收录是抓取之后,搜索引擎判断这个页面有独立价值、可以被索引,再把它放进索引库,之后才可能出现在搜索结果里。
所以会出现几种状态:被抓了但没收录、收录了但排不出来、抓取频率很高但索引量不动。它们对应的处理动作完全不同。
从抓取到收录要过三道门槛
第一道:能不能顺利抓到
- robots.txt 是否误屏蔽了整站目录或关键资源;
- 返回的状态码是否稳定为 200,有没有间歇性 5xx 或超时;
- 需要渲染的内容,原始 HTML 里是否为空;
- 页面是否依赖登录、Cookie 或特定地域才能看到主体内容。
这一关没过,日志里要么根本不出现,要么大量报错,处理重点是让页面能被正常抓到。
第二道:抓到的内容值不值得留
爬虫抓到了,不等于内容会被保留。以下几种页面容易被判为低价值:
- 正文只有几句话,其余全是导航、推荐位和广告;
- 同一批内容在不同 URL 下反复出现,没有 canonical 或参数处理;
- 列表页、标签页、站内搜索结果页大量生成相似结构;
- 内容由模板拼接,换个关键词就当成一篇新页面。
处理重点是让每个 URL 承载独立信息,而不是继续增加相似页面。
第三道:处理之后能不能进索引
内容本身没问题,也可能因为信号冲突被挡住:
- 页面上的 canonical 指向了另一个更完整的版本,本页会以那个 URL 的形式入索引;
- HTTP 头或页面里的 noindex 没有清理干净,是从测试环境带过来的;
- 多个变体(带参数、带尾斜杠、大小写不同)被合并,只保留一个代表 URL;
- 站点整体质量偏低时,新页面的收录速度和比例都会明显下降。
判断问题的顺序应该是:先确认被抓到,再看内容是否值得留,最后检查索引信号是否一致。跳过前两步直接改代码,通常是在治标。
一个可以照着走的核对顺序
- 在服务器日志或抓取统计里确认该 URL 是否真的被请求过,返回码是什么。
- 把日志按页面类型分组,看是详情页不收录,还是列表页、筛选页也在里面,问题范围会立刻缩小。
- 抓取原始 HTML(关闭 JS 或用抓取工具查看),确认主体内容在不在。
- 检查 robots、meta robots、X-Robots-Tag、canonical 四个信号是否互相一致。
- 对比同栏目下已被收录的页面,找出结构、长度、内容上的差别。
- 确认无误后,用站内入口链接、Sitemap 提交等方式重新暴露 URL,然后耐心观察,不要反复提交。
常见的两个误判
一是看到抓取频繁就以为快收录了。抓取频率更多反映爬虫对站点的信任度和更新预期,和单个页面能否入索引没有直接关系。
二是看到索引量没涨就去堆外链。如果页面本身过不了第二道门槛,外链只会带来更多抓取,不会自动带来收录。
小结
抓取是入口,收录是结果,中间隔着内容质量与索引信号的判断。遇到爬虫来了但不收录,先把两个数字分开,再顺着抓取、内容、索引信号这条线逐段核对,比盲目修改页面要有效得多。