抓取和收录是两件事
抓取是搜索引擎蜘蛛下载网页的过程。蜘蛛通过链接、站点地图、历史记录等发现 URL,然后请求服务器,拿到 HTML 或资源。收录是搜索引擎把抓取到的内容分析、去重、评估后,放进索引库,并在有查询时可能展示出来。抓取成功只是第一步,不代表页面一定会被收录。
日志里出现蜘蛛访问,只能说明蜘蛛来过、请求过,甚至可能只抓取了部分资源。是否进入索引,取决于后续处理。
为什么抓取到了却没有进索引
内容被判定为低价值或重复
如果页面正文稀少、大量模板文本、与站内其他页面高度相似,或者只是参数组合生成的列表,索引系统可能认为没有单独收录的必要。这时抓取日志正常,但索引里看不到。
规范版本被其他 URL 抢走
同一内容有多个 URL,比如带参数、带 www、大小写不同、移动版和桌面版。搜索引擎会选一个规范版本收录,其他版本可能被合并。你查的那个地址没有索引,不代表内容完全没进索引。
页面返回了不该返回的状态
抓取时返回 200,但内容为空或提示错误,容易被当作软 404。返回 noindex、robots.txt 禁止抓取、canonical 指向别处,也会让页面无法进入索引。这些要和抓取日志分开核对。
渲染后内容与源码不一致
如果正文依赖 JavaScript 渲染,而蜘蛛拿到的初始 HTML 里没有内容,索引系统可能只能看到空壳。虽然现在渲染能力提升,但等待渲染仍有不确定性,重要内容尽量直接输出在 HTML 里。
自查顺序:从发现到索引逐层核对
- URL 是否被发现:检查内链、站点地图、外链入口。日志里完全没有蜘蛛访问,先解决发现路径,而不是收录。
- 抓取是否被允许:查看 robots.txt、meta robots、X-Robots-Tag 是否误拦截。允许抓取是进入索引的前提。
- 服务器返回是否正常:确认状态码是 200,内容不是空壳,没有跳转到无关页面。软 404 会浪费抓取并影响收录。
- 规范标签是否指向自己:canonical 写错或指向其他页面,等于主动放弃当前 URL 的索引资格。
- 页面内容是否有独立价值:检查正文占比、重复度、信息完整度。模板化页面需要补充独特内容,而不是反复提交。
- 查看索引报告与查询表现:区分“已发现”“已抓取,尚未编入索引”“已编入索引”。不同状态对应不同处理方向。
常见误区
- 把日志里的蜘蛛访问当成收录通知。访问频率高不代表索引优先级高。
- 看到“未收录”就反复提交站点地图。如果页面本身不合格,提交次数没有意义。
- 只盯一个 URL。多地址版本、移动版和桌面版需要一起看,避免误判。
抓取是敲门,收录是进门。先确认门有没有开、路有没有通,再判断房间里的内容是否值得留下。
如果你正在排查,建议先记录蜘蛛访问时间、返回状态、内容版本和索引状态,再逐项排除。不要只凭一个日志条目下结论。