核对收录时,“有没有收录”只是第一层。第二层更常见的问题是时间对不上:明明上周改过正文,工具里却显示内容还是旧的;明明日志里蜘蛛昨天来过,收录状态却没变化。这时候先别急着归因到抓取不够或页面质量差,多数情况下是三个不同的时间被混用了同一个。
先分清三个时间分别代表什么
1. 最近抓取时间
指搜索引擎蜘蛛上一次实际请求这个 URL 的时间,通常在抓取统计、服务器日志或 URL 检查工具的“上次抓取时间”里能看到。它只说明蜘蛛来过,不代表这次抓到的内容已经进入索引。
2. 索引刷新时间
指索引里这个 URL 的内容被重新计算、替换的时间。它可能发生在抓取之后,也可能因为配额分配、质量判断等原因延后很久,甚至不刷新。很多人把工具里显示的编入索引时间直接当成抓取时间,于是看到日期不动就以为蜘蛛没来,实际是抓了但没有重新入库。
3. 页面自己声明的时间
包括 HTTP 响应头里的 Last-Modified、结构化数据里的更新时间字段、CMS 模板自动生成的更新时间,以及正文里写死的日期。这一项由站点自己控制,也最容易被自动更新污染:侧边栏推荐位轮换、评论数变化、访问计数改动,都可能让整页的 Last-Modified 每次请求都变。
三种常见错位与判断方式
- 抓取新、索引旧。日志里昨天有抓取,索引里仍是两周前的版本。优先检查是否被抓取但判定内容无实质变化,或者页面主体由 JS 渲染、抓到的 HTML 里没有正文。
- 抓取旧、索引新。索引时间比最近抓取时间还晚,通常是索引层自己做了重算或合并,不一定是重新抓取。此时不要反复提交,先看这个 URL 是否有其他变体被合并。
- 声明时间一直在变、内容没变。每次请求 Last-Modified 都是当前时间,会让抓取调度把它当成高频更新页面,长期看反而占用抓取配额。
核对顺序建议
- 先确认页面是否真的被收录,记下索引里显示的版本特征,比如标题、摘要、正文首段。
- 再看最近抓取时间,确认蜘蛛命中的是哪一个 URL 版本,途中是否经过重定向。
- 然后对比索引时间与抓取时间的先后,判断是抓了没重算,还是根本没抓。
- 最后检查页面声明时间是否被模板自动改写,必要时固定 Last-Modified,或补上明确的日期标记。
- 把上述三项记在同一张表里,观察一到两周,再决定是否需要改动内容或内链。
时间只是判断线索,不是结论。抓取时间和索引时间对不上时,先把它当作待验证的假设,用日志和页面实际返回的内容去交叉确认。
几个容易踩的坑
- 把工具里显示的日期当成唯一口径,不同工具、不同站点统计的时间基准并不一致。
- 页面上把可见日期写成当天,但正文没变,容易让用户和蜘蛛都误判新鲜度。
- 只看首页或列表页的抓取时间,忽略详情页自己的真实抓取记录。
把三个时间对齐之后,很多“收录没动静”的问题会自然分流:一类是抓取层面没排上,一类是抓到了但索引没刷新,还有一类是页面自己把更新时间弄乱了。分清楚之后再动手,通常比反复提交和反复改内容更省事。