核对收录情况时,很多人只盯着一件事:这个 URL 在索引里有没有。至于索引里存的是什么——标题、摘要、日期、主图——往往等用户反馈“搜出来的名字不对”才回头看。这一步其实可以提前做,成本也不高。
索引里保存的不是你的源码
抓取之后,搜索引擎会对页面做解析和抽取,决定用哪段文字当标题、哪段当摘要。最终展示的版本还可能随查询词变化。所以“源码里 title 写得很清楚”和“索引里存的就是这句 title”不能画等号。
这本身属于正常现象,不是错误。但如果抽取结果和页面主旨偏离太远,用户点进来的预期就会落空,落地体验和后续行为都会受影响。
三种常见的“对不上”
- 标题被拼接:索引里显示的是“H1 + 栏目名 + 站点名”,或者取了面包屑、导航文字,而你自己写的 title 完全没出现。
- 摘要来源异常:摘出来的句子来自侧栏推荐、登录提示、弹窗文案,而不是正文首段。
- 日期不准:正文讲的是几年前的事,索引里挂的却是模板输出的“今天”。时效性内容尤其容易踩到。
核对时按顺序走一遍
- 用站点限定查询找到目标页,按模板分组抽样,不必全站铺开。
- 记录索引里实际显示的标题、摘要、日期、主图,抄进表格。
- 和源码里的 title、H1、正文首段逐项比对,标出偏差类型。
- 如果偏差集中在同一模板,优先改模板,而不是逐页手改。
先分清是收录问题还是抽取问题
地址在索引里、只是展示形态不同,一般属于抽取与展示层面的事。这类情况反复提交 URL、堆外链意义不大,通常也不会改变结果。需要处理的是页面结构:让关键信息更容易被识别。反过来,如果地址根本没进索引,那才要回到发现、抓取、索引这条链路去查。
结构上常见的诱因
- title 与 H1 表述差距过大,抽取时难以确定主标题。
- H1 缺失,或用图片、logo 代替文字标题。
- 正文被大量模板文字包围,主内容占比低,抽取容易抓错段落。
- 结构化数据里标注的标题、日期与正文实际内容不一致。
- 列表页、聚合页、详情页共用同一套模板,抽取结果趋同。
建一份抽取结果对照表
按模板分组,每组抽五到十页,记录“源码里写的”和“索引里显示的”两栏。只登记有偏差的条目,注明是标题、摘要还是日期出问题。改动前后各留一次基线,下次再有人问“是不是改坏了”,你手上有东西可比。
收录核对不只是确认地址在不在,还要确认索引里那份“名片”是不是你想递出去的那份。
几个容易做偏的动作
- 把展示偏差当成收录失败,开始大范围重发内容。
- 同一批模板页面逐页改 title,改完却没有对照基线。
- 只核对首页和几个重点页,忽略了占量最大的模板页。
这项工作不需要天天做。模板上线、站点改版、调整结构化数据之后各做一轮,基本能覆盖大部分问题。发现偏差时,先判断它属于抽取展示还是收录本身,再决定要不要动手。