日志里能看到蜘蛛来过,站长工具也显示页面已经被收录,可把标题原样贴进搜索框,翻好几页都找不到自己。遇到这种情况,多数人的第一反应是“是不是被降权了”。但在下这个结论之前,需要先把三件不同的事拆开:抓取、收录、展现。它们各自对应不同的问题,混在一起谈,排查就没有方向。
抓取、收录、展现分别指什么
- 抓取:蜘蛛发起请求并成功拿到 HTML。这一步在服务器日志里可以直接看到,状态码、响应时间、User-Agent 都是证据。
- 收录:搜索引擎把抓到的内容解析、去重、判定价值之后放进索引库,并记下它理解出的主题、正文和版本。
- 展现:用户输入查询词时,系统从索引中挑出候选页面,再按相关性、质量、时效等排序呈现。
“已经被收录但搜不到”,绝大多数情况发生在展现环节,而不是收录环节。只有少数情况是索引本身出了问题,例如收录的是旧版本、正文被合并到另一个 URL、或者页面处在“已排除”状态下被工具以不同口径展示。
第一步:确认这个 URL 是否真的在索引里
先做确认,再动手改内容。
- 站内查询只能看个大概。它的结果是估算值,不同查询词、不同机房的数据都会有差异,不要拿它当精确的收录数。
- 单条 URL 用官方的 URL 检查工具看状态,比批量查询更可靠,也能看到最后抓取时间和引用的 canonical。
- 留意斜杠、大小写、参数版本。你可能在查 A,被收录的是 B。
- 如果页面依赖 JS 渲染,确认索引里保存的版本是否包含正文。只有骨架的页面在具体词上很难有展现机会。
如果确认索引里没有它,问题就回到收录环节,方向是 robots、noindex、canonical、内链入口和内容本身的可用性。这跟“已收录但搜不到”是两条完全不同的排查线,用错方向只会白费功夫。
第二步:确认已收录后,再查为什么搜不到
- 查询词和页面主题不匹配:你搜的是自己习惯的叫法,用户搜的是另一种表达。看看页面里是否真的出现了这些词,还是只出现在导航和页脚里。
- 标题堆了词,正文却答非所问:这类页面即使被收录,也很难在长尾词上拿到位置。
- 同一个词下竞争页面更强:收录只是入场券,不保证任何排位。
- 时效与地域:活动类、资讯类页面会随时间衰减,地区版本和语言版本也会影响结果归属。
- 展示形式的变化:部分结果被折叠、被聚合区块或特殊模块替代,看起来像“没出现”,实际是换了位置。
第三步:索引里保存的是哪个版本
有时候页面确实在索引里,但保存的是修改前的版本:旧标题、旧正文,甚至已经删掉的内容。这种情况下,用新标题去搜自然找不到。可以在 URL 检查工具里对比索引版本与线上版本是否一致,也可以通过站点地图和内链再次触发抓取。内容改动较大时,索引更新需要一个重新抓取和处理的过程,往往不是即时的。
几个容易误判的地方
- 把站内查询无结果直接当成“被删除”。页面可能只是换了收录的 URL 版本。
- 把收录数量当作核心目标。数量涨了但都是无价值的参数页,对整站没有帮助。
- 反复查询。查询本身不改变索引状态,重复查询只会增加噪音。
判断的标准应该是:目标页面是否在索引里、索引版本是否正确、用户在真实查询下能不能找到它。这个顺序不能颠倒。
一份可执行的自查顺序
- 用日志确认最近是否有抓取,状态码是否正常。
- 用 URL 检查工具确认索引状态与索引版本。
- 核对 robots、noindex、canonical 是否与预期一致。
- 在真实用户会用的查询词下测试,而不是只用标题原文。
- 对比同类页面的收录与展现表现,找出差异点。
- 按结论整改,等下一轮抓取和处理完成后再复查。
把抓取、收录、展现分开看,很多看似矛盾的现象就有了合理解释。真正值得花时间的不是反复查询收录状态,而是把页面内容做成能匹配真实查询的样子。