有些页面提交后短暂出现在索引里,过一段时间又被拿掉;也有些页面抓取日志里天天有,索引里始终查不到。遇到这种情况,很多人第一反应是继续提交、继续加外链,但如果页面本身缺少可被独立检索的内容,这些动作很难改变结果。
先分清抓到了和收进去了
抓取是把 HTML 取回本地,收录是把页面放进索引并分配一个位置。中间还有解析、正文抽取、去重聚类、质量判断、需求匹配等环节。任何一个环节判定这个 URL 不值得单独占位,它都可能只被当作某个代表页的副本,或者干脆不进索引。
所以看到抓取正常、索引没有,先别急着当作技术故障,回到页面本身看看。
核对页面质量时看什么
正文是否有独立信息
- 去掉导航、页脚、推荐位之后,正文还剩多少字,有没有把一件事说清;
- 内容是否只由参数拼出来的列表、地址、编号堆成;
- 同一模板下几十上百个地址,正文差异是不是只有标题里的一个词。
页面是否解决了某个具体问题
索引位是有限的,搜索引擎更倾向保留能被检索、能回答问题的页面。纯粹为了覆盖关键词而生成的页面,即使被抓取,也很难稳定留在索引里。
站点整体质量会传导
如果站内大量页面都是低差异模板页,质量判断会向站点层面传导,少数好页面也可能被拖累,出现抓取慢、收录晚的情况。这时要收缩的是低价值地址,而不是继续放量。
重复内容和 URL 规范常被忽略
同一段内容能用多个地址打开,是收录核对里最常见的干扰项。常见的来源有:
- 带跟踪参数的分享链接、会话 ID;
- 筛选、排序、分页组合出的参数地址;
- 大小写、结尾斜杠、http 与 https 混用;
- 打印页、AMP 页、移动版独立地址。
这些地址如果都能被抓取,又没有明确的规范化信号,聚类时可能只保留一个,其余在索引里消失。核对时先确认:站内链接、sitemap、canonical、重定向是否指向同一个首选地址。内部仍在大量指向非首选地址,等于持续把蜘蛛引向副本。
一个可执行的核对顺序
- 从索引里取出实际可见的代表地址,记录它的标题与摘要;
- 用该地址反查站内还有哪些地址返回相同内容;
- 检查这些地址是否返回 200、是否互相 canonical;
- 看内链与 sitemap 主要指向哪一个;
- 统计全站有多少地址属于同一模板且正文差异极小;
- 对低价值地址做收敛:合并、加 noindex 或从内链撤下;
- 观察一段时间再看索引变化,不要当天反复提交。
不要指望单次操作立刻见效
索引更新有自己的节奏。调整规范化信号、收敛低质地址之后,通常要等下一次抓取和重新评估。频繁改动首选地址、来回切换 canonical,反而会让搜索引擎难以判断哪个地址代表这段内容。
把收录问题当成页面质量与地址规范的问题,而不是提交次数的问题,核对起来会清晰很多。