很多人把“收录”当成一个动作,实际上它是一条链路:URL 被发现、被安排抓取、内容进入索引库、最后才有机会在搜索结果里展示。任何一环卡住,表现都可能是“没收录”或“收录不稳定”。如果一上来就改内容,往往排查不到点上。
先看 URL:参数、大小写和尾斜杠
搜索引擎对 URL 的识别是字符串层面的。同一个页面如果出现多个 URL 版本,比如带不带追踪参数、带不带尾斜杠、大小写不一致,就可能在索引里分散成多个地址。常见来源包括:
- 站内链接写法不统一,一部分带 ?from=xxx,一部分不带;
- 分享、广告或统计工具自动追加参数;
- 服务器对大小写和尾斜杠不做归一,返回不同状态码或同一内容。
处理顺序通常是:先统一站内链接,再给规范版本设置 canonical,最后用 301 把明显的变体收口。不要在同一个页面同时放多个相互矛盾的信号,比如 canonical 指向 A,内链却大量指向 B。
重复内容:先分主版本,再谈取舍
重复不一定是抄袭,更多时候是同一套内容的多个入口。例如筛选页、排序页、打印页、分页聚合页,以及不同参数生成的列表。它们可能都返回 200,也可能都被抓取。如果不做区分,索引容易把权重和抓取预算分散掉。
可以按信息增量分三档:
- 有独立价值:保留,并让 canonical 指向自身;
- 只是入口变体:用 canonical 指向主版本,或设置 noindex 但保留抓取;
- 无内容或空结果:考虑 404/410,或至少返回 noindex,避免软 404。
判断标准不是“这个 URL 好不好看”,而是“用户通过它能不能得到与主版本不同的有效信息”。
页面质量:收录前先看信息增量
即使 URL 干净、也被抓取了,页面仍可能因为质量信号不足而进不了索引。可以从几个角度自检:
- 正文是否主体明确,还是模板、导航、推荐位占了大部分;
- 标题和摘要是否与页面内容一致,有没有堆关键词;
- 列表页是否有足够条目,还是只有几条重复卡片;
- 用户评论、问答、聚合页是否提供了原页面之外的信息。
质量不够时,优先补内容或合并页面,而不是反复提交 URL。提交只能增加被发现的机会,不能替代页面本身的可索引性。
抓取与收录不是一回事
日志里看到蜘蛛来过,只说明 URL 被抓取过,不代表已经进入索引。抓取之后还要经过内容解析、去重、质量判断和索引调度。因此会出现“抓取正常但索引不涨”的情况。核对时至少把三段分开:
- 抓取:看服务器日志、工具里的抓取统计;
- 入库:看索引状态、规范版本选择;
- 展示:看搜索关键词、标题摘要和排名。
不同工具的数据口径和更新时间不同,对不上是常态。先确认数据来源,再判断是否存在真实问题。
一个可执行的核对顺序
- 确认目标 URL 返回 200,且内容与用户看到的一致;
- 检查站内链接是否都指向规范版本;
- 检查 canonical、robots、noindex 是否互相冲突;
- 确认页面有独立信息增量,不是纯模板或空列表;
- 区分抓取与索引数据,留出合理的更新时差;
- 若仍无变化,再回到 URL 发现和内链入口排查。
收录是结果,不是单次操作。把 URL 规范、重复版本和页面质量分开核对,比反复提交或频繁改动更容易找到真正的阻塞点。