不少人把“蜘蛛来过”等同于“页面被收录”,其实这是两个阶段。抓取是搜索引擎下载页面的过程,收录是在下载之后,对页面进行评估、去重和选择,再决定是否放进索引。抓取成功但最终没有进索引,在站点运营里很常见。
抓取和收录是两道门
抓取解决的是“能不能拿到内容”,收录解决的是“值不值得保留”。一个页面可能因为服务器稳定、内链充足而被频繁抓取,但如果内容质量低、和其他页面高度重复,或者 URL 本身混乱,最终仍然可能停在索引之外。
所以看日志时,不要只数蜘蛛请求次数。请求多不代表索引里就有对应页面;反过来,有些页面抓取频率不高,但一旦被判断为有价值,也可能较快进入索引。
页面质量:收录的基础门槛
页面质量没有单一分数,但搜索引擎会从多个信号综合判断。比较常见的有:正文是否完整可见、是否有独特信息、页面是否主要为了导流或堆砌关键词、模板部分是否远多于正文、是否有明确的主题和用途。
- 正文太短,或者只有图片、视频但没有文字说明,页面很难被理解。
- 大量页面共用同一套模板,只有标题或几个词不同,容易被归为低质量。
- 内容拼凑、采集后简单替换同义词,缺少信息增量,收录后也可能不稳定。
- 页面主要靠弹窗、跳转或诱导点击,用户体验差,质量评估也会受影响。
这里要说明,页面质量不是“原创就一定能收录”。原创只是其中一个因素,结构是否清晰、是否满足搜索意图、是否与其他页面形成互补,同样重要。
重复内容:搜索引擎会先归并再选代表
重复内容通常不会直接导致惩罚,但会让搜索引擎在多个相似页面里选一个作为代表,其余版本可能不展示或很少展示。站内重复常见于:同一篇文章放在多个栏目、商品页有多个参数 URL、列表页和详情页内容高度相似。
站外重复则常见于转载。如果你的内容先发在别的平台,或者被大量采集,搜索引擎可能把先被收录的版本当作主版本,你的页面反而变成重复副本。想减少这种情况,可以在站内用 canonical 指明主 URL,内链也尽量指向同一个地址,同时避免同一内容生成多个可访问 URL。
重复内容的核心问题不是“复制”,而是搜索引擎无法判断哪个地址更值得作为索引入口。
URL 规范:同一页面别给多个地址
URL 规范做得好不好,直接影响收录时的地址选择。常见问题包括:带 www 和不带 www 同时可访问、http 和 https 都能打开、末尾斜杠有无都能访问、大小写混用、跟踪参数生成大量变体。
- 确定一个主域名和协议,其他版本 301 到主版本。
- 列表页、分页、筛选参数,尽量用 canonical 或 robots 规则控制,不要让参数无限生成 URL。
- 内链、sitemap、分享链接都使用规范地址,减少搜索引擎发现重复入口的机会。
- 改版或换域名时,旧 URL 做好 301 映射,不要直接返回 404 或 200 空页面。
URL 规范不是一次性工作。新功能上线、活动页配置、参数规则调整,都可能产生新的重复地址,需要定期检查。
日常可以按这个顺序检查
- 先看页面是否能正常访问,状态码是否为 200,内容是否完整渲染。
- 再看页面质量:正文是否足够、是否有独特信息、是否和站内其他页面高度重复。
- 然后检查 URL:是否有多个地址指向同一内容,canonical 是否指向正确版本。
- 最后结合日志和索引报告,看抓取和收录的差异,再决定是优化内容还是整理 URL。
抓取与收录之间隔着一道判断。页面质量、重复内容和 URL 规范,是这道判断里最常被提到的三个方向。与其只盯收录量,不如回到页面本身,把能控制的部分做扎实。