很多网站运营把收录问题归因于提交次数、蜘蛛池规模或外链数量,但爬虫抓取只是第一道关。页面被抓取之后,搜索引擎还要判断它是否值得进入索引、以什么形式展现。这个阶段,页面质量、重复程度和 URL 规范会直接影响结果。
抓取与收录是两件事
抓取是爬虫下载页面内容,收录是索引系统决定是否把该 URL 作为可检索结果保存。服务器返回 200 只说明页面可以访问,不代表它会被收录。一个内容空洞、与其他页面高度相似、或者没有站内入口的 URL,即使被抓取多次,也可能长期停留在“已发现”或“已抓取,尚未编入索引”。
所以排查收录时,不要只盯着抓取频次。先确认页面是否具备被索引的基本条件,再去看抓取和提交动作。
页面质量不是主观打分,而是可检查项
“内容好不好”听起来很主观,但从收录角度看,可以拆成几个相对客观的检查点。
内容完整度
页面主体是否完整加载,正文是否只有标题、几句占位文字,或者关键信息藏在图片、脚本里。如果用户和爬虫看到的都是空壳,索引系统很难判断页面价值。
页面唯一性
同一内容是否以多个 URL 存在,比如带追踪参数、大小写不同、打印版本、筛选排序结果。重复内容不一定被惩罚,但会让搜索引擎难以选择规范版本,也可能稀释入口和权重。
站内角色
页面是否从导航、列表或正文链接可达。完全孤立的页面即使提交过,也更难被持续抓取和评估。层级过深、入口过少,同样会影响发现效率。
重复内容的三种常见来源
- 完全重复:同一页面通过不同参数、协议、大小写或尾斜杠访问,内容一模一样。
- 近似重复:筛选页、排序页、分页列表之间只有少量差异,大量内容重叠。
- 模板重复:空结果页、薄聚合页、批量生成的地区页,主体内容由模板填充,缺少独立信息。
处理重复内容时,先明确目的:是想让某个版本被收录,还是想让变体退出索引。前者用 canonical 或 301 指向规范 URL,后者可以用 noindex 或合并内容。不要一边保留大量相似页面,一边期待每个都获得收录。
URL 规范要落到日常操作
URL 规范不只是技术配置,也体现在站内链接和提交习惯上。内链尽量统一使用规范版本,sitemap 只放希望被索引的 URL,避免同一路径在站内出现多种写法。对于参数页,可以按追踪、筛选、会话三类分别处理:追踪参数尽量在服务端或前端去掉,筛选参数只保留有搜索需求的组合,会话参数不要出现在可抓取链接里。
一个可执行的自查顺序
- 确认目标 URL 返回正常,正文内容完整可见。
- 检查是否有 noindex、canonical 指向其他页面,或 robots.txt 误挡。
- 查看站内是否有稳定入口,是否孤岛页面。
- 对比相似页面,判断是保留、合并还是设置规范版本。
- 改善后观察抓取日志和索引状态,给一定周期,不要频繁改动。
收录不是提交奖励,抓取也不是收录。页面质量、重复度和 URL 规范共同决定索引系统是否愿意保留这个 URL。
如果你正在处理一批长期不收录的页面,可以先把它们按“内容空壳、重复变体、缺少入口”分类,再分别处理。比起反复提交,先把页面本身变成值得索引的版本,通常更有效。