同一个站点,首页和博客目录收录正常,产品筛选页或帮助中心却长期停留在“已发现”或“已抓取,尚未编入索引”。遇到这种情况,先别急着把整站判为“不被信任”。搜索引擎处理收录时,颗粒度是 URL,而不是站点。不同目录之间的差异,通常可以从几个具体环节找到原因。
收录决策不是站点级开关
搜索引擎对每个 URL 独立评估:是否值得抓取、抓取后是否值得索引、索引后是否需要更新。站点整体质量会影响抓取频率和信任度,但具体某个目录能不能进索引,更依赖它自己的抓取路径、页面质量和内链支撑。把“整站收录差”换成“哪些目录差、差在哪个环节”,排查会清晰很多。
目录收录差异的常见来源
1. 抓取入口深度不同
首页直接链接的目录,蜘蛛通常发现得更早;需要经过多级列表、分页或 JS 才出现的目录,发现和抓取都会慢。尤其是帮助中心、旧活动页、用户中心这类入口较深的目录,蜘蛛可能很久才访问一次。
2. 内链数量与位置差异
同一个站里,博客文章之间互相链接多,产品页之间链接少,收录表现就可能不同。内链不只是传递权重,它也是蜘蛛发现 URL 和判断页面重要性的路径。一个目录如果只能从 sitemap 找到,缺少正文内链,抓取优先级通常偏低。
3. 目录模板质量参差
如果某个目录大量页面只有标题、几张图、一段重复描述,搜索引擎可能认为这些页面价值不足,减少抓取或延迟索引。相反,目录页有独立信息、结构化数据、清晰说明,被索引的概率更高。这里不是要堆字数,而是让页面有明确用途。
4. URL 规范问题集中出现
筛选参数、排序参数、跟踪参数、大小写和末尾斜杠,如果集中在某个目录,就会把同一批内容拆成多个 URL。索引信号被分散后,目录整体收录看起来就会变差。可以先检查该目录是否出现参数变体被收录、canonical 指向不一致等情况。
5. 服务器响应和目录级配置
有些目录由不同系统或 CDN 规则提供,可能偶发 5xx、429 或超时,也可能被 robots.txt、noindex 误伤。目录级配置一旦拦截抓取,蜘蛛来几次就会降低访问频率,收录自然停滞。
按这个顺序排查
- 抽样对比:从收录好的目录和差的目录各取 20 到 50 个 URL,记录“已发现”“已抓取”“已编入索引”的分布,不要只看 site: 总数。
- 看蜘蛛日志:确认蜘蛛是否访问过差目录,访问的是真实页面还是参数变体,返回码是否正常。
- 查入口路径:从首页出发,数一数到目标页面需要几次点击,中间是否有分页、JS 加载或跳转链。
- 检查内链:在正文中搜索目标 URL,看有多少页面链接到它,链接是否在主要内容区,锚文本是否自然。
- 核对规范:检查 canonical、robots 元标签、sitemap 中的 URL 是否一致,参数变体是否被正确收敛。
- 看页面质量:对比两个目录页面的正文、图片、结构化数据和独有信息,判断差目录是否存在大量模板重复。
调整时先动哪几处
- 给重要但入口深、内链少的页面补充上下文链接,优先从相关文章或导航中接入。
- 把 sitemap 按目录拆分,便于观察提交后哪些目录有抓取响应;但 sitemap 只是发现入口,不能替代内链和页面质量。
- 收敛参数和 URL 变体,让同一内容尽量只有一个规范地址。
- 检查服务器返回码和目录级 robots、noindex 配置,避免误拦截。
- 对内容过薄的页面先补用途,再考虑是否值得保留在索引中。
收录差异通常不是单一原因造成的。先确认蜘蛛有没有来、来了抓的是哪一版、页面是否值得索引,再决定改内链、改模板还是改规范。
同站不同目录的收录差异,可以当作一张排查地图:抓取入口决定“能不能被发现”,内链和页面质量决定“值不值得抓”,URL 规范和服务器状态决定“抓得顺不顺”。按这个顺序逐层排除,比反复提交 URL 更有方向。