收录经常被当成一个“提交动作”的结果:提交 sitemap、点一下提交入口、或者让蜘蛛多来几次,页面就该进索引。实际工作中更常见的情况是,页面本身还没满足进入索引的条件,提交再多次也只是让 URL 被反复发现。把收录倒推一步,可以看成页面需要依次过四道关。
第一关:抓得到
抓取是收录的前提,但抓得到并不等于收录。常见的卡点包括:
- robots.txt 里对整站或某个目录写了 Disallow,URL 根本进不了抓取队列;
- 页面只存在于 sitemap,站内没有任何内链指向它,属于孤岛页;
- 服务器对蜘蛛返回 5xx 或长时间超时,抓取被中断;
- 链接写在 JavaScript 里且需要点击才生成,蜘蛛拿不到这个 URL。
自查时可以先看服务器日志里这个 URL 有没有出现抓取记录。没有抓取记录,先解决可达性问题,不用急着讨论内容质量。
第二关:抓到了能读懂
渲染问题往往比想象中普遍。页面在浏览器里看起来完整,但服务器返回的 HTML 里只有框架和占位符,主内容要靠脚本请求后再插入。这种情况下,蜘蛛看到的和用户看到的可能不是同一个页面。
几个常见表现
- 正文、价格、规格等关键信息由接口异步返回,源码里没有;
- 内容被登录遮罩、弹窗或“展开更多”挡住,默认不展示;
- 图片形式的正文,没有可读的文字描述;
- 同一份内容靠前端路由切换,多个 URL 返回同一个空壳 HTML。
处理方向通常是把关键内容做服务端渲染或静态输出,至少保证首屏主要文本在源码里可读。
第三关:读懂了值不值得进索引
内容质量是相对的,判断标准是“这个页面和站内其他页面比,有没有独立存在的理由”。以下几类页面容易被抓取,但不容易长期留在索引里:
- 正文只有一两句话,靠模板和无关模块撑起整个页面;
- 与站内其他页面高度相似,只是换了参数或标题;
- 纯聚合列表,没有自己的说明、筛选逻辑或补充信息;
- 内容主体由商品参数表、用户评论等重复结构拼接而成。
这类页面不一定被判为作弊,但通常会被归入“可以抓取、不必保留索引”的一类。处理方式可以是合并同类页面、补充独立内容,或者用 noindex 明确表达态度,而不是放着让它反复被判断。
第四关:规范信号是否一致
当同一份内容存在多个 URL 版本时,蜘蛛需要明确知道哪个是主版本。以下几处经常互相打架:
- canonical 指向的 URL 本身不可抓取,或者返回 404、5xx;
- 站内链接混着写,有的指向带参数版本,有的指向干净版本;
- 旧地址用 302 跳转,或者直接 404,而不是 301;
- 参数变体既没有 canonical 收口,也没有 robots 规则约束。
如果 canonical 指向的是一个已经被 noindex 的页面,信号会自相矛盾,最后往往是谁都不进索引。
按这个顺序自查
- 用日志确认 URL 有没有被抓取过,没有就先修可达性;
- 确认返回状态码是 200,且内容不是空壳;
- 关掉 JavaScript 查看源码,主内容是否还在;
- 和站内相似页面比一比,判断是否有独立价值;
- 检查 canonical、301 与 robots 规则是否互相冲突。
抓取解决的是“能不能看到”,收录解决的是“值不值得留”。两者之间隔着的,正是页面本身的质量与规范。
把这四道关当成发布前的常规检查,比事后反复提交更省时间。收录速度还受站点权重、抓取节奏等外部因素影响,很难精确控制;但能不能被抓到、能不能被读懂、信号是否清楚,这些是运营自己可以决定的。