网站收录

页面要过四道关才谈得上收录:抓取、渲染、内容与规范

收录常被当成提交动作的结果,实际上它更像是页面依次满足若干条件后的产物。本文把收录拆成抓取、渲染、内容质量与规范信号四道关,给出每道关的常见卡点和自查顺序,帮助运营判断问题出在可达性、可读性还是页面本身的价值。

网站收录

页面要过四道关才谈得上收录:抓取、渲染、内容与规范

收录经常被当成一个“提交动作”的结果:提交 sitemap、点一下提交入口、或者让蜘蛛多来几次,页面就该进索引。实际工作中更常见的情况是,页面本身还没满足进入索引的条件,提交再多次也只是让 URL 被反复发现。把收录倒推一步,可以看成页面需要依次过四道关。

第一关:抓得到

抓取是收录的前提,但抓得到并不等于收录。常见的卡点包括:

  • robots.txt 里对整站或某个目录写了 Disallow,URL 根本进不了抓取队列;
  • 页面只存在于 sitemap,站内没有任何内链指向它,属于孤岛页;
  • 服务器对蜘蛛返回 5xx 或长时间超时,抓取被中断;
  • 链接写在 JavaScript 里且需要点击才生成,蜘蛛拿不到这个 URL。

自查时可以先看服务器日志里这个 URL 有没有出现抓取记录。没有抓取记录,先解决可达性问题,不用急着讨论内容质量。

第二关:抓到了能读懂

渲染问题往往比想象中普遍。页面在浏览器里看起来完整,但服务器返回的 HTML 里只有框架和占位符,主内容要靠脚本请求后再插入。这种情况下,蜘蛛看到的和用户看到的可能不是同一个页面。

几个常见表现

  • 正文、价格、规格等关键信息由接口异步返回,源码里没有;
  • 内容被登录遮罩、弹窗或“展开更多”挡住,默认不展示;
  • 图片形式的正文,没有可读的文字描述;
  • 同一份内容靠前端路由切换,多个 URL 返回同一个空壳 HTML。

处理方向通常是把关键内容做服务端渲染或静态输出,至少保证首屏主要文本在源码里可读。

第三关:读懂了值不值得进索引

内容质量是相对的,判断标准是“这个页面和站内其他页面比,有没有独立存在的理由”。以下几类页面容易被抓取,但不容易长期留在索引里:

  • 正文只有一两句话,靠模板和无关模块撑起整个页面;
  • 与站内其他页面高度相似,只是换了参数或标题;
  • 纯聚合列表,没有自己的说明、筛选逻辑或补充信息;
  • 内容主体由商品参数表、用户评论等重复结构拼接而成。

这类页面不一定被判为作弊,但通常会被归入“可以抓取、不必保留索引”的一类。处理方式可以是合并同类页面、补充独立内容,或者用 noindex 明确表达态度,而不是放着让它反复被判断。

第四关:规范信号是否一致

当同一份内容存在多个 URL 版本时,蜘蛛需要明确知道哪个是主版本。以下几处经常互相打架:

  • canonical 指向的 URL 本身不可抓取,或者返回 404、5xx;
  • 站内链接混着写,有的指向带参数版本,有的指向干净版本;
  • 旧地址用 302 跳转,或者直接 404,而不是 301;
  • 参数变体既没有 canonical 收口,也没有 robots 规则约束。

如果 canonical 指向的是一个已经被 noindex 的页面,信号会自相矛盾,最后往往是谁都不进索引。

按这个顺序自查

  1. 用日志确认 URL 有没有被抓取过,没有就先修可达性;
  2. 确认返回状态码是 200,且内容不是空壳;
  3. 关掉 JavaScript 查看源码,主内容是否还在;
  4. 和站内相似页面比一比,判断是否有独立价值;
  5. 检查 canonical、301 与 robots 规则是否互相冲突。
抓取解决的是“能不能看到”,收录解决的是“值不值得留”。两者之间隔着的,正是页面本身的质量与规范。

把这四道关当成发布前的常规检查,比事后反复提交更省时间。收录速度还受站点权重、抓取节奏等外部因素影响,很难精确控制;但能不能被抓到、能不能被读懂、信号是否清楚,这些是运营自己可以决定的。