网站收录

页面发布前的收录自检:上线前值得核对的几件事

不少收录问题其实在页面发布那一刻就埋下了。这份清单按“能不能被抓到、抓到的是不是你想要的那一版、内容值不值得进索引、上线后怎么观察”四步展开,帮你把 URL 可访问性、robots 误伤、canonical 指向、重复内容和渲染方式等问题在上线前就排查掉,减少事后反复返工。

网站收录

页面发布前的收录自检:上线前值得核对的几件事

多数收录问题不是发布之后才出现的,而是在发布那一刻就埋下了。URL 写错、robots 误伤、canonical 指偏、正文和站内其他页面高度相似——这些都能在上线前花几分钟发现。下面这份清单按“能不能被抓到、抓到的是不是这一版、值不值得进索引、上线后怎么观察”四步来走。

一、先确认这个 URL 能被发现

  • 站内有链接指向它。至少有一条来自相关性较高页面的内链,点击深度不要太深。完全没有内链的页面,只能靠外部链接或站点地图碰运气。
  • 直接访问返回 200。用不带登录态、不带 Cookie 的方式打开一次,确认没有被 302 到登录页、首页或错误页。
  • robots.txt 没有误伤。新目录、测试路径、临时规则很容易把整段路径一起屏蔽,改完规则最好用实际 URL 验证一次。
  • 需要的话放进 sitemap。站点地图不是收录保证,但它能让新 URL 更快进入抓取队列,尤其是内链较少的页面。

一个容易忽略的细节

如果同一内容存在多个入口,比如列表页带排序参数、带跟踪参数,或者大小写、尾斜杠写法不统一,先在发布前把主版本定下来,把其他入口统一指向它。等到被拆成好几个 URL 再回来收拾,成本高得多。

二、抓到的是不是你想要的版本

  • canonical 指向自己,或者明确指向真正的主版本,不要指向一个 404 或重定向地址。
  • 状态码语义正确。内容已经下架的页面不要继续用 200 承载,避免搜索引擎把它当成有效页面反复抓取。
  • 渲染方式确认过。如果正文依赖客户端渲染,确认关键内容在渲染后可见,而不是留一个空壳给蜘蛛。
  • 移动端和桌面端一致。同一 URL 在两端的正文差异过大时,索引里留下的那一份可能不是你想展示的。

三、内容层面值不值得进索引

抓取和收录是两件不同的事。抓取是读取页面,是否保留在索引里则取决于搜索引擎对页面价值的判断。索引的存储和检索都有成本,所以取舍是常态。发布前可以从几个角度自查:

  • 标题、H1 和首段是否在说同一件事,读者能不能一句话概括这个页面。
  • 和站内既有页面有没有大面积重复,参数页、变体页、聚合页尤其常见。
  • 正文是否有独立信息量,而不是一个列表加两三句占位说明。
  • 标题和摘要是否提供了区别于其他页面的信息,避免整站同一套模板文案。
一条经验:同一批新页面里只有个别没被收录,先看那一页和其他页的差异;如果整批都没动静,问题更可能出在目录层级、robots 规则或站点地图层面。

四、上线之后别急着动手

发布后一两天内,页面状态显示“已发现,尚未抓取”或“已抓取,尚未编入索引”都很常见,多数情况只是排队。这个阶段频繁改标题、改正文、反复提交,反而让状态来回跳动,也不利于判断真正的问题在哪。

更稳妥的做法是留一个观察窗口:先看服务器日志里有没有针对这个 URL 的抓取记录,再看索引状态有没有变化。如果确实有抓取但迟迟不进索引,再考虑是补内链、加内容,还是调整 canonical 或 robots 设置。

一份可执行的核对顺序

  1. 能否从站内链接到达,内链是否相关。
  2. 直接访问是否返回 200,是否被 robots.txt 放行。
  3. canonical 与状态码是否指向正确的主版本。
  4. 标题、正文是否与站内其他页面明显区分。
  5. 发布后观察抓取记录和索引状态,再决定是否动手调整。

把这五步固定成发布流程的一部分,能让很多收录问题在发生之前就被挡掉,剩下的才交给时间和搜索引擎的判断。