多数收录问题不是发布之后才出现的,而是在发布那一刻就埋下了。URL 写错、robots 误伤、canonical 指偏、正文和站内其他页面高度相似——这些都能在上线前花几分钟发现。下面这份清单按“能不能被抓到、抓到的是不是这一版、值不值得进索引、上线后怎么观察”四步来走。
一、先确认这个 URL 能被发现
- 站内有链接指向它。至少有一条来自相关性较高页面的内链,点击深度不要太深。完全没有内链的页面,只能靠外部链接或站点地图碰运气。
- 直接访问返回 200。用不带登录态、不带 Cookie 的方式打开一次,确认没有被 302 到登录页、首页或错误页。
- robots.txt 没有误伤。新目录、测试路径、临时规则很容易把整段路径一起屏蔽,改完规则最好用实际 URL 验证一次。
- 需要的话放进 sitemap。站点地图不是收录保证,但它能让新 URL 更快进入抓取队列,尤其是内链较少的页面。
一个容易忽略的细节
如果同一内容存在多个入口,比如列表页带排序参数、带跟踪参数,或者大小写、尾斜杠写法不统一,先在发布前把主版本定下来,把其他入口统一指向它。等到被拆成好几个 URL 再回来收拾,成本高得多。
二、抓到的是不是你想要的版本
- canonical 指向自己,或者明确指向真正的主版本,不要指向一个 404 或重定向地址。
- 状态码语义正确。内容已经下架的页面不要继续用 200 承载,避免搜索引擎把它当成有效页面反复抓取。
- 渲染方式确认过。如果正文依赖客户端渲染,确认关键内容在渲染后可见,而不是留一个空壳给蜘蛛。
- 移动端和桌面端一致。同一 URL 在两端的正文差异过大时,索引里留下的那一份可能不是你想展示的。
三、内容层面值不值得进索引
抓取和收录是两件不同的事。抓取是读取页面,是否保留在索引里则取决于搜索引擎对页面价值的判断。索引的存储和检索都有成本,所以取舍是常态。发布前可以从几个角度自查:
- 标题、H1 和首段是否在说同一件事,读者能不能一句话概括这个页面。
- 和站内既有页面有没有大面积重复,参数页、变体页、聚合页尤其常见。
- 正文是否有独立信息量,而不是一个列表加两三句占位说明。
- 标题和摘要是否提供了区别于其他页面的信息,避免整站同一套模板文案。
一条经验:同一批新页面里只有个别没被收录,先看那一页和其他页的差异;如果整批都没动静,问题更可能出在目录层级、robots 规则或站点地图层面。
四、上线之后别急着动手
发布后一两天内,页面状态显示“已发现,尚未抓取”或“已抓取,尚未编入索引”都很常见,多数情况只是排队。这个阶段频繁改标题、改正文、反复提交,反而让状态来回跳动,也不利于判断真正的问题在哪。
更稳妥的做法是留一个观察窗口:先看服务器日志里有没有针对这个 URL 的抓取记录,再看索引状态有没有变化。如果确实有抓取但迟迟不进索引,再考虑是补内链、加内容,还是调整 canonical 或 robots 设置。
一份可执行的核对顺序
- 能否从站内链接到达,内链是否相关。
- 直接访问是否返回 200,是否被 robots.txt 放行。
- canonical 与状态码是否指向正确的主版本。
- 标题、正文是否与站内其他页面明显区分。
- 发布后观察抓取记录和索引状态,再决定是否动手调整。
把这五步固定成发布流程的一部分,能让很多收录问题在发生之前就被挡掉,剩下的才交给时间和搜索引擎的判断。