“这个页面收录了吗?”很多团队的默认动作是打开搜索框敲一下 site 命令。它方便,但只适合当线索,不适合当结论。把 site 查询结果直接等同于索引库,是收录排查里最常见的一类偏差。
site 查询到底在回答什么
site 查询返回的是一组与查询条件相关的估算结果,不是索引数据库的快照。它通常只列出搜索引擎认为值得在这次查询里展示的页面,数量是粗略值,翻到后面还会出现缺漏、重复或顺序错乱。
- 查询结果会受地域、语言、个性化因素影响,换网络环境可能看到不同的页面。
- 权重低、层级深、内容单薄的页面,即使已经在索引里,也未必出现在结果前几页。
- 被判定为重复或备用版本的 URL,可能被折叠,改由规范版本出面展示。
所以,site 查询查不到,只能说明“这次没展示出来”,不能直接推出“没被收录”。
更接近事实的几种口径
- 后台索引报告:会区分“已编入索引”“已发现但未编入索引”“已抓取但未编入索引”,另有重复网页、备用网页等状态,适合看整体分布。
- URL 检查工具:针对单条 URL 查询,能看到最近一次抓取时间、规范版本判定以及是否在索引中,适合抽样核对。
- 服务器日志:能确认“有没有被抓”,但不能证明“有没有进索引”。
容易踩的几种误判
- 页面其实被收录了,但规范版本指向另一条 URL。查询原地址查不到,问题不在收录,而在 URL 归并。
- 页面确实在索引里,只是因为搜索词不匹配而不展示,这属于排序与选择问题,不是索引问题。
- 后台显示“已抓取但未编入索引”,这条 URL 被抓过,只是没有通过后续评估,把它当成“没抓”会做错动作。
- 参数页、分页页、筛选页的状态与主页面并不同步,混在一起统计会让整体数字失真。
抓取与收录不是一回事
抓取解决的是“搜索引擎有没有把内容读走”,收录解决的是“读完之后要不要放进索引并允许展示”。前者受 robots 协议、服务器响应、内链入口影响,后者还要看内容是否重复、是否满足基本质量要求、是否有明确的规范地址。日志里满屏的抓取记录,只能说明内容被读到了。
建议的自查顺序
- 按模板选一批代表性 URL:首页、栏目页、内容页、分页、参数页各取几条。
- 对照后台索引报告,把状态分类记录,不要只看总数。
- 用 URL 检查工具逐个查看规范地址、最近抓取时间与索引状态。
- 核对页面本身是否有清晰的标题、正文、内链入口与规范标记。
- 把结果留档,隔两到四周再看趋势,单次结果波动参考价值有限。
收录状态由搜索引擎判断,运营能做的是把信号讲清楚:让重要页面容易被发现、内容不重复、规范地址稳定,而不是反复催结果。
site 查询可以留作快速感受,但判断收录时,用后台报告加 URL 检查的组合口径更稳妥。把“查不到”拆成没被抓、抓了没编入、编入了但换了地址、编入了但不展示这几种情况,后续的排查方向会清晰很多。