网站收录

站内页面数与索引量对不上:先建立一份应收录基线再比对

站内页面数和索引量对不上,往往是统计口径不同造成的。本文给出一个可复用的做法:先定义应收录基线,把参数页、重复地址和该保留的内容页分开,再按多收录与少收录两个方向分类比对,最后按类型决定是收敛 URL 还是补内链入口。

网站收录

站内页面数与索引量对不上:先建立一份应收录基线再比对

做站点运营的人常会盯着两个数字:站内实际能打开的页面数,和搜索结果里显示的索引量。这两个数字几乎从来不会相等,差出几倍甚至几十倍都不奇怪。问题不在于数字本身,而在于你无法判断这个差距是正常的,还是有一批页面本该被收录却没有,又或者有一批不该存在的地址正在占用索引位置。要回答这个问题,先把“应收录基线”建出来。

为什么两个数字天生对不上

索引量是搜索引擎侧的估算值,更新有延迟,统计口径也不完全对等;站内页面数则取决于你怎么数——数据库里有多少条记录、后台有多少篇已发布内容、还是爬虫实际能访问到多少个返回正常状态的地址。三种数法能差出好几倍。所以第一步不是去解释差距,而是先确定拿什么去比。

第一步:定义应收录基线

基线指的是:你希望被搜索引擎发现并纳入索引的那部分 URL。它不是全站所有 URL,而是筛掉噪声之后的结果。常见判断可以按下面三条来梳理:

  • 应当纳入:独立的内容详情页、有独立检索价值的栏目页、承载唯一内容的分页或聚合页。
  • 不应纳入:站内搜索结果页、带排序或筛选参数的地址、测试与预览地址、重复的 URL 变体(大小写、尾斜杠、跟踪参数)。
  • 需要单独决策:分页、标签页、作者页、归档页。它们不是天然该收或不该收,取决于是否有独立内容与内链价值。

把这三类分开记录,基线才有意义。否则“少了三百个页面”这种结论,很可能只是把参数页算进去了。

第二步:把基线变成可核对的清单

口径确定之后,尽量让它可复现,而不是每次凭印象重来。一个可用的流程是:

  1. 从站点地图、数据库或后台导出全部 URL,形成主清单。
  2. 按上面的三类规则打标签,剔除明确不该收录的地址。
  3. 对保留的 URL 做一次可访问性抽检,确认返回状态正常、内容不是空壳。
  4. 记录清单生成时间。后续比对必须使用同一口径的清单,否则差异无法解释。

清单不必做到百分之百全量,但抽样规则要固定,比如按栏目分层各抽一部分,这样每次结果才具备可比性。

第三步:分类比对差异

拿到基线和索引数据之后,差异通常落在两个方向,处理方式完全不同。

索引量多于基线

说明有一批你没打算让它进索引的地址被收录了。常见来源是参数组合、站内搜索、多域名或多协议入口、历史遗留的旧地址。这时要做的不是逐个删页面,而是回到 URL 生成源头收敛,再对已经存在的那部分用规范标签或状态码处理。

索引量少于基线

说明有一批本该被收录的页面没有进入索引。这时要把“没收录”再拆开看:是没被发现、被发现但没抓取、抓取了但没编入索引,还是编入过又被移出。这几类的排查方向差异很大——发现环节看内链和站点地图,抓取环节看服务器日志与响应速度,编入环节则要看页面质量与重复程度。

第四步:按类型决定动作

  • 多余的参数地址:从链接生成处收敛,配合规范标签或抓取规则。
  • 重复的内容页:确定主版本,其余做规范指向或合并。
  • 长期不收录的弱内容页:先判断是否值得保留,不值得就合并或下线。
  • 有独立价值但收录慢的页面:优先补内链入口,而不是反复提交。
把“索引量对不上”拆成“哪些该收没收、哪些不该收却收了”两个问题,比反复提交地址或猜测算法更有效。数字本身不解决问题,口径才解决。

最后提醒一点:索引数据更新有延迟,刚上线或刚改版的站点在几周内数字波动都属于正常范围。核对周期建议拉到两周以上,避免把延迟当成问题去处理。