很多站长把“蜘蛛来过”当成“收录成功”,日志里看到 200 状态码就安心了。但从抓取到进入索引之间,还有一道筛选:搜索引擎需要判断这个页面值不值得占用索引空间、值不值得在结果里占一个位置。这一步通常不会有明确通知,只能从页面本身和站点整体状态去推断。
抓取解决的是“能不能拿到”,收录解决的是“值不值得留”
抓取是技术层面的动作:蜘蛛顺着链接过来,把 HTML 拿回去。收录更接近一层筛选判断:这份内容相对已有内容有没有增量,页面能否稳定访问,主体内容能否被识别。两者用的不是同一套标准,所以会出现抓得到、进不去的情况。
理解这一点之后,很多“为什么没收录”的问题会变得具体:不是蜘蛛找不到,而是找到之后没有通过筛选。
索引选页时通常会关注的几个点
- 主体内容是否明确:正文能被提取出来,而不是被导航、推荐位、广告和评论区层层包住。
- 是否与站内其他页面高度重合:同一篇文章出现在多个栏目、多个标签下,算法需要挑出一个代表版本。
- 页面是否提供独立信息:筛选组合页、自动聚合页、只有一两段话的占位页,往往属于“存在但没必要”。
- 站点整体质量:一个站点里如果堆了大量低质页面,同类页面的收录概率会一起被拉低。
- 可访问性与稳定性:频繁超时、间歇性返回 5xx、内容随刷新变化,都会让页面难以稳定进入索引。
容易被挡在门外的几种页面
薄内容页
标题很长、正文只有两三句,其余全是模板文案。这类页面单独看不算错,但放在索引里没有可比较的价值,往往长期停留在已发现状态。
自动生成页
由规则批量拼出来的页面,比如城市加关键词、标签组合、站内搜索结果的落地地址。它们数量大、彼此相似,通常只有极少数会被收录,其余会持续消耗抓取机会。
内容雷同页
同一篇内容有 PC 版、移动版、打印版、被转载版等多个地址。如果没有明确的规范地址指向,索引里要么反复替换,要么干脆都不稳定。
自查顺序
- 先确认页面返回 200,且正文确实在初始 HTML 里,而不是靠脚本后补。
- 换几个入口访问,确认 URL 唯一,参数、大小写、结尾斜杠的处理一致。
- 看站内有没有别的页面承载相同内容,确认哪个应该是主版本。
- 检查正文区是否被模板内容稀释,必要时调整页面结构。
- 最后判断这个页面本身值不值得单独存在。如果答案是否定的,不必硬推。
站点层面能做的收敛
比起逐页去催收录,不如从源头减少低质页面的产生:把自动聚合、筛选组合、分页序列控制在合理范围;给真正有独立价值的页面更清晰的内链入口;对同一主题的多个版本指定规范地址;对没有长期价值的页面及时清理或设为不可索引。
这样做的直接效果是让索引里留下的页面更整齐,间接也会影响新页面的进入速度——索引空间和抓取机会都是有限资源,用在哪儿是有取舍的。
收录不是提交之后的必然结果,而是页面在内容、重复度和可访问性上综合过关之后的产物。把注意力放回页面本身,通常比反复研究提交渠道更有用。