很多站点排查收录问题时,第一反应是“蜘蛛没来”。但把日志翻出来看,蜘蛛其实来过,甚至抓了好几遍,页面依然停在“已抓取,未编入索引”。这时候问题往往不在抓取环节,而在页面本身的质量判断上。
抓取和收录是两道关
抓取解决的是“蜘蛛能不能拿到这个 URL 的内容”,收录解决的是“拿到之后,值不值得放进索引、能不能参与检索”。前者看的是可访问性、robots 规则、状态码、渲染方式;后者看的是内容本身有没有独立价值,以及它在整个站点里是不是重复的。
所以同一个页面可能在抓取侧完全正常——返回 200,正文能渲染,内链也能进来——却依然进不了索引。这不是蜘蛛没干活,而是在收录这一步被过滤掉了。
哪些因素会影响“页面质量”的判断
正文占比
把页面 HTML 拉出来,去掉导航、页脚、侧栏、广告位、推荐位之后,还剩下多少真正属于这个页面的内容?如果正文只有两三行,其余全是模板和链接,这种页面在质量判断里通常不占优势。常见于商品无描述页、空标签页、只放了几句话的资讯页。
模板重复度
批量生成的页面,正文换几个词,模板一模一样,很容易被归到相似内容里。这里要区分两种重复:一种是同一个页面被多个 URL 访问,靠 canonical 解决;另一种是多个页面内容高度相似,要靠合并或收敛解决。后者不是 canonical 能修的。
内容能否回答一个具体问题
判断标准可以很朴素:这个页面对一个真实用户有没有用。如果它只能靠站内其他页面拼凑信息,或者只是关键词的排列组合,那它在索引里也很难有位置。
自查顺序
- 先确认页面能被抓取:状态码 200,没有被 robots.txt 挡住,没有 noindex。
- 看渲染后的 HTML 里有没有正文,而不是只看源码里的占位符。
- 把模板元素去掉,估算正文的实际字数与信息密度。
- 和站内同类页面做对比,看是否存在大段雷同。
- 确认这个页面有没有独立入口,还是只能从某个列表深处点到。
几个常见误区
- 把“提交了 sitemap”当成“会被收录”。sitemap 只解决发现和抓取提示,不解决质量判断。
- 以为加长字数就能过。凑字数带来的低质内容,和短内容一样难处理。
- 看到“已抓取未编入索引”就反复提交。重复提交不会改变页面本身的判断结果,先把内容改到位再说。
- 把模板页和正文页混在一起评估。两者应该分开看,模板页本来就不该期待收录。
处理思路
对确认低质的页面,优先做的是收敛,而不是硬推。能合并的合并,能补充的补充;既没有独立价值又不打算维护的,让它退出索引往往比留在索引里更省事。站点整体质量提升之后,新页面的收录表现通常也会更稳定一些。
页面质量不是一个开关,而是相对的:同一篇内容,放在一个整体质量较高的站上,和放在一个由大量模板页支撑的站上,后面的结果可能完全不同。
最后提醒一句,收录受很多因素影响,包括站点整体情况、竞争程度和搜索需求,没有人能保证某个页面一定进入索引。能做的只是把可控的部分——可抓取、可读、有独立价值——做到位。