网站收录

页面能抓取却不进索引:先做一轮页面质量自检

许多页面能被蜘蛛抓取,却长期停在“已发现”或抓取后不入索引。问题往往不在 robots 或 sitemap,而在页面质量本身。本文给出一套可操作的自检清单,从正文完整度、模板占比、内容独特性、用户价值等维度判断页面是否达到可索引门槛。

网站收录

页面能抓取却不进索引:先做一轮页面质量自检

页面能被抓取,不代表会被索引。抓取只是把 HTML 取回,索引还要经过质量评估。很多页面长期停在“已发现”或抓取后没有进入索引,原因不在 robots 或 sitemap,而在页面质量本身。

先分清抓取与索引

抓取是蜘蛛访问 URL 并下载内容;索引是搜索引擎判断这个页面是否值得放进可供检索的库。两者中间有一道质量门槛。低质、重复、信息量不足的页面可能被正常抓取,但不会进入索引。因此,当发现页面不收录时,先看日志确认是否抓取过,再回到页面本身做质量自检。

页面质量自检的五个维度

1. 正文完整度

把页面当作用户第一次访问来看:核心内容是否直接可见?如果正文依赖点击、展开、登录或滚动加载才能出现,抓取到的 HTML 里可能只有框架。可以抽取纯文本,看正文段落是否完整、字数是否过少、关键信息是否在首屏附近。

2. 模板占比

导航、页脚、侧栏、推荐位、相关阅读、评论模板都算模板内容。如果这些区块加起来远多于正文,页面容易被判定为低质。自检时可以把页面 HTML 按区块拆分,估算正文占整个可见文本的比例。正文占比过低的页面,优先考虑精简模板或合并内容。

3. 内容独特性

同一站点内,不同筛选参数、排序方式、分页组合生成的页面,往往只有少数条目不同。这类页面即使能抓取,也可能因为近似重复而不被索引。可以把标题、正文前几段、主要列表项做分组,找出高度相似的一组页面,再决定保留哪些、合并哪些、收敛哪些。

4. 用户价值

问三个问题:这个页面是否在回答一个明确的问题?标题与正文是否一致?用户看完能否得到可操作的信息?如果页面只是聚合了少量信息,或者标题承诺的内容正文没有提供,质量分通常不会高。

5. 站点整体质量

索引是站点级别的判断。如果大量页面都是薄内容、重复内容或空壳页,搜索引擎会降低对整站的抓取与索引意愿。反过来,当低质页面被收敛后,优质页面的抓取和索引表现可能改善。所以自检不能只看单个页面,也要看低质页面在整站中的占比。

自检之后怎么处理

  • 提升:补充正文、增加独特信息、把关键内容放到可直接抓取的位置。
  • 合并:把近似重复的页面合并到一个主页面,用规范标签或重定向处理旧 URL。
  • 收敛:对没有独立价值的筛选页、分页、空壳页,用 noindex 或 robots 规则减少索引压力。
  • 观察:调整后不要立刻判断收录结果,按页面类型给一个观察窗口,记录抓取频次和索引状态变化。

记录与观察窗口

做质量自检时,建议建一张表:URL、页面类型、抓取时间、抓取状态、索引状态、正文占比、处理动作、观察日期。按周或按双周对比。不要因为一两天没变化就反复修改,频繁改动反而会干扰判断。

收录不是单一开关,而是页面质量、站点整体表现和抓取配额共同作用的结果。先把质量门槛看清楚,再决定是优化、合并还是收敛。