抓取和收录是两件事:蜘蛛来过、返回 200,只说明这个地址能被访问;是否进索引,还要看页面本身能不能被判断为“值得留下的一个结果”。这个判断没有公开的分数,但从页面上能观察到一些线索。把页面质量当作上线前的自查项,比事后盯着收录数字猜原因要省事。
一、正文在页面里占多大比重
一个页面的 HTML 里通常混着导航、侧栏、推荐位、页脚、版权、广告位。搜索引擎要把正文从这些内容里分离出来,噪声越多,判断越困难。
- 把页面的可见文字复制出来,去掉导航和页脚,剩下的是不是主要信息;
- 正文是不是长到足以独立回答一个问题,而不是一句话加一堆按钮;
- 列表页、聚合页有没有自己的说明文字,还是只有标题的堆叠。
如果正文只有两三行,其余全是链接和模块,这个页面更像一个入口而不是一个结果。入口可以有,但不必都进索引。
二、模板重复的部分会不会盖过正文
同一套模板生成几百个页面时,页面之间相同的段落会非常多。相同的部分越多,页面之间可区分的信号越少。
- 页面上有没有大段全站一致的介绍文字,出现在每个页面同样的位置;
- 不同的页面,前几屏内容是不是几乎一样,差别只在标题里换了一个词;
- 结构化字段有没有填满,还是大量留空。
三、和站内已有页面是否高度近似
重复不只发生在不同站点之间,更常见的是自己站内。同一件事写了两三个版本、同一批数据按不同参数展开成很多地址,都会让索引面临“留哪个”的问题。
检查方式:抽几个页面,把正文开头一段放进站内搜索或搜索引擎加 site: 限定,看有多少地址返回几乎相同的文字。如果同一个意思对应几十个地址,先想清楚哪个是主版本,再用规范标签、内链和站点地图把信号集中到一个地址上。
四、页面给出的信息是否完整
- 标题能不能说清这个页面到底讲什么,而不是品牌名加一串关键词;
- 有没有一段摘要或导语,让阅读者在不点开之前就知道内容;
- 更新时间、作者、来源这类信息是否真实,而不是每次都自动刷新。
五、上线前的自查清单
- 去掉模板后,正文是否仍然成立;
- 站内是否存在明显近似页面,主版本是否唯一;
- URL 是否可以长期稳定,不随参数或会话变化;
- 页面是否能在不执行脚本的情况下看到主要内容;
- 该页面对用户是否有明确用途。
六、什么时候选择不收录
并不是所有页面都要进索引。筛选结果页、内部搜索页、登录后的页面、内容极少的临时页,用 noindex 明确排除,比让它们挤在索引里再被淘汰更干净。要注意 noindex 和 robots.txt 管的是不同环节:前者针对收录,后者针对抓取,不要用错。
收录不是奖励,而是搜索引擎认为这个地址值得作为一个结果保留。质量自查的目的不是讨好某个算法,而是让每个能被访问的地址都清楚地说出自己是什么、有什么用。