收录问题常被归因于蜘蛛不来,但日志显示抓取正常时,问题往往在页面本身。页面质量不是抽象分数,而是搜索系统判断这个 URL 是否值得单独保留一个索引版本。核对时可以先看正文,再看页面差异,最后看时间与更新信号。
一、先确认蜘蛛抓到的正文是否完整
在讨论质量之前,先确认抓取层面没有明显障碍。对照抓取日志、页面源码和缓存版本,看正文是否直接出现在 HTML 中,还是依赖 JavaScript 渲染、登录状态或用户交互才出现。如果抓到的只是导航、页脚和版权信息,后面的质量判断就失去了基础。
- 正文在 HTML 源码中是否可读;
- 关键段落是否被 CSS 隐藏或放在折叠面板里;
- 是否被 robots.txt、meta robots 或 X-Robots-Tag 误拦。
抓取到的正文不完整时,先修可访问性,不要急着改 canonical 或加 noindex。
二、模板重复:多个 URL 共用一套骨架
列表页、筛选页、标签页和商品分类页最容易出现这种情况。判断方法:从同一模板下抽取若干 URL,去掉导航、侧栏和页脚,比较正文主体。如果差异只有标题和一两行列表,搜索系统可能只保留其中一个版本,其余被当作重复内容处理。
- 同一模板下抽样 5 到 10 个 URL;
- 比较正文主体字数与独有段落;
- 查看这些 URL 是否有独立的搜索需求。
处理方向可以分三种:有独立需求的页面保留,并补足独有信息;没有独立需求但需要用户访问的,合并到主列表或加 noindex;不要用 canonical 把内容明显不同的页面强行指向同一个 URL,那样容易让索引选择与预期不一致。
三、正文薄弱:有内容但撑不起一个索引版本
薄弱不等于字数少。工具页、短问答、参数页可能很短但有明确用途。判断时看三点:是否回答了标题承诺的问题;是否比搜索结果里已有内容多出信息;是否只是把关键词重复几遍。如果三者都不满足,这个 URL 很难被单独索引。
- 标题与正文是否一致;
- 是否有可验证的数据、步骤或结论;
- 是否与站内其他页面高度相似。
处理顺序上,先补独有信息,再考虑合并到更完整的页面。如果页面只是为覆盖关键词而建,删掉或合并通常比硬撑更合适。
四、内容陈旧:时间信号与页面状态
有些页面质量不差,但长期未更新,索引可能保留旧版本,或降低抓取频率。核对时看页面上的时间是否真实、更新后 URL 是否变化、旧版本是否被重定向或继续保留。
- 更新时间与正文实际修改是否一致;
- 重要页面更新后是否有内链入口;
- 过时页面是保留、改版还是返回 410。
不要为了显得新鲜而改时间戳。搜索系统会综合页面变化、外链和用户行为判断。
五、核对顺序:先改可抓取,再谈质量
- 状态码与抓取正常;
- 正文可被抓到;
- 同模板页面差异足够;
- 有独立需求则保留,否则合并或收口;
- 更新后观察抓取频率与索引版本变化。
页面质量与收录之间没有一键开关。把模板重复、正文薄弱、内容陈旧分开处理,比笼统地优化质量更容易看到变化。