讨论收录时,很容易把注意力放在单个页面上:标题写没写、关键词有没有、字数够不够。但搜索引擎面对的从来不是孤立的一页,而是整个站点的页面集合。当站内有大量内容相近、信息量又低的页面时,判断标准就变成了对比——这一页和其他页比,有没有留下的必要。正文太薄、主要靠模板撑起来的页面,通常就在这一步被跳过。
一、哪些页面容易被认为是“薄”
- 列表页只有一串标题,每条没有摘要、没有说明,翻好几页也看不出差别
- 聚合页把站内其他文章的标题和链接堆在一起,正文部分几乎都是重复的导航
- 分类页只有一两条内容,或者长期空着
- 商品页、服务页只有参数表和一句简介,没有适用场景,也没有常见问题
- 由模板批量生成的页面,除了名称和几个字段,其余部分完全一致
要注意,“薄”不是单纯按字数算的。一页三百字但把一个问题讲清楚了,往往比一千五百字里有一千二百字是页头页尾导航要厚实得多。
二、索引为什么会跳过它们
索引空间有限,抓取和索引系统一直在做取舍。几个常见的判断逻辑:
- 可替代性高:站内已经有讲同一件事更完整的页面,薄页面提供不了额外信息
- 正文占比低:把模板、导航、推荐位去掉之后,真正属于这个 URL 的内容很少
- 相似度过高:几十个页面只是字段不同,在模型上几乎等价,留一个就够了
- 缺少稳定入口:内链少、位置深,即使被抓到,也容易被归到低优先级
这些判断是叠加的。单看一项可能不致命,同时命中两项以上,页面长期停在“已抓取,尚未编入索引”就很常见。
三、动手之前,先做一次抽样自检
不要一上来就批量 noindex,先抽二十到五十个可疑 URL,按下面几步看一遍:
- 用阅读模式或纯文本视图打开,看去掉模板之后还剩多少内容
- 把同类的三五个页面放在一起对比,看差异是不是只有名称、时间、价格
- 检查有哪些内链指向它们,入口在导航里还是埋在角落
- 回想一下:用户会为了这个页面的内容专门搜索并点进来吗
经过这一步,通常会分成三堆:值得补内容的、应该合并的、确实该让出位置的。
四、处理的先后顺序
顺序很重要,先做能保留价值的动作,再做减法。
- 补:对有价值但写得太少的页面,补上说明、适用场景、常见问题,让它比同类页更完整
- 合:内容本来就重复的,合并到一个主页面,把其他 URL 重定向或 canonical 指过去
- 收敛:确实不需要独立存在的,用 canonical 或调整内链,把信号集中到主版本
- 退出:确认没有保留价值的,再考虑 noindex 或删除
noindex 不等于删除。页面仍然可以被访问,只是不再作为索引候选;而且已经进入索引的版本需要一段时间才会退出,期间在搜索结果里看到旧页面是正常的。
五、几个容易踩的点
- 批量 noindex 之前,先确认没有重要页面靠这些 URL 传递内链
- 列表页有几页是正常分页,不要因为“内容重复”把整个分页体系一起关掉
- 不要把 noindex 当成掩盖内容问题的办法,该补的内容迟早要补
- 处理之后留一份记录,过几周再抽样看索引状态,避免误伤
回到本质:索引留下的是“这个 URL 在站点里扮演了什么独特角色”。模板能帮你快速生成页面,但决定收录的,始终是页面本身有没有提供别处给不了的信息。