做收录核查时,很多人先看 URL 写法、内链入口、canonical 是否规范,这些确实重要。但还有一类问题常被忽略:页面本身能被“拿走”的独有信息太少。同一套模板下,几十上百个页面除了标题和几个字段几乎一样,收录结果自然会出现有的进了、有的没进。
什么是正文占比
这里说的正文占比,不是简单的字数统计,而是把全站统一的模板部分剥掉之后,页面还剩多少独有内容。
通常需要先减掉的部分包括:
- 导航、面包屑、侧栏
- 页脚、备案信息、全站友情链接
- 推荐位、热门榜、相关文章模块
- 广告位、登录提示、Cookie 提示
剩下的才是这个 URL 独有的信息。如果这部分只有一两句话,而模板部分占据了大半屏幕,那么页面在抓取和索引阶段可选的价值就很低。
低正文占比页面常见的收录表现
- 收录时间明显比同站其他页面长,甚至长期停留在“已发现”状态
- 同一模板的页面只被收录一部分,另一些迟迟不进来
- 索引里展示的摘要抓的是推荐位或页脚文字,而不是页面主体
- 页面更新后,索引版本长期不刷新
这些表现本身不是处罚,更接近资源分配的结果。面对海量 URL,抓取和索引容量会被优先给到信息增量更高的页面。页面之间越相似,这种筛选就越明显。
一套可执行的自查顺序
- 关掉 CSS 和 JS,直接看纯文本。如果一眼看不出这个页面在讲什么,说明主体信息不足。
- 把导航、页脚、侧栏在编辑器里删掉,数一数剩下多少字,以及这些字是否真的只属于这个 URL。
- 抽三到五个同模板页面并排比较,标出它们共有的段落。共有比例越高,被当作近似页面的概率越大。
- 检查主内容是否依赖 JS 渲染。模板文字在 HTML 里、主体内容在脚本里,是很容易被漏掉的情况。
- 记录这些页面在索引报告里的状态,连续观察两到三周,看是否有稳定规律,而不是只看某一天的数据。
可以尝试的处理方向
- 补独有信息:参数说明、适用场景、常见问题、更新时间、数据来源,这些内容对用户有用,也确实增加了页面的信息增量。
- 减少重复模块:全站推荐位、热门榜可以保留在少数入口页,不必每个页面都塞一份。
- 该合就合:内容高度重叠的页面,合并成一个更完整的页面,通常比保留十个半成品更容易被理解。
- 该关就关:筛选参数页、空结果页、内容极少的占位页,可以考虑用 noindex 或 robots.txt 控制,但要先确认它没有承接有价值的搜索需求。
几个容易走偏的地方
- 把正文占比等同于字数。堆三百字同义反复,并不会提高页面价值。
- 靠增加相关推荐来“填满”页面。推荐位是导航,不是内容。
- 看到一个页面没收录就立刻删。先判断它是否承接了真实的搜索需求,再决定保留、补充还是下线。
收录是筛选后的结果,不是对页面的奖励。与其反复猜测算法,不如先让每个 URL 都有自己值得被单独保留的理由。