很多站长排查收录问题时会盯着标题、关键词和内链,却很少问一句:蜘蛛抓走这份 HTML 之后,它认为哪一段是页面的主要内容?如果页面上导航、面包屑、侧栏推荐、底部标签把正文围在中间,蜘蛛就得自己判断“哪块才是正文”。这个判断一旦跑偏,页面就可能被当成低质量聚合页来处理。
蜘蛛拿到的是整页源码,不是渲染后的阅读视图
用户看到的是浏览器渲染后的结果,正文在首屏很显眼;蜘蛛先拿到的是原始 HTML,顺序自上而下。如果正文之前塞了几百行导航代码、几十个链接的推荐位,正文在源码里的位置就会很靠后,模板与内容的比值也会变得难看。
搜索引擎通常会尝试提取页面主体,把模板部分剥离。提取结果越接近你希望的正文,后续的主题理解和质量判断就越顺。提取失败、或者提取到一堆链接文字,问题往往不在“内容不够好”,而在结构没有把正文表达清楚。
模板占比过高会带来哪些影响
- 正文被稀释,页面主题不够集中,容易被判定为列表页或导航页。
- 同一套模板下大量页面主体内容相似,重复度上升。
- 蜘蛛对页面价值的预估降低,抓取频次和深度可能跟着变化。
- 抽取出的正文不完整,摘要和片段展示效果差。
让正文更容易被识别
- 把正文放在靠前的 DOM 位置。导航可以做,但不必把所有栏目、所有子菜单都铺在正文之前。能折叠的折叠,能用一层菜单解决的不要嵌套三层。
- 用有语义的标签承载主体。article、main、section 这类标签比一堆 div 更能表达结构;标题层级保持 h1 唯一,h2、h3 顺序下推,不要为了样式跳级。
- 控制正文内的链接密度。正文段落里适度引用内链没问题,但如果每段都插三四个链接,主体就很像推荐位。相关阅读统一放到正文之后。
- 把侧栏和推荐位与正文分开。结构上分隔清楚,别让侧栏代码夹在正文段落中间。渲染顺序和源码顺序不一致时,以源码顺序为准来考虑蜘蛛的感受。
- 减少纯装饰性的重复块。同一段说明文字、同一组标签云出现在全站每个页面底部,属于典型的模板噪声。
正文漂移:正文开头出现的不是正文
另一种常见情况是“正文漂移”:文章开头先放一段免责声明、作者介绍、更新时间说明,再接目录,再接三五个相关推荐,真正的第一段正文被推到很远的地方。抽取算法很可能把前面这些当成正文主体,于是页面的主题就变成了“本站声明”。
判断标准很简单:把页面上的导航、侧栏、页脚全部删掉,剩下的内容里,正文是不是排在最前面、占比是不是最大。如果不是,蜘蛛看到的很可能也不是。
一个可以照着做的小自查
- 关掉 CSS 直接看页面:正文是否紧跟在标题之后?
- 查看源码,数一数正文开始前有多少个链接?如果超过二三十个,值得调整。
- 用纯文本方式提取页面,看结果是否以正文开头、是否混入大量菜单文字。
- 对比同模板下的几个页面,提取出的主体内容差异是否明显。
这些调整不会让页面立刻被收录,也不保证排名变化,但它们把“这页到底在讲什么”表达得更清楚,减少的是蜘蛛判断时的歧义。收录和索引是后续环节,先把这一步做扎实,后面的问题才更容易定位。