很多站長排查收錄問题时會盯着标题、關鍵詞和内鏈,却很少問一句:蜘蛛抓走這份 HTML 之後,它認為哪一段是頁面的主要内容?如果頁面上導航、面包屑、侧栏推荐、底部标簽把正文围在中間,蜘蛛就得自己判断“哪块才是正文”。這個判断一旦跑偏,頁面就可能被当成低质量聚合頁来處理。
蜘蛛拿到的是整頁源碼,不是渲染後的阅讀视图
用戶看到的是浏览器渲染後的结果,正文在首屏很顯眼;蜘蛛先拿到的是原始 HTML,顺序自上而下。如果正文之前塞了几百行導航代碼、几十個連結的推荐位,正文在源碼里的位置就會很靠後,模板與内容的比值也會變得难看。
搜尋引擎通常會尝试提取頁面主体,把模板部分剥离。提取结果越接近你希望的正文,後續的主题理解和质量判断就越顺。提取失敗、或者提取到一堆連結文字,問题往往不在“内容不够好”,而在结构没有把正文表達清楚。
模板占比過高會带来哪些影响
- 正文被稀释,頁面主题不够集中,容易被判定為列表頁或導航頁。
- 同一套模板下大量頁面主体内容相似,重复度上升。
- 蜘蛛對頁面價值的预估降低,抓取频次和深度可能跟着變化。
- 抽取出的正文不完整,摘要和片段展示效果差。
让正文更容易被识別
- 把正文放在靠前的 DOM 位置。導航可以做,但不必把所有栏目、所有子菜單都铺在正文之前。能折叠的折叠,能用一层菜單解决的不要嵌套三层。
- 用有语义的标簽承载主体。article、main、section 這類标簽比一堆 div 更能表達结构;标题层級保持 h1 唯一,h2、h3 顺序下推,不要為了样式跳級。
- 控制正文内的連結密度。正文段落里适度引用内鏈没問题,但如果每段都插三四個連結,主体就很像推荐位。相關阅讀统一放到正文之後。
- 把侧栏和推荐位與正文分開。结构上分隔清楚,別让侧栏代碼夹在正文段落中間。渲染顺序和源碼顺序不一致时,以源碼顺序為准来考虑蜘蛛的感受。
- 减少纯装饰性的重复块。同一段說明文字、同一组标簽云出現在全站每個頁面底部,属于典型的模板噪声。
正文漂移:正文開头出現的不是正文
另一種常见情况是“正文漂移”:文章開头先放一段免责声明、作者介绍、更新時間說明,再接目錄,再接三五個相關推荐,真正的第一段正文被推到很遠的地方。抽取算法很可能把前面這些当成正文主体,于是頁面的主题就變成了“本站声明”。
判断标准很简單:把頁面上的導航、侧栏、頁脚全部删掉,剩下的内容里,正文是不是排在最前面、占比是不是最大。如果不是,蜘蛛看到的很可能也不是。
一個可以照着做的小自查
- 關掉 CSS 直接看頁面:正文是否紧跟在标题之後?
- 查看源碼,數一數正文開始前有多少個連結?如果超過二三十個,值得調整。
- 用纯文本方式提取頁面,看结果是否以正文開头、是否混入大量菜單文字。
- 對比同模板下的几個頁面,提取出的主体内容差异是否明顯。
這些調整不會让頁面立刻被收錄,也不保證排名變化,但它們把“這頁到底在讲什么”表達得更清楚,减少的是蜘蛛判断时的歧义。收錄和索引是後續环节,先把這一步做扎實,後面的問题才更容易定位。