網站收錄

正文被模板挤到角落:收錄核對时先算一遍主内容占比

抓取正常、返回 200、site 也能查到,頁面表現却一直很弱,問题往往出在主内容占比太低。本文把抓取、索引、展示三层分開,给出量正文占比的具体步骤、模板重复带来的归並與代表頁轮換問题,以及按模板、内容、URL 归一化推進的處理顺序。

網站收錄

正文被模板挤到角落:收錄核對时先算一遍主内容占比

抓取日誌里有记錄、頁面返回 200、site 查询也能查到,但表現一直很弱——這類頁面在收錄核對里经常出現。很多时候問题不在于“有没有被抓到”,而在于這個地址里真正属于它自己的内容有多少。

抓取、索引、展示是三件事

核對之前先把三层分開,能省掉不少無效動作。

  • 抓取层:蜘蛛来過、讀過 HTML,日誌里有响應碼和字节數。這只說明地址可達。
  • 索引层:頁面被纳入候選库,可以被检索到。同一主题的多個地址在這里可能被聚到一起,只留一個代表。
  • 展示层:在什么查询、什么位置出現,由相關性、内容质量、用戶信号共同决定,不是收錄核對能直接控制的。

正文占比主要影响後两层:内容太薄的頁面即使進了索引,也容易被同類地址盖過去。

正文占比怎么量

  1. 取一份原始 HTML(不是渲染後的 DOM),複製成纯文本。
  2. 把導航、頁脚、面包屑、推荐列表、评论、版權声明逐块标出来。
  3. 用主内容字數除以全文總字數,得到一個粗略比例。
  4. 同一模板抽 5 到 10 個頁面重复,看這個比例是稳定還是忽高忽低。

如果一批頁面的正文占比長期低于两成,就值得回头看看:是模板把主体挤得太靠後,還是頁面本身只是聚合了一堆摘要。

模板重复带来的连带問题

同一套模板下,若每頁正文只有两三段,其余全是相同的導航與推荐,搜尋引擎看到的差异度就很低。常见後果有三個:

  • 多條地址被判為高度相似,只保留一條作為代表,其余進入“已排除”。
  • 代表頁来回轮換,今天留下 A,明天可能變成 B,收錄狀態看上去在横跳。
  • 抓取配額被大量低差异頁面消耗,真正需要更新的地址反而排队靠後。

這三個現象根子上是一件事:頁面之間缺少足够的区分信息。

動手改的顺序

  1. 先動模板。把主内容放到更靠前的位置,压缩首屏之外的重复块。
  2. 再补内容。摘要式頁面扩寫成完整正文,或者明确标為聚合入口並指定 canonical。
  3. 然後做归一化。大小寫、结尾斜杠、參數、http 與 https 统一到一個地址,减少同頁多址。
  4. 最後才是观察。改完给抓取和重新评估留一個周期,不用当天就下判断。
收錄核對能影响的是發現、抓取和归並這几個环节;能不能進索引、以什么形式出現,最终還是由搜尋引擎判断,没有“改完一定收錄”這回事。

把問题從“有没有被抓”升級成“這個頁面對搜尋来说值不值得留”,核對才會從數數字變成能落到具体改動上的工作。