抓取日誌里有记錄、頁面返回 200、site 查询也能查到,但表現一直很弱——這類頁面在收錄核對里经常出現。很多时候問题不在于“有没有被抓到”,而在于這個地址里真正属于它自己的内容有多少。
抓取、索引、展示是三件事
核對之前先把三层分開,能省掉不少無效動作。
- 抓取层:蜘蛛来過、讀過 HTML,日誌里有响應碼和字节數。這只說明地址可達。
- 索引层:頁面被纳入候選库,可以被检索到。同一主题的多個地址在這里可能被聚到一起,只留一個代表。
- 展示层:在什么查询、什么位置出現,由相關性、内容质量、用戶信号共同决定,不是收錄核對能直接控制的。
正文占比主要影响後两层:内容太薄的頁面即使進了索引,也容易被同類地址盖過去。
正文占比怎么量
- 取一份原始 HTML(不是渲染後的 DOM),複製成纯文本。
- 把導航、頁脚、面包屑、推荐列表、评论、版權声明逐块标出来。
- 用主内容字數除以全文總字數,得到一個粗略比例。
- 同一模板抽 5 到 10 個頁面重复,看這個比例是稳定還是忽高忽低。
如果一批頁面的正文占比長期低于两成,就值得回头看看:是模板把主体挤得太靠後,還是頁面本身只是聚合了一堆摘要。
模板重复带来的连带問题
同一套模板下,若每頁正文只有两三段,其余全是相同的導航與推荐,搜尋引擎看到的差异度就很低。常见後果有三個:
- 多條地址被判為高度相似,只保留一條作為代表,其余進入“已排除”。
- 代表頁来回轮換,今天留下 A,明天可能變成 B,收錄狀態看上去在横跳。
- 抓取配額被大量低差异頁面消耗,真正需要更新的地址反而排队靠後。
這三個現象根子上是一件事:頁面之間缺少足够的区分信息。
動手改的顺序
- 先動模板。把主内容放到更靠前的位置,压缩首屏之外的重复块。
- 再补内容。摘要式頁面扩寫成完整正文,或者明确标為聚合入口並指定 canonical。
- 然後做归一化。大小寫、结尾斜杠、參數、http 與 https 统一到一個地址,减少同頁多址。
- 最後才是观察。改完给抓取和重新评估留一個周期,不用当天就下判断。
收錄核對能影响的是發現、抓取和归並這几個环节;能不能進索引、以什么形式出現,最终還是由搜尋引擎判断,没有“改完一定收錄”這回事。
把問题從“有没有被抓”升級成“這個頁面對搜尋来说值不值得留”,核對才會從數數字變成能落到具体改動上的工作。