做收錄核查时,很多人先看 URL 寫法、内鏈入口、canonical 是否規范,這些确實重要。但還有一類問题常被忽略:頁面本身能被“拿走”的獨有信息太少。同一套模板下,几十上百個頁面除了标题和几個字段几乎一样,收錄结果自然會出現有的進了、有的没進。
什么是正文占比
這里说的正文占比,不是简單的字數統計,而是把全站统一的模板部分剥掉之後,頁面還剩多少獨有内容。
通常需要先减掉的部分包括:
- 導航、面包屑、侧栏
- 頁脚、备案信息、全站友情連結
- 推荐位、热门榜、相關文章模块
- 广告位、登入提示、Cookie 提示
剩下的才是這個 URL 獨有的信息。如果這部分只有一两句话,而模板部分占據了大半屏幕,那么頁面在抓取和索引阶段可選的價值就很低。
低正文占比頁面常见的收錄表現
- 收錄時間明顯比同站其他頁面長,甚至長期停留在“已發現”狀態
- 同一模板的頁面只被收錄一部分,另一些迟迟不進来
- 索引里展示的摘要抓的是推荐位或頁脚文字,而不是頁面主体
- 頁面更新後,索引版本長期不刷新
這些表現本身不是處罚,更接近资源分配的结果。面對海量 URL,抓取和索引容量會被優先给到信息增量更高的頁面。頁面之間越相似,這種篩選就越明顯。
一套可执行的自查顺序
- 關掉 CSS 和 JS,直接看纯文本。如果一眼看不出這個頁面在讲什么,說明主体信息不足。
- 把導航、頁脚、侧栏在編輯器里删掉,數一數剩下多少字,以及這些字是否真的只属于這個 URL。
- 抽三到五個同模板頁面並排比較,标出它們共有的段落。共有比例越高,被当作近似頁面的概率越大。
- 检查主内容是否依赖 JS 渲染。模板文字在 HTML 里、主体内容在脚本里,是很容易被漏掉的情况。
- 记錄這些頁面在索引报告里的狀態,连續观察两到三周,看是否有稳定規律,而不是只看某一天的資料。
可以尝试的處理方向
- 补獨有信息:參數說明、适用场景、常见問题、更新時間、資料来源,這些内容對用戶有用,也确實增加了頁面的信息增量。
- 减少重复模块:全站推荐位、热门榜可以保留在少數入口頁,不必每個頁面都塞一份。
- 该合就合:内容高度重叠的頁面,合並成一個更完整的頁面,通常比保留十個半成品更容易被理解。
- 该關就關:篩選參數頁、空结果頁、内容极少的占位頁,可以考虑用 noindex 或 robots.txt 控制,但要先確認它没有承接有價值的搜尋需求。
几個容易走偏的地方
- 把正文占比等同于字數。堆三百字同义反复,並不會提高頁面價值。
- 靠增加相關推荐来“填满”頁面。推荐位是導航,不是内容。
- 看到一個頁面没收錄就立刻删。先判断它是否承接了真實的搜尋需求,再决定保留、补充還是下线。
收錄是篩選後的结果,不是對頁面的奖励。與其反复猜测算法,不如先让每個 URL 都有自己值得被單獨保留的理由。