收錄排查里有一類問题经常被忽略:頁面内容是自己寫的,服務器也正常,robots 没有拦,可索引里就是一直没有它。往下查才發現,這不是质量或技術故障,而是蜘蛛压根没有一條稳定的路径走到這個頁面。這就是点击深度的問题。
点击深度和收錄是什么關系
点击深度指的是從首頁出發,顺着連結点几下能到達某個頁面。蜘蛛發現新 URL 的主要方式就是顺着連結爬,所以一個頁面在站内的連結层級越深、入鏈越少,被爬到的概率和频率就越低。這里要注意区分:深度問题首先影响的是“能不能被發現的抓取”,之後才轮到“抓取之後要不要收錄”。抓取和收錄是两件事,入口這一步没解决,後面谈内容质量没有意义。
還有一個常见誤解:把 sitemap 当成入口的替代品。sitemap 是辅助發現的文件,它可以提示 URL 存在,但站内没有任何連結指向的頁面,通常缺少權重和抓取優先級,長期表現往往不理想。
几種典型的“找不到入口”
孤儿頁面
頁面能被直接訪問,站内却没有任何一處連結指向它。常见于活動頁下线後忘记處理、老文章從列表里翻頁翻没了、商品下架但 URL 還留着。這類頁面即使出現在 sitemap 里,也基本靠运气被爬。
目錄层級堆得太深
比如首頁 → 频道 → 子频道 → 分類 → 标簽 → 文章,五六层下来,越靠後的頁面入鏈越少。站内規模大的时候,深层頁面往往是很久才被爬一次。
只在 sitemap 里,站内零入鏈
批量提交了几萬個 URL,其中一部分站内根本搜不到連結。抓取预算被這些頁面分散,真正有價值的頁面反而排不上。
自查顺序
- 先看日誌或抓取工具,確認這個 URL 到底有没有被爬過。完全没爬過,問题在入口;爬過但没收錄,問题在別處。
- 在站内搜尋這個 URL,看有没有別的頁面連結到它。没有入鏈,先补内鏈。
- 检查指向它的那几頁自己是否被抓取、被收錄。入鏈頁本身進不去索引,传递效果也有限。
- 數一下從首頁到该頁的点击层數,對比站内其他同類型頁面的深度。
- 看導航、面包屑、分類頁、相關推荐這些固定入口有没有覆盖到它。
可以怎么處理
- 從内容相關的頁面加正文内鏈,比在頁脚塞一堆連結更自然,也更容易被识別。
- 让面包屑、栏目頁、标簽頁承担一部分入口职责,前提是這些聚合頁本身是開放抓取的。
- 重要頁面尽量往浅层放,或者用一個新的聚合入口把它提上来。
- sitemap 保持精简准确,只放希望被抓的 URL,不要当成堆量工具。
- 一次性放出大量零入鏈的新 URL,容易让抓取量分散,建议分批。
点击深度没有统一的标准答案。小站点三四层很常见,几萬頁的大站則要格外留意深层頁面的入鏈情况。關键不是层數本身,而是重要頁面有没有稳定、可持續的站内入口。
哪些深层頁面可以不用管
不是所有頁面都值得拉出来。長期不更新、内容單薄、只服務于极少數用戶的深层頁面,保持現状、不被收錄也是合理選擇。真正需要處理的是那些有實际價值、又确實找不到入口的頁面。先判断價值,再决定要不要動结构。