排查收錄問题时,很多人先看内容质量、robots 規則、站点地图,却忽略了一個更基础的因素:這個頁面在站内處于什么位置,從首頁点几下能到。連結深度不决定收錄结果,但它實實在在影响頁面被發現的概率和频率。
連結深度為什么會影响收錄节奏
搜尋引擎發現 URL 的主要渠道之一是站内連結。爬虫沿着連結一层层往下走,頁面离首頁越遠,被走到的机會就越少,被抓取的間隔也越長。深度大的頁面,可能几天甚至几周才被訪問一次。
深度還會影响重抓节奏。一個经常被内鏈指向的頁面,内容更新後往往能較快被重新抓取;而深埋在角落里的頁面,即使更新了内容,也可能長時間停留在舊版本上,让人誤以為是索引出了問题。
先做一次連結深度自查
- 從首頁出發,记錄到達目标頁面最少需要几次点击;
- 用站内搜尋或站内連結检查,看還有哪些頁面連結到它;
- 把入口連結按来源分類:導航、分類頁、正文内鏈、頁脚、侧栏;
- 查看這些来源頁面本身是否已被收錄、是否经常被抓取。
常见经驗是把重要頁面控制在三次点击以内,但這只是參考值,不是硬性标准。真正需要關注的是入口數量和入口本身的质量,而不是單纯數层級。
入口數量和质量,比层級更值得看
一個頁面如果在多個被频繁抓取的頁面里出現,即使层級深一点,被發現的机會也不低。反過来,只有一個連結、且来自一個同样很少被抓取的頁面,就算层級只有两层,也可能長期不被訪問。
- 入口數量:只有一两個内鏈入口的頁面,風險較高;
- 入口頁面质量:来源頁面是否被收錄、是否有稳定的抓取;
- 連結位置:正文里的上下文連結,通常比頁脚、侧栏的批量連結更有效;
- 锚文本是否可讀:寫成「点击這里」這類無意义文本,入口的作用會被削弱。
常见的几種假入口
有些連結看起来存在,實际對發現頁面帮助有限,排查时容易誤判。
- 連結由脚本在点击後才生成,HTML 源碼里並没有可直接抓取的地址;
- 内鏈指向的地址要经過多次跳轉才到目标頁,鏈路越長越容易被放弃;
- 連結被 nofollow 或 robots 規則挡住;
- 連結藏在需要展開、点击「更多」才出現的模块里;
- 列表頁里目标條目排在很靠後的位置,且没有其他入口。
改善顺序:先让入口有效,再考虑提交
調整时按下面的顺序做,成本和收益比較可控。
- 把重要頁面放進主導航或分類頁,确保源碼里就有可抓取的普通連結;
- 在主题相關的正文里补充上下文内鏈,让入口出現在真實阅讀路径上;
- 清理重定向鏈,让内鏈直接指向最终地址;
- 修掉會阻断抓取的規則,例如誤寫的 robots 或頁面級 noindex;
- 最後再用站点地图和提交接口做补充,而不是一上来就依赖它們。
站点地图和提交接口解决的是「告知一次」,站内連結解决的是「持續被發現」。两者不能互相替代,入口没打通时,單靠提交往往看不到稳定變化。
連結改善之後,再回到其他维度
如果入口已经补上、連結深度也合理,頁面仍然長期不被收錄,那就要換方向排查:内容是否與站内其他頁面高度重复、URL 是否規范、頁面是否需要渲染後才出内容、是否存在返回 200 却空白的软 404 情况。
連結深度只是让頁面「被看到」的一环。能不能進入索引,最终還要看這個頁面本身是否值得被保留。把入口問题和其他维度分開處理,排查起来會清楚很多。