讨论收錄时,人們常把注意力放在站点地图、提交接口和 robots.txt 上,却很少回头看一件事:從首頁出發,一個頁面需要点几次才能到達。這個“点击深度”不是收錄的硬性门槛,但它會實實在在地影响爬虫發現 URL 的顺序和频率。
点击深度到底在量什么
点击深度指的是從首頁開始,沿着站内連結走到某個頁面所需的最少跳轉次數。首頁是一級,首頁直接鏈出去的頁面是二級,以此類推。這里要注意两点:一是“最少”——只要存在一條短路径,就算數;二是“站内連結”——導航、正文里的超連結、列表頁都算,纯靠搜尋框或表單提交才能到達的路径不算。
测量时最好用站点爬虫工具跑一遍,它會把每個 URL 的层級和入口来源一起列出来。手工估算容易漏掉隐藏在推荐位、頁脚或侧栏里的短路径。
深度為什么會牵動發現與抓取
爬虫每次来訪的抓取額度是有限的,它大致按照“首頁 → 一級栏目 → 更深层”的顺序往外扩散。深度越大,頁面被訪問到的轮次往往越靠後,頁面發生變化後被抓取到的間隔也可能更長。這不等于深頁面一定不收,而是它的發現成本更高、信号更容易被稀释。
- 連結层級越深,指向该頁的内鏈數量通常越少;
- 内鏈少的頁面,更新後不容易被重新訪問;
- 導航结构频繁調整时,深頁面更容易被“漏掉”。
換個角度说,浅层頁面天然拥有更多入口和更快的复訪节奏,深頁面則要依赖別的手段补上這一块。
几種把頁面做深的常见做法
- 只靠搜尋框:商品頁、帮助文章只能通過站内搜尋進入,頁面上没有可爬取的静態連結。
- 压在分頁末端:列表頁翻到第五頁之後才有入口,爬虫很少走到那么深。
- 纯前端渲染的列表:連結由脚本插入,抓取时拿不到 href。
- 栏目层层套娃:大分類下再分小分類,最终頁面落在第四、第五层。
可以做的調整
给重要頁面一條短路径
把目前最需要被發現的頁面,在首頁或一級栏目里给出固定入口。热门、最新、推荐位都是合适的载体,但位置要相對稳定,不要每次刷新都換一批,否則連結等于没建。
用交叉内鏈增加入口
相關内容、上下一篇、专题聚合,都能给深頁面多開几條通道。判断标准很简單:從任意一個頁面出發,能否在两三次点击内回到目标頁。
站点地图兜底,但別当主路径
站点地图能帮助發現 URL,但它不传递權重,也不能替代内鏈的作用。把站点地图当作补给线,内鏈才是主干道。
一個可执行的检查流程
- 挑出十到二十個业務上最重要的頁面;
- 用站点爬虫工具跑一遍,记錄它們的最小点击深度;
- 把深度大于三层的頁面單獨列出来;
- 给這些頁面补 1 到 2 條来自浅层頁面的内鏈;
- 隔一段時間再看,確認深度和抓取情况都有變化。
点击深度影响的是發現效率,不是收錄结果本身。把它当成一條優化线索,而不是一道開關。
收錄是多因素共同作用的结果,内鏈深度只是其中一环。但它有個好處:可量化、可調整,而且改完之後你能在前端结构上直接看到變化。對大多數中小站点来说,先把重要頁面的路径理顺,比反复提交站点地图更實在。