很多站点在内容量上来之後,會碰到一個現象:新發布的文章很快就有抓取记錄,但一些埋在栏目深處的頁面,几周甚至几個月都不见動静。問题往往不在内容本身,而在 URL 的目錄层級和站点深度——蜘蛛需要经過多少跳,才能走到那個頁面。
抓取预算與連結深度
搜尋引擎分配给每個站点的抓取资源是有限的。同样一次訪問,它可以用来抓一個刚更新的列表頁,也可以用来抓一個三個月没動過的深层頁面。层級越深,蜘蛛走到的成本越高,被排到队尾的概率也越大。经驗上,重要内容尽量控制在首頁出發三到四次点击以内,超過五跳才到達的頁面,就值得單獨检查一下入口是否够多。
常见的层級問题
- 栏目层层嵌套:首頁 → 频道 → 子频道 → 分類 → 列表 → 詳情,一路下去五六跳。
- 列表分頁很深,只有第一頁有稳定、可抓取的入口。
- 标簽頁、日期归档頁數量遠超正文頁,把有限的連結位稀释掉了。
- 部分栏目只能靠站内搜尋框或 JavaScript 点击才能到達。
- 栏目改版後舊目錄繼續保留,新舊结构並行,蜘蛛在两套路径之間来回走。
把深度压下来的几種做法
- 先梳理栏目,合並同類項。一級栏目控制在五到八個,二級栏目尽量不超過三個,让结构一眼能看懂。
- 给重要列表頁补入口:首頁推荐位、频道頁交叉連結、相關推荐模块、热门聚合頁,都可以把深层頁面往上提。
- 用聚合頁承接長尾内容,比如按主题、按地区、按時間维度生成专题頁,把散落的詳情頁串起来。
- 保持 URL 语义,目錄名與栏目名對應,避免出現 /p/12345 這類無法判断归属的路径。
- 分頁要给出真正的連結,別只做一個「加载更多」按钮;按钮触發的接口地址對蜘蛛並不等于入口。
深度不是越浅越好
扁平化不等于把所有頁面都塞到根目錄。目錄在某種程度上承担了语义归類的功能,栏目划分清楚,蜘蛛和用戶都能從 URL 猜出頁面大概讲什么。真正要避免的是「無意义的深」:同一個栏目下反复套壳,路径里堆着一串數字 ID 或日期,却看不出内容之間的從属關系。合理的做法是让目錄层數與栏目层數基本對應,路径短但不失去语义。
怎么自查
- 看服務器日誌,按 URL 的路径段數分组,統計不同深度的抓取频次和占比。
- 導出站内 URL 清單,算一下每個頁面到首頁的最短跳數,排出最深的那些。
- 用爬虫工具從首頁跑一遍,检查有没有只靠内部搜尋才能到達的孤岛頁面。
- 關注收錄與抓取的趋势變化,而不是盯某一天的绝對值。
目錄层級和站点深度属于「改一次、長期受益」的基础工作。它不能保證收錄,也不等于排名,只是降低了蜘蛛發現頁面的成本。
建议每半年做一次结构体检:栏目有没有新增却没入口的,聚合頁是不是越堆越多,舊目錄還有多少在跳轉。把這些理顺,搜尋蜘蛛的 URL 發現會顺畅不少,站点运营的很多後續工作也會轻松一些。