内容持續在發,抓取日誌里却很少看到目标頁面,這是不少站点會碰到的情况。很多人第一反應是“URL 太深了”,于是去改目錄结构,把 /news/2024/tech/xxx 压成 /n/12345,改完之後發現抓取情况並没有明顯變化。問题往往出在把两個不同的“深度”混為一谈。
一、URL 层級和内鏈层級是两件事
URL 层級指的是路径里有几段,比如 /a/b/c/page.html 有三层;内鏈层級指的是從首頁出發,顺着連結点几次能到目标頁。搜尋引擎發現 URL 的主要途径是連結,路径本身更多承担分類和语义的作用。
路径很深但内鏈入口很多的頁面,通常一样能被發現;路径很短但站点里几乎没人連結它的頁面,就是一個孤岛。判断一個頁面“深不深”,要先看它是哪種深。
二、URL 路径深度的影响通常被高估
路径本身會按段拆解,提供归属信息,一般不會因為“段數多”就直接被扣分。真正容易带来問题的是另外几種寫法:
- 路径里塞满跟踪參數、會话 ID、排序參數,同一篇内容出現大量不同 URL;
- 大量無意义的數字 ID,既看不出主题,也没有稳定的层級關系;
- 同一個栏目同时存在 /tech/ 和 /technology/ 两套路径,内容互相交叉。
如果為了“扁平化”去改路径,舊地址就要做 301,改完還可能留下残留連結。没有明确收益时,不建议單纯為了层級數字去動 URL 结构。
三、内鏈层級才是更常见的瓶颈
当頁面長期不被發現时,先看它從首頁出發要点击几次。常见的問题集中在下面几類:
- 目标頁只有首頁或某一個大列表頁指向它,中間缺少分類頁、聚合頁、相關内容模块;
- 連結挂在 JS 点击事件上,抓取时拿不到可跟進的 href;
- 連結所在区域被 robots.txt 屏蔽,或連結本身带了 nofollow;
- 列表頁只保留“下一頁”,歷史内容翻不到,也没有稳定的归档入口。
這几種情况叠加起来,頁面即使被 sitemap 列出,也缺少被反复訪問的路径。
四、按内鏈层級做一次排查
排查不需要复杂工具,可以按下面的顺序走一遍:
- 從首頁出發,记錄每個目錄下頁面到首頁的最小点击次數;
- 把点击次數在 4 次以上的頁面單獨整理成一張表;
- 在抓取日誌里看這些頁面的訪問频次,以及最近一次是被哪個 URL 带進来的;
- 标出既没有稳定内鏈、也没有被 sitemap 覆盖的孤岛頁面。
這張表通常能直接暴露出是哪一层在拖後腿:是某個中間层栏目没有把連結传下去,還是列表頁只輸出前几屏内容。
五、處理顺序建议
- 先补内鏈入口:在分類頁、聚合頁、相關阅讀、上一篇下一篇里加上目标頁連結;
- 再確認連結可被抓取:用普通 a 标簽加 href,而不是依赖脚本跳轉;
- 然後用 sitemap 做兜底,覆盖那些天然缺少入口的頁面;
- 最後才考虑是否調整 URL 结构,並且要同步處理好舊地址的跳轉。
sitemap 是發現渠道之一,但它不承担“提升權重”的作用。把 sitemap 当成内鏈的替代品,通常解决不了頁面長期没訪客的問题。
六、几個常见誤区
- 為了缩短 URL 把關鍵詞硬塞進路径,反而让地址讀起来更像堆砌;
- 把重要頁面只放在列表頁第五屏之後,抓取和用戶都很难触達;
- 给站内連結统一加 nofollow,切断了内部传递的路径;
- 改了路径却不做 301,等于把原来的入口重新變成孤岛。
遇到頁面長期不被發現,先別急着改 URL。把“從首頁点几次能到”這件事排清楚,往往比調整路径段數更有效。内鏈层級理顺之後,再看路径是否還有必要動。