很多站点排查收錄时,會把注意力放在 sitemap、提交接口和外鏈上,却忽略了一個更基础的問题:從首頁出發,要经過几次点击才能到達這個頁面。搜尋引擎的抓取是從已知 URL 出發不断扩展的過程,入口越浅、被連結得越多,被發現的概率和重新抓取的频率通常越高。
点击深度是怎么影响發現的
爬虫不是一次就能把全站翻完。它按照一定节奏,從首頁、sitemap、外鏈等已知入口開始,沿着連結一层层展開。如果某個頁面在第五层甚至更深,而路径上某一层頁面本身的抓取频率就很低,這條鏈路整体都會被拖慢。深层頁面常见的情况是:第一次被抓到之後很久没有回訪,内容更新了也不會很快反映出来。
抓取優先級和連結位置
同一批 URL 摆在那里,爬虫分配的時間並不是平均的。站内被大量連結指向的頁面、在導航中固定出現的頁面,通常會被更频繁地回訪;而只在一個角落被鏈過一次的頁面,優先級明顯靠後。
- 導航、面包屑、相關推荐中的連結稳定且長期存在,作用更持續。
- 正文里的上下文連結對语义和發現都有帮助,但前提是内容确實相關。
- 一次性出現的連結,比如只在某篇公告里挂過一次,很快就會被淹没。
- 分頁、标簽頁产生的連結數量大但價值參差,會稀释抓取资源。
常见的深坑结构
有些结构看起来正常,實际上把大量頁面压得很深:
- 商品或文章只挂在多級归档頁下面,而归档頁自己很少被訪問。
- 依赖站内搜尋或篩選才能到達的頁面,没有稳定的静態入口。
- 把新内容先放進最新模块,几天後模块轮換掉,連結随之消失。
- 栏目頁只展示前几頁,更早的内容要靠翻頁,越往後越难到達。
這些頁面本身不一定有問题,但發現渠道太窄,收錄节奏自然會慢。
检查與改善的顺序
- 先確認問题是不是真的出在發現环节。對照抓取日誌,看爬虫有没有来過、来過几次、返回狀態是什么。
- 統計重要頁面的点击深度,優先處理那些有搜尋需求、但入口很深的頁面。
- 给核心内容补一條稳定入口,比如在相關栏目、聚合頁或正文中加指向連結,而不是只靠临时模块。
- 减少無意义的連結輸出。連結不是越多越好,模板里堆出来的連結會分散抓取资源。
- 用内鏈把同類頁面串起来,让爬虫從一個頁面能自然走到下一個相關頁面。
改完之後怎么驗證
調整内鏈後不會立刻见效。可以观察几周内抓取日誌的變化:目标目錄的抓取次數是否增加、返回碼是否正常、新頁面從發布到被抓的時間是否缩短。同时看後台的已發現 URL 數量是否在向编入索引轉化。如果抓取變多了但索引狀態長期不動,問题可能已经不在發現环节,而是頁面质量、内容重复或者索引策略上的其他原因。
内鏈解决的是能不能被找到,不解决找到之後要不要收。把這两個問题分開看,排查效率會高很多。
別把内鏈当成萬能钥匙
内鏈层級浅、入口稳定,确實能提高被發現的概率,但它不能替代對内容本身的判断。一個深度只有两跳、却被大量複製的頁面,依然可能不被收錄;反過来,内容扎實但入口較深的頁面,收得慢也常常能收。實际操作中,先保證重要頁面不迷路,再去看内容是否值得被索引,顺序會更合理。