排查收錄时经常遇到一種情况:首頁和主要栏目收錄得比較全,某個目錄却長期只進了一小部分。只看整站總數,這個問题是看不出来的——總數會被表現好的部分掩盖。把統計口径拆到目錄层面,問题才會顯出轮廓。
目錄是观察收錄的一個合适颗粒度
搜尋引擎的收錄决策最终落在單個 URL 上,並不存在“這個目錄被收錄了”這样的狀態。但站点的结构本身是按目錄划分的,内鏈、模板、内容類型、發布時間往往都以目錄為單位区分。因此目錄层面的收錄率差异,通常能直接指向原因所在。
先確認差异是不是真的
在動手調整之前,先把資料口径的問题排除掉,否則很容易對着假象做優化。
- 抽样方式:site: 查询只能反映大概,最好在服務器日誌里按目錄統計被抓取的 URL 數量,再和该目錄實际的獨立 URL 數量對比。
- 時間窗口:新目錄和老目錄的收錄节奏本来就不同,別拿上线一周的目錄和上线三年的目錄直接比。
- 索引狀態:用網址检查看几個代表頁,確認是“确實没收錄”,而不是“收錄了但没有展示”。這两件事的處理方式完全不同。
- 目錄邊界:統計时先确定分頁、篩選參數、标簽頁算不算在同一個目錄里,口径不一致會得出相反结论。
目錄收錄差的几種常见原因
内鏈分布不均
導航和正文里指向某個目錄的入口少,目錄内的頁面又只能靠列表頁一层层往下带,蜘蛛能到達的深度就有限。可以實际点一下:從首頁出發,走到某個目錄内第 20 個頁面需要几跳?如果超過四五跳,抓取覆盖往往就不完整。
目錄内頁面质量參差
有些目錄里混着模板化聚合頁、空列表頁和少量真正有内容的詳情頁。整体抓取时,低质部分會稀释這個目錄的表現。比較可行的做法不是一刀切,而是把有價值的頁面挑出来,用内鏈和入口明确地扶起来。
URL 參數與重复
带篩選、排序、分頁參數的目錄,很容易出現一個内容對應几十個 URL 的情况。如果這些參數 URL 都能被抓到,抓取资源會被大量消耗,真正希望被收錄的規范頁反而被挤在後面。
目錄的歷史包袱
老目錄里可能沉淀了大量已下线内容、被替換過的路径和失效連結。這些不會直接“拖累”新頁面,但會让蜘蛛在這個目錄里花掉更多無意义的時間,間接影响新内容的發現速度。
目錄层面可以做的調整
- 統計:按目錄列出被抓 URL 數、獨立 URL 數、索引進 URL 數,找出差距最大的那一個,先集中處理。
- 收口:參數 URL 和無價值聚合頁要通過合适的手段控制住,具体選哪種方式取决于你是想阻止抓取還是阻止索引,两者不能混用。
- 扶正:在導航、面包屑、相關推荐里给目标目錄增加稳定的内鏈入口,把点击深度压到合理范围内。
- 减负:清理失效連結、合並高度近似的頁面,让目錄内的 URL 數量和實际内容數量大致匹配。
- 观察:按目錄分別看日誌中的抓取频次變化,判断調整是否生效。這個過程需要時間,不适合频繁反复修改。
不是每個目錄都需要把收錄率拉满
收錄數量本身不是目标。工具類目錄、帮助文档、活動頁、歷史归档,承担的作用各不相同。對没有搜尋需求、也不作為站内入口的目錄,控制抓取、减少無谓消耗,往往比追求收錄更合理。
反過来也一样:如果某個目錄承载了主要的流量入口,那么它在索引里的覆盖率就值得持續關注,而不是等到問题累积了才回头查。
小结
把收錄拆到目錄层面看,問题通常會具体很多。與其盯着整站總數反复猜测,不如先找到那個明顯拖後腿的目錄,再從内鏈、质量、參數和歷史内容几個方向逐個排查。調整之後按目錄观察,比看全站曲线更容易判断有没有起作用。