收錄對不上时,大家习惯先看頁面本身:标题、正文、noindex、canonical。但有一類問题出在更前面——頁面根本没被蜘蛛走到,或者走到的路径绕了太遠。這时不管頁面寫得多好,都可能長期停在“已發現、未抓取”那一栏。核對之前先量一遍從首頁到目标頁的点击距离,往往比反复改正文更快定位問题。
為什么要先量点击距离
蜘蛛發現 URL 的顺序,主要取决于站内連結里出現的地址。sitemap 能提供一份清單,但它解决的是“知道有這個地址”,不等于“被排進抓取队列的前面”。在抓取能力有限的前提下,從首頁一两跳就能到的地址,通常比埋在第五、第六层的地址更早被取回。
抓取和收錄是两件事:被抓過說明蜘蛛来過,被收錄說明索引层認可它。点击距离影响的是前一件事,做得不好,後一件事连上场的机會都没有。
怎么量:從首頁做一次广度遍歷
不需要复杂工具。找一份站内連結導出(爬虫工具、服務器日誌、或站点後台的内鏈統計都可以),按三步做:
- 把首頁记為第 0 层,只統計頁面里真實可点击的連結,不含脚本拼接出来的地址。
- 第 1 层是主導航、面包屑、首頁推荐位指向的地址;第 2 层是栏目列表里的條目;以此類推。
- 给每個目标頁只记最短的那條路径,而不是随便一條。有直達路径,就不必管它同时也出現在第五层。
三類頁面分開看
栏目頁、内容頁、工具或活動頁的合理深度並不一样。栏目頁一般落在 1 到 2 层;常規内容頁三跳以内比較稳;专题、活動、長尾内容可以放宽,但最好有聚合入口托着,而不是只靠站内搜尋兜底。
深度超标通常是這几個原因
- 只出現在列表頁的後几頁。第一頁永遠最容易被爬到,越往後越难被顺路取回。
- 入口只在搜尋框里。用戶搜得到,不代表蜘蛛走得到。
- 連結由脚本動態插入。原始 HTML 里没有這條連結时,很多时候等于没有。
- 相關推荐用了 nofollow 或跳轉脚本。連結信号被削弱,發現優先級也跟着下降。
- 只在 sitemap 里出現。清單给了,站内却没有任何連結指向它,這類地址常長期停在“已發現”。
處理顺序建议
- 先修覆盖最多頁面的位置:主導航、面包屑、栏目分類入口。
- 再补聚合頁,用标簽頁、专题頁、索引頁把同類地址串起来,给長尾頁面多一條進路。
- 减少不必要的中間层。能一次跳到的,不要设計成“列表—子列表—詳情”三段。
- 列表分頁保留第一頁的直接連結,深层頁面尽量往前提。
- 改完後隔一段時間再量一次,對比前後的层級變化。
层級只是一個變量。頁面本身质量太低、與已有頁面内容高度重复,即使压到第一层也不一定進索引。深度排查回答的是“有没有机會被抓到”,不是“抓到了就一定會收”。
复核时對齐两個數
一次核對只回答一個問题:重要頁面是不是都有一條三跳以内的路径。把层級表和索引狀態放在一起看,如果某個地址层級很浅却仍不進索引,問题大概率在頁面质量或重复内容上,這时再回到内容层面排查,效率會比一開始就怀疑站点结构高得多。
這套量法可以固定成例行检查:新站上线、改版換模板、批量新增栏目之後各做一次,深度異常的地址通常一眼就能看出来。