蜘蛛池的入口頁通常數量不小,生成的模板也大同小异。在這種前提下,URL 结构是少數還能由人為控制的變量之一。它不影响頁面的视觉呈現,却會影响蜘蛛發現連結後的判断、抓取路径的分配,以及後續日誌排查的难度。
层級:入口頁別埋得太深
搜尋引擎蜘蛛的抓取预算有限,越靠近根目錄的 URL 越容易被反复訪問。入口頁如果被安排在三层、四层目錄之下,實际被抓到的概率會明顯下降。
- 尽量把入口頁放在接近根目錄的位置,目錄层級控制在两到三层以内。
- 中間层不要做成空壳,如果中間頁只有一條連結,等于白白消耗一次抓取。
- 同級頁面數量多时,用分類頁或分頁把連結分發下去,而不是让首頁挂上几千個連結。
判断标准很简單:從根目錄点到目标入口頁,需要多少次点击。次數越多,蜘蛛走到底的意愿越低。
參數:能静態就静態
带參數的 URL 不一定抓不到,但參數越多、越杂乱,被判定為低價值頁面或重复頁面的概率越高。
- 參數數量:能压到一個以内的就別放三個。id=123 這類必要參數可以保留,統計、来源、排序類的參數尽量去掉。
- 參數顺序:同一頁面如果存在 a=1&b=2 和 b=2&a=1 两種寫法,會被当成两個 URL,需要统一顺序或用規范地址處理。
- 會话類參數:sessionid、token 這類會随訪問變化的參數,最好不要出現在入口頁連結里。
命名:可讀、稳定、唯一
入口頁 URL 用什么命名方式,没有统一标准,但有几條经驗可以參考。
- 可讀性:拼音或英文單词比纯數字串更容易理解頁面主题,也方便自己後期排查。
- 稳定性:URL 一旦生成上线,尽量避免再改。改一次就等于把一個已经存在的地址作废。
- 唯一性:同一份内容只對應一個 URL,不要同时存在 /a/123 和 /a/123.html 两種形式。
重复 URL 的几個常见来源
很多入口頁的問题不是抓不到,而是抓到了太多同样的内容。常见情况包括:
- 结尾斜杠的有無:/list 和 /list/ 指向同一頁。
- 大小寫不统一:/Page 和 /page 被当成两個地址。
- 协议與域名變体:http 與 https、带 www 與不带 www 混用。
- 分頁參數不規范:?page=1 與不带參數指向同一份内容。
處理方式通常是二選一:要么统一跳轉,要么在頁面里声明規范地址。两種方式選一種坚持用,不要混着来。
上线前可以自查的几項
- 入口頁從根目錄点過去需要几次点击,是否超過三层。
- 随机抽几十條 URL,检查是否存在重复、跳轉鏈或大小寫混用。
- URL 中是否残留統計參數、會话參數或測試用的临时參數。
- 頁面内的連結是否為可抓取的 a 标簽,而不是依赖脚本点击。
- 日誌里出現 404 或 301 的 URL,是否能對應到具体的模板問题。
URL 结构不會直接决定收錄结果,但它會影响蜘蛛在站内走動的顺畅程度。把這一层理清楚,後面再看抓取和索引的資料,判断會容易很多。