收錄問题排查,很多人是從抓取這一步開始的,但抓取之前還有一個更容易被忽略的环节:發現。蜘蛛必须先知道某個 URL 存在,才可能去訪問它。如果新頁面從来没有被任何入口指向過,抓取日誌里自然也不會出現它,後面的抓取和索引都無從谈起。
發現、抓取、索引是三件事
粗一点分,一個 URL 從诞生到進入索引會经過三段:
- 發現:蜘蛛從某個已知頁面、站点地图或外部連結里看到這個地址。
- 抓取:蜘蛛實际發起請求,把頁面内容取回来。
- 索引:内容经過處理,判断是否值得長期保留在索引里。
這三段是串行的。第一段没走通,後面两段连發生的机會都没有。所以当新頁面迟迟不收錄时,先別急着改标题改正文,先確認它有没有被看到。
蜘蛛常见的几個 URL 發現入口
- 站内連結:首頁、栏目頁、列表頁、相關推荐里的連結,是蜘蛛最主要的来源,通常也是被跟随得最稳的一類。
- 分頁與更多入口:列表翻頁、归档頁、按時間或标簽聚合的頁面,能把蜘蛛带到更深的层級。
- 站点地图:sitemap 是补充入口,不是主入口。它的作用是告诉蜘蛛這些地址存在,但抓不抓、抓几次,仍取决于頁面本身。
- 外部連結:外站的自然連結、合作頁面、内容分發平台,都能带来新的發現路径。
- 推送與提交接口:部分搜尋引擎提供主動提交入口,可以在發布後告知一声,但同样只是告知。
入口没铺好时,頁面會呈現什么狀態
- 頁面只能通過站内搜尋、篩選條件或表單提交才能到達,没有稳定可跟随的連結。
- 連結由脚本在点击时才生成,源碼里找不到可以直接跟随的地址。
- 連結只出現在頁脚一大串里,位置太深、數量太多,被跟随的概率很低。
- 新頁面只在站点地图里出現過,站内没有任何地方指向它,外部也没有連結。
這些情况對應的常见表現是:頁面在索引里顯示為已發現但尚未抓取,或者连這個狀態都没有。這时真正该做的是补連結入口,而不是換着方式反复提交地址。
怎么检查自己的入口够不够用
- 從首頁出發,只用普通可点击連結,看能不能在三四次点击内到達目标頁面。做不到,就說明层級偏深。
- 看抓取日誌里蜘蛛訪問目标頁面时是從哪個頁面跳過来的。如果来源永遠只有站点地图,說明站内連結几乎没有贡献。
- 把導航和列表遮住,只留正文,看新頁面還能不能被其他文章引用到。
- 检查有没有頁面只有一條入口,而這條入口本身就是個還没被收錄的頁面。
几個容易踩的誤区
把站点地图当成收錄開關,提交完就認為任務結束;或者把内鏈当成装饰,只在發布那一刻加一次,之後再也没有人维護。
- 一次性给新栏目堆上几百個連結,反而让每個連結分到的注意力變少。
- 把重要頁面藏在只有交互才能触發的路径里,日常浏览看不到,蜘蛛也很难走到。
- 頁面已经下线,入口連結還留着,蜘蛛反复去訪問一個不存在的地址。
小结
收錄的上游是 URL 發現,URL 發現的上游是連結结构。把新頁面接進首頁、栏目和已有内容组成的連結網絡里,让它在發布当天就有一條稳定、可跟随的入口,後面關于抓取和索引的排查才有意义。入口這件事不需要什么技巧,需要的是在發布流程里固定留出一步:新頁面上线时顺手確認一次,它到底有没有被鏈上。