網站收錄

内頁長期不進索引:從首頁点击深度與内鏈分布開始的核對顺序

新頁面長期停在“已發現,尚未抓取”,或者干脆没進索引,很多人先怀疑抓取频次。但更常见的原因是 URL 没有被有效發現:從首頁到目标頁要点击几次、連結是否可抓取、站点地图是否一致,都會影响發現效率。本文按從發現到抓取的實际路径,给出以入口深度和内鏈分布為起点的核對顺序。

網站收錄

内頁長期不進索引:從首頁点击深度與内鏈分布開始的核對顺序

站点上线一批新頁面,日誌里搜尋蜘蛛却很少走進這些地址,索引狀態長期停在“已發現,尚未抓取”,或者干脆没有出現。這时候不少人會先去調蜘蛛池、改抓取频次,但真正决定頁面能不能被發現的,往往是從已有頁面出發的連結路径。按下面的顺序核對,更容易找到卡住的位置。

先分清:是没被發現,還是被發現後没抓取

這两種情况的處理方向完全不同。打開索引狀態查询,看目标 URL 目前的覆盖狀態;再對照服務器日誌,看蜘蛛是否訪問過這個地址。

  • 日誌里完全没有记錄、索引工具里也查不到,說明 URL 還没有進入發現队列,重点在内鏈和站点地图;
  • 日誌里有訪問记錄,但狀態長期不更新,重点在抓取、渲染和頁面本身的质量判断。

把這一步做在前头,可以避免在错誤的方向上反复調整。

第一步:數一數從首頁到目标頁要几次点击

從首頁出發,顺着頁面上真正可点击的連結走到目标 URL,记錄中間经過的次數。层級越深,蜘蛛走到這里的概率越低。

  • 首頁直達的栏目頁、推荐位,通常最容易被發現;
  • 三級以内、每层都有稳定入口的頁面,一般在較短周期内能被抓到;
  • 需要四五次点击、中間某一层連結還经常變動的頁面,容易長期停留在未發現狀態。

如果目标頁确實處在很深的位置,優先考虑在相關栏目頁或聚合頁上补一條固定入口,而不是只依赖站点地图。

第二步:看内鏈是否真的通向它

頁面上出現了連結文字,不代表蜘蛛能顺着走過去。逐項检查:

  1. 連結是否用可抓取的 a 标簽和 href 书寫,而不是点击事件或按钮;
  2. 連結上有没有被加上 nofollow;
  3. 所在区块是不是由 JS 延迟渲染,原始响應里根本没有這個連結;
  4. 連結是否被折叠、藏在标簽頁里,需要交互之後才出現。

另外注意單個頁面上的連結數量。一個頁面挂着几百條連結,真正有價值的入口會被稀释;反過来,只有頁脚一條全站連結的頁面,指向作用也比較弱。

入口要有相關性

内容相關的頁面之間互相引用,比全站统一的頁脚連結更有意义。同一主题的文章彼此引用、列表頁里带位置的自然推荐,都是比較稳的入口形式。

第三步:新頁面自己是否提供了可被發現的地址

有些頁面本身没有任何對外連結,只在站点地图里出現過一次。站点地图能帮助發現,但它不是入口的替代品。需要核對:

  • 站点地图里的 URL 與實际地址是否完全一致,包括协议、域名、尾斜杠和參數;
  • 站点地图文件本身能否正常訪問,有没有被 robots.txt 屏蔽;
  • 新頁面發布後,相關列表頁和栏目頁是否同步更新了連結。

第四步:確認没有其他因素挡住發現

  • robots.txt 里是否誤屏蔽了目錄;
  • 頁面是否返回 3xx 或 4xx,連結存在但跟随失敗;
  • 整站入口是否只靠 JS 渲染,原始响應里几乎没有連結;
  • 頁面是否被其他規則临时下线。

常见的誤区

把收錄問题全部归结為蜘蛛池或抓取频次,改善往往有限。抓取频次只是结果的一部分,前提是 URL 已经進入可發現的路径,並且連結能被正常跟随。

另一個誤区是短期反复提交同一個地址。重复提交不會加快索引,反而让日誌里出現大量相同請求。真正需要做的是补齐入口、修好連結,然後留出观察周期。

核對顺序小结

  1. 用日誌和索引狀態分清是未發現還是未抓取;
  2. 從首頁數点击深度;
  3. 检查内鏈是否可抓取、是否有 nofollow、是否依赖 JS;
  4. 检查站点地图地址與實际地址是否一致;
  5. 检查 robots.txt、狀態碼與渲染方式;
  6. 补齐相關頁面入口,隔一段時間再看日誌變化。

頁面被收錄的前提是被發現並且被抓取,而發現主要依靠連結。把入口理顺之後,再去看抓取频次和索引狀態的變化,判断會清晰很多。