站点上线一批新頁面,日誌里搜尋蜘蛛却很少走進這些地址,索引狀態長期停在“已發現,尚未抓取”,或者干脆没有出現。這时候不少人會先去調蜘蛛池、改抓取频次,但真正决定頁面能不能被發現的,往往是從已有頁面出發的連結路径。按下面的顺序核對,更容易找到卡住的位置。
先分清:是没被發現,還是被發現後没抓取
這两種情况的處理方向完全不同。打開索引狀態查询,看目标 URL 目前的覆盖狀態;再對照服務器日誌,看蜘蛛是否訪問過這個地址。
- 日誌里完全没有记錄、索引工具里也查不到,說明 URL 還没有進入發現队列,重点在内鏈和站点地图;
- 日誌里有訪問记錄,但狀態長期不更新,重点在抓取、渲染和頁面本身的质量判断。
把這一步做在前头,可以避免在错誤的方向上反复調整。
第一步:數一數從首頁到目标頁要几次点击
從首頁出發,顺着頁面上真正可点击的連結走到目标 URL,记錄中間经過的次數。层級越深,蜘蛛走到這里的概率越低。
- 首頁直達的栏目頁、推荐位,通常最容易被發現;
- 三級以内、每层都有稳定入口的頁面,一般在較短周期内能被抓到;
- 需要四五次点击、中間某一层連結還经常變動的頁面,容易長期停留在未發現狀態。
如果目标頁确實處在很深的位置,優先考虑在相關栏目頁或聚合頁上补一條固定入口,而不是只依赖站点地图。
第二步:看内鏈是否真的通向它
頁面上出現了連結文字,不代表蜘蛛能顺着走過去。逐項检查:
- 連結是否用可抓取的 a 标簽和 href 书寫,而不是点击事件或按钮;
- 連結上有没有被加上 nofollow;
- 所在区块是不是由 JS 延迟渲染,原始响應里根本没有這個連結;
- 連結是否被折叠、藏在标簽頁里,需要交互之後才出現。
另外注意單個頁面上的連結數量。一個頁面挂着几百條連結,真正有價值的入口會被稀释;反過来,只有頁脚一條全站連結的頁面,指向作用也比較弱。
入口要有相關性
内容相關的頁面之間互相引用,比全站统一的頁脚連結更有意义。同一主题的文章彼此引用、列表頁里带位置的自然推荐,都是比較稳的入口形式。
第三步:新頁面自己是否提供了可被發現的地址
有些頁面本身没有任何對外連結,只在站点地图里出現過一次。站点地图能帮助發現,但它不是入口的替代品。需要核對:
- 站点地图里的 URL 與實际地址是否完全一致,包括协议、域名、尾斜杠和參數;
- 站点地图文件本身能否正常訪問,有没有被 robots.txt 屏蔽;
- 新頁面發布後,相關列表頁和栏目頁是否同步更新了連結。
第四步:確認没有其他因素挡住發現
- robots.txt 里是否誤屏蔽了目錄;
- 頁面是否返回 3xx 或 4xx,連結存在但跟随失敗;
- 整站入口是否只靠 JS 渲染,原始响應里几乎没有連結;
- 頁面是否被其他規則临时下线。
常见的誤区
把收錄問题全部归结為蜘蛛池或抓取频次,改善往往有限。抓取频次只是结果的一部分,前提是 URL 已经進入可發現的路径,並且連結能被正常跟随。
另一個誤区是短期反复提交同一個地址。重复提交不會加快索引,反而让日誌里出現大量相同請求。真正需要做的是补齐入口、修好連結,然後留出观察周期。
核對顺序小结
- 用日誌和索引狀態分清是未發現還是未抓取;
- 從首頁數点击深度;
- 检查内鏈是否可抓取、是否有 nofollow、是否依赖 JS;
- 检查站点地图地址與實际地址是否一致;
- 检查 robots.txt、狀態碼與渲染方式;
- 补齐相關頁面入口,隔一段時間再看日誌變化。
頁面被收錄的前提是被發現並且被抓取,而發現主要依靠連結。把入口理顺之後,再去看抓取频次和索引狀態的變化,判断會清晰很多。