在搜尋控制台里看到“已發現-尚未抓取”,或者服務器日誌里長時間没有對應蜘蛛的訪問记錄,很多人會直接把它当成收錄問题。更准确地说,這通常卡在URL 發現和抓取調度之間,离索引還有一段距离。先分清目前狀態,再决定要不要動頁面,能少走很多弯路。
先分清三種狀態,不要把問题混在一起
- 已發現,未抓取:搜尋引擎知道這個 URL 存在,但還没有安排蜘蛛来取内容。
- 抓取失敗:蜘蛛来過,但服務器返回了错誤、超时或被拦截,内容没有取到。
- 已抓取,未索引:内容已经取回,但系統判断暂时不值得進入索引。
這三者的排查方向完全不同。如果日誌里根本没有蜘蛛记錄,優先看“發現”和“抓取優先級”,而不是去改标题和正文。
入口信号是否有效
URL 被發現的途径主要有内鏈、sitemap、外部連結和手動提交。入口信号弱,頁面就可能一直停在“已發現”狀態。
- 内鏈是否来自可抓取、有稳定抓取频率的頁面,而不是孤立的深层頁。
- sitemap 中的 URL 是否可訪問、是否返回 200、是否和頁面實际地址一致。
- 外部連結是否来自被频繁抓取的站点,還是几乎没有抓取價值的頁面。
入口存在不等于入口有效。一個只被低质量頁面連結一次的 URL,被發現後等待很久才被抓取,並不罕见。
robots 层面的限制要單獨看
如果 robots.txt 禁止抓取某個目錄或參數,蜘蛛可能知道 URL 存在,但不會去取内容。此时搜尋控制台常顯示“已發現-尚未抓取”或類似的受限狀態。
注意:noindex 需要蜘蛛先抓到頁面才能生效;robots 禁止抓取則可能让頁面连内容都取不到。两者不要混用。
核對时重点看:robots.txt 是否有誤伤、是否阻止了 CSS/JS 等渲染资源、是否有针對特定參數的屏蔽規則。
抓取预算與站点整体優先級
搜尋引擎不會平均分配抓取资源。站点越大、低质 URL 越多,單個頁面的等待時間就越長。
- 站点是否存在大量參數组合、篩選頁、重复列表,稀释了抓取配額。
- 是否有大量返回 404、软 404 或重定向鏈的 URL,消耗蜘蛛時間。
- 重要頁面是否被放在較浅的点击距离,還是埋在多层面包屑之後。
抓取预算不是固定值,它會随站点质量、更新频率和服務器响應速度變化。先减少無效 URL 的暴露,比反复提交單個頁面更有效。
URL 质量與重复度也會影响調度
同一個内容對應多個地址,比如带參數、大小寫、斜杠、預設文件名不同,容易让調度系統降低對這類 URL 的抓取意愿。canonical 可以表達偏好,但不能替代入口收敛。
- 统一站内連結指向規范版本,不要多種寫法混用。
- 對無實际内容的篩選、排序、追踪參數,尽量用 robots 或連結規則控制。
- 確認頁面不是空壳、模板占比過高或信息增量极低。
建议的核對顺序
- 確認日誌里有没有蜘蛛訪問,排除“抓取失敗”和“已抓取未索引”。
- 检查内鏈和 sitemap 是否给出了有效入口。
- 核對 robots.txt,確認没有誤伤目标 URL 或渲染资源。
- 查看站点是否因大量低质、重复 URL 拉低了整体抓取效率。
- 收敛重复地址,统一内鏈和 canonical 指向。
- 观察一段時間,不要在同一天反复改 URL 或频繁提交。
“已發現”只說明 URL 進入了候選池,离抓取和收錄還有距离。先把入口、可抓取性和 URL 质量理顺,再耐心观察調度變化,通常比反复折腾頁面内容更接近問题本身。