新頁面上线,最常听到的一句话是「怎么還没被收錄」。但在收錄之前,還有一個更早的环节:蜘蛛得先知道這個 URL 存在。發現和抓取是两步,中間還隔着一次排队。
URL 發現與首次抓取,是两件不同的事
發現指的是蜘蛛在某個地方看到了一條指向新地址的連結;抓取指的是它真正發出請求、把頁面内容拿回来。前者只是把你的 URL 放進候選队列,後者才轮到抓取調度决定什么时候来、以多高的频率来。
所以會出現這样的情况:URL 已经在日誌里出現過一次,之後再没動静;也有頁面几個月没被抓,某天突然被訪問。這中間差的往往不是「提交了没有」,而是這條 URL 在站内外的位置、站点整体的抓取节奏,以及服務器当时的响應狀態。
蜘蛛發現新 URL 的常见入口
站内連結:最直接,也最可控
從已有頁面指向新頁面的普通連結,是發現效率最高的入口之一。前提是這些連結出現在蜘蛛本来就會訪問的頁面上,比如首頁、栏目頁、上一級頁面。如果新頁面只被一個同样没人抓的頁面連結,那么它被發現的時間就會被拖長。
Sitemap:批量告知,但不等于立刻来
Sitemap 的作用是把一批 URL 集中摆出来,适合新頁面成批上线、或者站内連結不容易覆盖到的地址。它是「告知」,不是「召唤」。提交之後,蜘蛛仍會按自己的节奏處理,尤其是站点整体抓取频率不高的时候。
外部連結:把蜘蛛從別處带過来
来自其他站点的連結,會让蜘蛛在抓取對方頁面时顺便看到你的新地址。這里要注意的是,外鏈的價值在于「被真實抓取並解析」,而不是數量堆叠。短時間内凭空出現大量指向同一地址的連結,容易让這條 URL 顯得異常。
發現之後,為什么還要等
- 抓取队列的優先級:蜘蛛對首頁、栏目頁這類高频更新頁面的回訪更勤,對深层頁面會放到更後面。
- 站点的整体抓取节奏:一個長期稳定更新、响應正常的站点,通常比一個时快时慢、经常返回 5xx 的站点更容易被稳定回訪。
- 頁面自身的位置:点击距离越遠、入口越少的 URL,越容易被排在後面。
- URL 本身的形態:带長參數、會话 ID 的地址,可能被当作重复或低價值入口處理。
新頁面發布时,可以顺手做的事
- 在上級栏目頁或相關頁面上加一條正常的正文連結,而不是只在導航或頁脚堆連結。
- Sitemap 里补上這條 URL,更新對應的時間字段,让它和真實更新時間一致。
- 確認頁面能直接返回 200,不要用跳轉把新地址绕到舊地址。
- 避免同一批上线几百個内容相似的頁面,那容易稀释蜘蛛對其中每一頁的注意力。
- 發布後留意服務器日誌里這條 URL 的第一次請求,看它拿到的狀態碼和响應時間。
怎么判断蜘蛛真的来了
最直接的办法還是看服務器日誌:按 URL 過滤,看訪問時間、返回狀態、請求头和 User-Agent。如果日誌里長期只有你自己的訪問记錄,說明這條 URL 還没進入抓取队列,可以先回過头检查入口連結和 Sitemap 是否生效。如果日誌里已经有請求,但狀態碼是 5xx 或频繁超时,問题就不在發現环节,而在服務器稳定性上。
發現 URL 是入口問题,抓取 URL 是調度問题,抓取成功與否是服務器問题。三层分開看,排查起来會清楚很多。
把這三层分清楚,新頁面上线後就不用只盯着「收錄没收錄」一個结果,而是能判断它卡在哪一步。