先分清三步:發現、抓取、索引
新頁面從發布到出現在搜尋结果里,走的是三個相對獨立的环节。URL 發現是蜘蛛知道有這個地址;抓取是蜘蛛真的来取了一次 HTML;索引是内容進入索引库,並通過了质量與重复判断。這三步任何一步卡住,頁面都不會出現在搜尋结果中,而它們的排查方法完全不同。
- 發現:内鏈、導航、sitemap、外鏈、站長工具提交,都是蜘蛛获取 URL 的入口。
- 抓取:受服務器响應速度、robots.txt、抓取预算、返回碼影响。
- 索引:受内容质量、重复度、canonical、noindex 指令影响。
提交 sitemap 只解决發現這一步,它不代表蜘蛛會優先抓取,也不代表頁面會被索引。
一條大致的時間线
不同站点差异很大,但可以先建立一個粗糙的參照,用来判断是正常延迟還是真有問题。
- 几小时到 1 天:更新频繁、层級較浅的栏目下的新頁面,可能当天就被抓取。
- 3 到 7 天:多數站点的常規新頁面,被發現並抓取属于正常范围。
- 2 到 4 周:新站、新目錄、缺少内鏈入口的頁面,抓取和索引都可能拖到這個量級。
- 超過 1 個月仍未抓取:通常不是慢,而是發現或抓取环节被挡住了。
要留意的是,抓取和索引之間存在明顯滞後。蜘蛛来過、返回 200,也常见几天甚至几周後才進索引。
三個卡点,分別怎么判断
卡在發現
頁面是孤儿頁,或者只有首頁上一處临时連結,連結很快被新内容顶掉。sitemap 没有更新、導航依赖客戶端渲染,也會让蜘蛛拿不到地址。
卡在抓取
服務器响應過慢、間歇性 5xx、连接被重置,都會让蜘蛛降低抓取频率。robots.txt 誤挡、大量參數頁消耗抓取预算,也會让新頁面排在後面。
卡在索引
内容過薄、與站内已有頁面高度相似、模板重复、canonical 指向了別處、頁面带了 noindex,都會让頁面抓取成功却不進索引。
自己驗證卡在哪一步
- 查服務器日誌,確認蜘蛛是否訪問過该 URL;没有记錄,問题多半在發現环节。
- 看返回碼是否稳定為 200,以及是否存在超时或 5xx。
- 检查渲染後的 HTML 里正文是否真的存在,而不是只靠前端脚本拼接。
- 核對 noindex、canonical、robots.txt 之間是否有冲突指令。
- 找同模板下已被收錄的頁面做對比,看差异在内容還是連結入口。
可以做的几件小事
- 给新頁面一個稳定、長期存在的内鏈入口,而不是只挂在列表第一屏。
- 及时更新 sitemap 並在站長工具提交,不必反复提交同一批 URL。
- 同一内容只保留一個規范版本,參數、大小寫、尾斜杠统一到一個 URL。
- 让正文核心内容在服務端就能輸出,减少對渲染的依赖。
- 避免一次性批量上线大量同质頁面,這會把抓取预算摊薄。
预期放平一点
新頁面一天没收錄就反复修改标题、URL 和 canonical,往往让狀態更混乱。建议以周為观察窗口,先確認卡在發現、抓取還是索引,再针對性處理。收錄是结果,不是靠提交動作就能換来的開關。